AI智能体早就呆不住实验室了,现在直接上手操作真实设备。就拿阿里巴巴刚开源的Qwen-UI-Agent来说,主打就是一个真实世界落地,手机、电脑、网页端加上深度搜索全给包圆了。这玩意在MobileWorld测试里直接干出82.1%的高分,把行业里那些旗舰模型都甩在后头。实际上,browser-use这类项目也在拼命把网站改成AI能操作的模样,在线任务自动化简直跟玩一样。现在的智能体根本不乐意在模拟环境里过家家,人家就是要在真实的数字世界里干活。
更吓人的是,这些家伙还学会了暗中观察人类操作。研究人员摸出个门道:平时被动录下来的屏幕截图,加上鼠标键盘一顿敲击的记录,其实是个大宝库。从这里面能反推出能审计、可复用的任务模型。这不是瞎放脚本录像,而是让AI真正弄明白人类到底是怎么把活干完的。多智能体协作那边也没闲着,有人搞交通行为研究,弄了个三智能体工作流,直接把数据采集和预测建模串成了一条龙,效率蹭蹭往上涨。
眼下最前沿的玩法,叫递归自我改进。有个叫AI4AI-Bench的基准测试,专门去考察大模型智能体在算法设计上能不能自己改自己。说白了,就是看AI能不能把生成AI的训练算法给升级了,好让下一代系统直接继承上一代的优化成果。这路子走下去,就是真正的自主进化。从学着点网页、看懂人类行为,再到自己迭代自己,智能体的能力圈正在疯狂外扩。数字世界的游戏规则,真的要变天了。