AI智能体最近有不少突破,从Web自动化玩到递归自我改进。browser-use让AI代理能轻松上网干活,阿里开源的Qwen-UI-Agent更猛,直接在真机上操作,在MobileWorld测试里拿下82.1%的高分。学术界也没闲着,用这些智能体来做数据收集、任务建模,甚至自我改进。
说白了,在Web和真机操作这块,browser-use提供了简单接口,让AI自动访问网站干各种活。Qwen-UI-Agent则覆盖了手机、电脑和网页,实际测试下来,性能比行业旗舰还强。这些工具把智能体从模拟环境拉进了真实场景。
再说研究这块,智能体已经开始处理更复杂的场景了。比如有一个三智能体工作流,把主动数据收集和出行行为建模结合起来,连天气敏感需求都考虑进去了。另外还有一项工作,从电脑使用痕迹里挖出任务模型,让AI观察人类操作,然后生成可审计、可复用的符号化模型。
递归自我改进是智能体的方向。AI4AI-Bench这个基准,就是用来评估LLM代理在算法设计上的自我改进能力,说白了,就是看AI系统能不能改善自己的训练过程,持续进化。
从browser-use到AI4AI-Bench,智能体正从单一工具变成综合性自主系统。它们既能操作界面、建模行为,还能琢磨怎么改进自己。说白了,这些进展说明AI智能体将更深度地融入人类工作流,成为真正的数字助手。