AI技术

AI智能体进化:从浏览器自动化到真机操控

智能体现在算是彻底站上AI舞台的C位了。它们的手越伸越长,不管是网页还是手机屏幕,简单或者复杂的决策都想插一手。开源圈子的嗅觉向来敏锐,GitHub上的browser-use直接喊出"让网站对AI代理开放"的口号。说白了,就是把浏览器硬生生变成一个可编程的执行场,以后那些繁琐的在线操作全交给机器去跑。这路子看着挺糙,但真管用。智能体在真实的网页上点来点去,硬是把任务流水线给跑顺了。

学术界琢磨的东西更深:智能体能不能自己学会干活,还能不能自己评价干得好不好?arXiv上最近的三篇论文透出了点风声。有一篇搞了个三智能体工作流,把主动采数据、出行建模和看天吃饭的需求预测串在一块,治的是数据收集和预测模型老死不相往来的旧病。另一篇的切入点很妙,拿被动录下的截图、鼠标和键盘动作当素材,硬是倒推出一个符号化的任务模型,这样一来整个流程就能查账、能复用。还有一篇甩出了AI4AI-Bench基准,专测大模型在算法设计上的递归自改进能力。实际上,这就是在拷问AI能不能优化它自己生成答案的流程。

搞产业的人当然没闲着。阿里最近把Qwen-UI-Agent给开源了,这是个以真实世界为中心的GUI智能体基座模型,管着移动端、电脑端、网页端,还带个深度搜索。它图的就是打破模拟器测试的天花板,直接去啃那些真实又没法复刻的设备环境。在MobileWorld移动端测试里,这模型拿了82.1%的高分,把几个主流同行都甩在后头。

你仔细看会发现这种分工挺有意思的。开源工具负责把手伸进浏览器里头搅和,研究论文负责搞定怎么建模、怎么打分,工业模型则直接在真机上压注。智能体赛道下一轮拼什么?肉眼可见的卖点就是"在真实世界里谁更能打"。料都备齐了,接下来就看谁下手狠了。