AI技术

AI智能体狂飙:搞定网页自动化,还能当全栈科学家

AI智能体正快马加鞭地接管我们的线上任务。说白了,像browser-use这类开源项目,直接把网站的门对AI敞开了。以前那些繁琐的网页自动化操作,现在一句话就能搞定。还有个叫hermes-agent的智能体也挺有意思,主打“陪你一起长大”,能在日常交互中不断摸透你的脾气和习惯。有了这些家伙,AI总算从只会陪聊的玩具,变成了真正能干活的数字牛马。

不过,简单的网页操作只是开胃菜,现在这帮AI连硬核科研都能拿下。实际上,像OmniScientist这种全模态全学科AI科学家,提假设、写代码跑数据,最后连论文都能自己码完,一套全活儿。遇到那种耗时极长的复杂设计任务呢?AutoDesign能通过优化模型框架的元系统,把乱七八糟的多模态信息直接变成结构化产出。你看,智能体早就不是那种按一下才动一下的死板工具了,它们正在变成能独立思考的“数字科学家”。

本事越来越大,怎么给它们打分反倒成了麻烦事。美团技术团队最近抛出了个解法:测AI,结果、过程、效率、风险这四个维度缺一不可。他们还弄了个二元化Rubric打分机制,一顿操作猛如虎,直接把人机评估的一致率从62%干到了92%。有了这套标准,企业就能摸清AI的底细,判断到底能不能用。省得智能体干活干到一半,直接跑偏了。

从搞定网页操作到当全能科学家,再到搞出标准化的评测体系,AI智能体的版图算是拼齐了。家伙事儿越来越硬,考核标准也越来越细,落地变现自然就顺理成章。接下来,就看谁跑得快,能率先把这些技术塞进真实的业务场景里,把生产力真正给榨出来了。