现在搞AI智能体开发,门槛基本被开源生态踩在脚底下了。Dify这种平台挺狠,把智能体工作流、RAG管线还有一堆模型工具,全糊进一个工作区里。云端本地随便部署,原型到生产一条龙搞定。懒得从头敲代码也没事。awesome-llm-apps那个项目里直接扔了100多个开源应用,拿来就能跑。还有个叫hermes-agent的也挺有意思,主打“陪跑成长”,智能体能在交互里自己慢慢进化。工具链都卷成这样了,说白了,造个智能体现在就跟拼乐高似的。
家伙事儿备齐了,智能体就开始啃硬骨头了。arXiv上新发的那个OmniScientist,直接叫板真人研究员。这玩意儿是个全模态全学科的AI科学家。提假设、写代码跑实验,最后连论文排版都给你弄得明明白白。实际上,这种端到端的科研自动化已经说明问题了。AI智能体早不是只会陪人聊天的玩具,它是能直接掀翻复杂脑力劳动工作流的生产力怪兽。
本事越大,怎么打分反倒成了让人头疼的麻烦事。美团技术团队最近分享了点实战心得。他们觉得搞Agent评测,必须死盯四个地方:结果、过程、效率和风险。为此他们还弄了个二元化Rubric评分标准。效果很顶,硬生生把人机评分一致率从62%拽到了92%。说白了,真想把智能体塞进业务线里赚钱,没一套靠谱的评测体系兜底,早晚得翻车。