现在搞AI智能体开发真的没那么难了。拿Dify这种一站式平台来说,RAG和智能体工作流直接打包给你,团队从搞原型到正式上线基本不用重写代码。开源社区玩得更野,awesome-llm-apps项目一口气甩出100多个免费应用,拿来就能直接跑。
实际上,现在的智能体早就跨过了“陪聊机器人”的阶段。前阵子arXiv上挂出的OmniScientist就是个典型,这玩意简直是个全能AI科学家。从提假设、跑代码到最后憋出论文,整套科研流程全自动。说白了,这跨度直接把自动化办公拔高到了自动化科研的级别。
能力越强,评测就越让人头疼。美团技术团队最近聊了聊他们的心得:想测智能体,得死盯结果、过程、效率和风险这四个维度。他们搞了个二元化Rubric评分表,硬生生把人机评分一致率从62%拉到了92%。别说,这招确实管用。
技术落地总免不了有些意外操作。最近美国有一帮学生,直接拿AI智能体代上整门网络课程。这可好,从代写作业一路进化成了“代上课”。网课本来盯人就费劲,这下防作弊更是雪上加霜。兜兜转转一圈,线下考试和口头展示的威慑力又回来了。
开源工具把开发门槛踩低了,全能型Agent也把能力边界撑得越来越宽。各行各业的生产力都在被重新洗牌,但眼下的当务之急是怎么评、怎么管。技术跑得太快,规矩和评测要是掉队,这神器分分钟就能翻车变成潘多拉魔盒。