先看开源圈,Dify搞了个协作工作空间。建智能体工作流、弄RAG管道都挺方便,云端、VPC或者自托管随意选。团队从弄原型到正式上线,基本不用重写代码。另一边,awesome-llm-apps更直接,一口气甩出100多个开源应用。拿来就能跑,全免费。说白了,现在的开源生态已经把智能体开发的门槛踩到地板上了。
科研这块也没躲过智能体的冲击。OmniScientist是个全模态、全学科的AI科学家。它能把假设生成、跑代码再到写论文这一整套流程全包了。以前几个人耗几个月的活儿,现在一个智能体可能几天就搞定。实际上,基础模型能力溢出,科研自动化早就不只是个概念了,大家都在往现实里推。
智能体到底好不好用,还得看评测。美团图灵团队最近搞了个四层评测框架,分了结果、过程、效率、风险这几块。他们用二元化Rubric一测,人机一致率直接从62%飙到了92%。实际上,没靠谱的评测兜底,智能体就是个黑箱,落地根本无从谈起。这四层指标算是把能力和安全全包圆了。
hermes-agent选了条不同的路,主打陪你成长。它不再是个定死的工具,用得越多越聪明。开源平台、科研自动化、评测体系,再加上个性化成长,AI智能体的版图补得飞快。2025年估计才是这帮东西真从demo走向规模落地的关键一年。