智能体生态正在快速膨胀。Dify提供一站式协作工作台,支持构建Agentic工作流和RAG流水线,团队能从原型直接跑到生产环境,部署方式覆盖云端、VPC和自托管。另一边,awesome-llm-apps开源项目一口气放出100多个AI智能体、Agent技能和RAG应用,全部免费可用,开发者拿来即用。
智能体的能力边界也在拓宽。arXiv上新发的OmniScientist项目瞄准科研全流程,从假设生成、代码执行到论文撰写,基础模型让AI科学家能自动化越来越完整的研究工作流。这不再是辅助工具,而是端到端的科研伙伴。
能力上去了,评测得跟上。美团技术团队发布的Agent评测框架覆盖四个维度:结果层、过程层、效率层、风险层。他们用二元化Rubric把人机一致率从62%拉到92%,说明评测方法本身也在进化,粗糙打分已经不够用了。
还有hermes-agent打出的概念——"与你共同成长的智能体"。从工具到科学家再到评测体系,智能体赛道已经不缺玩家,接下来拼的是谁能真正落地、持续进化。