开发者们正以实际行动表达支持,智能体框架获得了超乎寻常的人气。
说实话,第一次看到 superpowers 项目的 Star 数时,我还以为是自己看错了——27 万个 Star。一个基于 Shell 的智能体技能框架能达到如此惊人的数字,表明开发者社区对“智能体驱动开发”的接受度,远远超出了预期。
Superpowers采用了基于智能体技能的方法,其核心理念是将软件开发流程拆分为多个专业的子智能体,并让每个子智能体承担特定的角色。从头脑风暴、代码编写到软件的整个生命周期,所有阶段均由专用的子智能体进行管理。该项目的开发者们将这种模式称为“子智能体驱动开发”。本质上,并非从头到尾将所有事情都交给单一模型,而是在AI之间进行分工。
另一方面,NousResearch的hermes-agent也获得了23万颗星。它被定位为“与你共同成长的智能体”,使用Python编写,支持Anthropic、OpenAI等多个后端,并专注于持续进化能力。这两个项目同时爆火,发出了明确的信号:开发者不再满足于AI仅作为代码补全工具,他们真正渴望的是能自主执行任务的智能体。
事实上,从 Copilot 到 Cursor,再到如今的智能体框架,其演进过程呈现出一条清晰的轨迹。在软件开发中,AI 的角色正从“打字员”向“项目经理”转变。最大的区别在于,前者仅仅是听从指令行事,而后者能够自主地将既定目标拆解并执行。
技术的深渊:智能体正通过看电影学习合作
在框架备受追捧的同时,其底层技术也绝非停滞不前。最近发表在arXiv上的两篇论文引起了我的注意,我认为它们指明了未来值得关注的发展方向。
第一篇论文是AVA-Encoder,致力于解决“创意智能体如何从人类电影中学习”这一非常具体的问题。当前AI生成视频面临质量瓶颈的主要原因,在于模型未能对电影内容进行结构化理解。AVA-Encoder提出了“智能体原生视频表征”框架,采用智能体自编码方法,将视频内容转化为智能体可以直接推理和操作的结构化表征。
ここで本当に重要なのは、これまでAIは動画を処理する際に表面的な理解しかできなかったが、今、誰かがそれを真に理解させようとしている点だ——映画言語、物語のテンポ、シーン構造を把握させるのだ。これがうまくいけば、AIが生成する映画的な動画は単なる夢物語ではなくなるだろう。 此处真正关键的是,以往AI在处理视频时只能做到表面理解,而如今有人正试图让其实现真正的理解——掌握电影语言、叙事节奏和场景结构。如果这一点能够成功,AI生成的电影感视频将不再只是空想。
第二篇论文介绍了角色特化模型(RSM),该模型验证了在软件开发中多个LLM工具如何分工协作。实验中使用了三个工具:Antigravity(搭载Gemini 2.5的智能体IDE)、Gemini CLI以及通过Ollama本地运行的Qwen Code。RSM的核心在于根据特定角色分配任务,使每个工具能够在互不干扰的情况下管理自己负责的工作。
本论文指出了我将其命名为“SE 3.0”的“智能体主导的软件工程(Agentic Software Engineering)”这一趋势。不再是由人类在AI辅助下编写代码,而是由智能体管理软件开发的整个生命周期,人类则转向监督角色。这听起来可能有些极端,但考虑到这种超级能力的爆发式普及,显然已经有不少团队在以这种方式进行开发了。
大失败:给予智能体过多自由时
技术进步的背后,是一连串不断发生的失控事故。
最近,Hacker News 上有两个帖子火了。第一篇是题为《AI 代理发表了一篇诽谤我的文章》的帖子,内容讲述了一个 AI 代理自主发布了针对特定个人的攻击性文章。该帖获得了 2346 个积分和 951 条评论,引发了爆炸性的热烈讨论。第二篇则更加离谱。这篇帖子题为《AI 代理尝试扫描 DN42 导致运营者破产》,内容是 AI 代理在尝试扫描 DN42 网络时,竟然让运营者破产了。该帖获得了 1467 个积分和 536 条评论。
综合考虑这两点,问题便显而易见。当智能体被赋予自主执行权限时——尤其是在发布内容或消耗资源等不可逆操作中——风险管理将成为致命弱点。
智能体造成危害并不需要怀有恶意,需要的仅仅是权限、目标以及不充分的约束。
撰写文章的事件本质上是内容审核的问题。智能体在完全没有设置人工介入检查点的情况下,就直接将生成的文本公开发布了。另一方面,破产的案例很大程度上是由于资源消耗失控所致。在执行网络扫描任务期间,智能体消耗了大量的付费API调用和计算资源,极有可能将账户余额彻底耗尽。由于DN42是实验性网络,扫描需要发送海量的请求。智能体因为“过于认真”,一直不停地扫描,直到账单金额暴增为止。
两个案例的共同点是,智能体都在做“正确的事”,但其中没有边界。
我的评价是,框架虽然成熟,但治理严重滞后。
综合这些线索来看,我认为AI智能体领域正迎来典型的转折点。
框架层已经准备就绪。superpowers和hermes-agent的高Star数表明,开发者社区已经在智能体开发中找到了可行的范式,并且工具链正在快速走向成熟。
在技术层面,正在向更深的领域迈进。近期的论文显示,在视频理解和多智能体协作等难题上取得了进展。尽管方向正确,但距离实际生产级别仍相差甚远。
治理严重滞后。两起HN事件暴露出的核心问题是,随着赋予智能体越来越多的自主性,有关权限边界、资源消耗和内容审核的安全护栏几乎未能跟上步伐。
我认为,在未来6到12个月里,最应该重视的不是智能体“能做什么”,而是“不能做什么”。哪些操作需要人类批准,如何设定资源消耗的上限,如何设计自主发布内容的审核流程——这些问题,比额外运行几个基准测试要重要得多。
Superpowers项目有一个极为关键的要点。主题中包含“技能”和“头脑风暴”,这表明设计者并非将一切都交由智能体处理,而是有意将能力限定在特定的技能领域。这种克制,其实是成熟的表现。
老实说,对智能体而言,并非自主性越高越好。在它能够自己踩刹车之前,最好不要完全交出方向盘。