AI工具

AI写代码到底行不行?从爆款工具到学术突破的冷思考

AI编程圈最近有点精神分裂。一边是GitHub上动辄几十万Star的爆款工具,Hacker News上天天有人吹新的coding agent;另一边,有人直接开喷:说好的AI能写代码,那些垃圾软件去哪了?

这问题问得挺狠。嘴上吹得天花乱坠,实际产出却对不上号,这事儿确实值得掰扯掰扯。我把最近的热门项目和论文翻了一圈,发现AI编程这潭水比表面看起来深多了——工具确实在进步,但离"替代程序员"还差着十万八千里。

爆款工具扎堆,赛道挤得快没位置了

先看工具层面。GitHub上有个叫superpowers的项目,拿了27万Star,号称"agentic skills framework"。说白了就是一套基于AI agent的软件开发方法论,不光是帮你补全代码,而是想把整个开发生命周期——从头脑风暴到编码到测试——全塞进agent的管辖范围。这项目用Shell写的,主推subagent-driven development,就是让一堆子agent分工协作,跟流水线似的一起干活。

老牌选手n8n也没闲着,20万Star的战绩摆在那里。它本来是个工作流自动化平台,现在加了原生AI能力,支持MCP协议,四百多个集成。用可视化拖拽加自定义代码,就能把AI agent嵌到各种自动化流程里。这种low-code加AI的玩法,拉低了门槛,不懂代码的人也能搭出带智能的工作流。

Hacker News上热度更高的还有个叫OpenCode的,开源的AI coding agent,帖子拿了1274分、618条评论。讨论区吵得挺热闹,大家关心的核心问题就一个:这货到底能不能独立干活?

我观察下来,这些工具有个共同趋势——都在从"代码补全"往"代码生成"甚至"任务完成"的方向使劲。以前Copilot是帮你写几行,现在这些agent是想帮你写整个模块、跑测试、修bug。野心确实大了不少,但能力跟不跟得上,后面细说。

学术界也没闲着:从Agent框架到全能AI科学家

工业界热闹,学术界同样在卷。arXiv上最近有两篇论文,挺值得聊的。

第一篇叫AutoDesign,研究的是长周期agent任务的设计优化问题。长周期任务是啥?就是那种需要多步骤、多轮迭代的复杂活儿,比如把多模态数据源转化成结构化的媒体输出。现有的agent框架大多是静态的,走一步算一步,不会自己改进。AutoDesign想干的事,是让agent系统自己攒经验、递归地优化执行框架,他们管这叫meta-harness optimization。说白了,就是让agent学会怎么更好地当agent。

第二篇是OmniScientist,更激进。想做全模态、全学科的AI科学家,从假设生成、代码执行一路干到论文撰写。但论文里自己也承认了一个致命问题:现在的AI系统基本只能处理文本、代码和标签,那些科学发现真正依赖的空间关系、时间序列、跨通道信息,agent根本摸不着。这不是小毛病,是根本性的能力缺失。

这两篇论文放一块看,学术界的思路和工业界不太一样。工业界急着把东西推向市场,先能用再说;学术界在追问更底层的东西——agent的推理框架怎么设计,多模态信息怎么真正利用。两条线各跑各的,但早晚要汇合。

代码垃圾去哪了?没人正面回答的问题

回到那个最扎心的问题。Hacker News上那篇"Where's the shovelware?"的帖子拿了770分,482条评论,热度不低。提问者的逻辑很直白:如果AI真能高效生成代码,市面上应该早被AI做的软件淹没了才对。可现实是,你很难找到明确的、由AI主导开发并成功上架的软件产品。

这个质疑确实站得住脚。我们天天看到demo炫酷得不行,视频里agent几秒钟就生成了一个完整应用。但demo和产品中间的那道鸿沟,大得能装下整个太平洋。生成一个能跑的prototype不难,难的是处理边界条件、维护代码质量、对接真实业务逻辑、做长期迭代。这些事,现在的AI agent还搞不定。

代码生成能力的提升速度确实是快,但软件工程从来不只是写代码。理解需求、架构设计、调试排错、团队协作,AI目前只解决了最浅层那一环。

我认为这个问题的答案其实不难想。AI生成的代码确实存在,但大多以碎片形式散落在各处——某个函数、某段逻辑、某个测试用例。它们被嵌在人类主导的开发流程里,你很难单独拎出来说"这玩意儿是AI写的软件"。完整的、端到端由AI开发的商业软件,目前确实几乎没有。不是技术完全做不到,而是质量把控、需求理解、工程管理这些环节,AI还差着好几个身位。

冷思考:别被Star数和demo骗了

把上面的信息拼起来,我的判断是这样:

  • AI编程工具的实用价值是真的,但主要停留在"辅助"层面——帮你写样板代码、生成测试、补全逻辑。当生产力放大器没问题,当替代品就过了。
  • Agent框架的学术进展值得盯一盯,AutoDesign这类研究在解决"agent怎么自我优化"的问题,方向是对的,但离落地还早得很。
  • 全模态AI科学家的愿景很美,但OmniScientist自己都承认了关键能力缺失,短期别指望它做真正的科研。
  • 工具的热度和实际生产力是两码事。superpowers拿了27万Star,不代表它已经改变了软件开发的方式。热度反映的是期待,不是现实。

真正值得关注的是什么?是那些用AI工具切实提升了开发效率的团队的真实反馈,是具体场景下能拿到的具体收益。GitHub上的Star数,Hacker News上的讨论热度,看看就好。

AI编程这个赛道,现在处于典型的"期望膨胀期"。工具在变好,这话没错;但距离人们吹的那个水平,中间还隔着好几个技术迭代周期。与其天天追新项目,不如想明白自己手头的活儿,哪些环节扔给AI合适,哪些必须自己上。这个判断力,比你会用哪个工具重要得多。