AI智能体狂飙:从偷懒哲学到售货机碾压实战
AI技术

AI智能体狂飙:从偷懒哲学到售货机碾压实战

AI智能体的开发哲学正在变得"反直觉"。GitHub上有个叫ponytail的项目,直接让AI代理像"最懒的资深程序员"那样思考——最好的代码就是你压根没写的代码。少即是多,能不写就不写,这种偷懒哲学反而逼出了更高效的解决方案。

但怎么衡量这些智能体到底行不行?Embodied-BenchForge提出了一个闭环式工作流,专门用来自动化构建具身智能基准测试。以前的方法要么只覆盖孤立阶段,要么被锁死在预设环境里,这个新框架试图打通全流程,让评估更接近真实场景。

真实场景的表现确实吓人。Andon Labs的Vending-Bench2测试中,GPT-6 Astra拿500美元模拟经营自动售货机一整年,平均余额冲到15515美元。最差一轮的成绩都超过Claude Fable 5.1的最好成绩,碾压近3倍,首次登顶。优势主要在供应链管理和规则执行上——它不仅能想,还能稳稳落地。

从"懒得写代码"的设计哲学,到标准化的基准构建,再到售货机模拟中的碾压级表现,智能体正在从概念走向实战。能偷懒的思路、能衡量的标准、能赚钱的结果,三条线正在汇成一股洪流。