AI大模型

AI不拼参数拼后训练,大模型落地进入深水区

智谱刚给行业提了个醒。GLM-5.3发布了,参数量没动,还是7400亿,但人家靠后训练硬是把性能拔高了50%,写代码的水平直逼Claude Fable 5。这释放了一个明确信号:大模型不卷参数了,开始练内功。蚂蚁百灵拉着AReno搞本地智能体强化学习,也是这路子。实际上,本地部署不代表就能干活,模型得真懂规矩、守底线、会抡工具。说白了,光靠参数"虚胖"早没戏了,后训练才是决定能不能落地的生死线。

应用端这块更热闹。金山办公灵犀接了DeepSeek-V4正式版,百万token上下文,直接去啃复杂的办公场景。百度GenFlow改名"库库AI"单飞了,月活破亿。京东七鲜在北京搞了个24小时无人咖啡店,机器人现做,AI给你推荐喝啥。这些可不是PPT画大饼,是真刀真枪跑在业务里的。连高盛都发话了,说AI在印度很难掀起大规模失业潮,服务业受点波及,但大盘子稳得住。

可槽点也不少。谷歌拿GPT-5跑了450万次测试,发现这玩意儿也会"话到嘴边想不起来"。难在哪?模型自己得先意识到"我忘了",这就够头疼了。QuoteBench那篇论文说得更透:光看执行分数都差不多,但命令路径里的坑根本没法区分。AutoDesign框架想解决长周期智能体的自我迭代问题,但现有玩法还是太死板。你看AutoGPT在GitHub上拿了18万星标,社区喊得震天响,可真正能稳定跑下来的智能体工作流,太少见了。

算力这块的需求更是坐着火箭往上窜。机器人要进物理世界,算力消耗两年翻了10倍。从DeepSeek到Kimi,再到"黄仁勋联盟",开放权重在改写游戏规则。可"开源"到底开了个啥?大家其实还在摸着石头过河。我的判断很简单:往后看,谁的后训练做得扎实,谁的智能体靠谱不掉链子,谁就能吃上AI落地这口肉。参数规模的故事?歇了吧,真讲不下去了。