DeepSeek推倒重来:3万亿参数模型剑指GPT-6
AI大模型

DeepSeek推倒重来:3万亿参数模型剑指GPT-6

DeepSeek本周上线V4.1 Flash,架构大改但没升大版本号。552B MoE非对称架构,输入激活约8B、输出约16B,上下文撑到100万token,原生支持图文理解。模型已登陆千问AI平台,API和Token Plan同步开放,开发者在Qoder、千问APP、Codex等工具里都能直接调用。

V4.1 Pro已确认在路上,但前代Pro表现不及预期,外界期待别拉太高。真正的重头戏是爆料中的3万亿参数大模型,性能直接对标GPT-6 Astra。Code 2.0也快了,主打电脑控制能力,后续还有更多模型排队发布。

梁文锋的打法很明确——入口才是秘密武器。DeepSeek不只想做模型,而是把模型塞进每一个使用入口,从代码生成到文档处理再到智能体任务,全链路覆盖。这轮"推倒重来"的架构调整,本质上是在为更大规模的模型铺路。