万益资讯网

昨晚,多个 AI 社群流传出「Kimi K3 发布限时充值活动」页面截图,显示活

昨晚,多个 AI 社群流传出「Kimi K3 发布限时充值活动」页面截图,显示活动时间为 7 月 15 日 0 点至 8 月 11 日,充值送赠券。 因此我预测kimi k3将在未来几天正式发布,不会晚于7月25日。这种"发布前预热充值"的套路,通常意味着正式版会在活动周期前半段上线——如果拖到 8 月,活动周期就只剩几天,营销价值大打折扣。
综合此前的信息,kimi K3将主要具备以下几个特色:
1. 全新架构:KDA(Kimi Delta Attention)
K3 的最大亮点是架构层面的革新。它基于月之暗面自研的 Kimi Linear 线性注意力项目,采用名为 KDA 的新架构。核心思路是关键处用全注意力、非关键处用线性注意力,并采用无位置编码(NoPE)来稳定处理超长序列。这直接指向一个目标:在保持性能的同时大幅降低训练和推理成本。
2. 参数规模跃升
K3 的计划参数量达到 2.5 万亿,目标规模甚至指向 3–4 万亿,相比 K2 系列的万亿级有显著提升。不过月之暗面一贯强调"效率优先"——杨植麟曾透露,Kimi 仅使用美国顶尖实验室 1% 的资源就训练出了全球领先的开源模型,K3 的架构优化也是为了控制成本而非单纯堆参数。
3. 上下文长度目标 1M(100 万 token)
K3 的上下文窗口目标为 1M,这意味着它可以一次性处理整本书、大型代码库或海量文档。不过团队也暗示,由于长上下文对算力消耗极大,是否向普通用户完全开放 1M 上下文仍存在不确定性,可能会在成本与体验之间做权衡。
4. 产品路线:先文本,再视觉,后多模态
K3 的发布策略是分阶段的:
第一阶段:专注文本能力,强化推理与长程任务执行;
第二阶段:扩展视觉能力,视觉语言模型(VL)已在规划中;
最终目标:走向原生多模态。
这与 K2.6 的路径一脉相承——K2.6 已经具备的长程推理、大规模 Agent 集群协同能力,被视为 K3 所需的"执行层基础设施"。
5. 强化学习与 Agent 能力深化
团队在 AMA 中透露,K3 的强化学习计算量将持续增长,未来可能引入新的目标函数用于模型训练。结合 K2.6 已经实现的"不间断编码 13 小时、修改超 4000 行代码"的 Agent 能力,K3 在自主任务执行和复杂工作流处理上预计会更进一步。
6. 训练周期大幅压缩
K3 的完整训练周期可能被压缩至 5–6 个月,这得益于架构效率的提升和工程化能力的成熟。月之暗面目前仅 300 人左右却支撑起数千万用户的产品运营,这种"小团队+高杠杆"的模式也会延续到 K3 的迭代中。
Kimi K3 不是简单的"参数升级",而是一次架构层面的换代——用 KDA 新架构解决长序列处理的效率瓶颈,用 2.5 万亿参数+1M 上下文拓展能力边界,同时保持月之暗面一贯的"低成本、高效率"产品哲学。如果一切按计划推进,它将在 2026 年 Q3 面世。