国内大模型团队正加紧排兵布阵。字节跳动Seed部门刚完成大换血,新设四个一级部门,把预训练数据、强化学习等资源全盘整合,B端和C端能力分开布局,李成刚带头搞新Omni模型。科大讯飞也没闲着,宣布今年1024开发者节将掏出基于全国产算力的主力通用大模型,8月底先放个阶段性版本给市场尝鲜。
这边大厂在调架构,那边神秘玩家直接下场搅局。一个叫“Ox Alpha”的模型突袭OpenRouter,输入输出全免费,性能还贼强,全网都在盲猜背后是智谱还是小米。不仅拼价格,推理速度也在卷。Liquid AI和Hugging Face联手发了LFM2.5系列草稿模型,靠全新投机解码路径,在不变更输出质量的前提下,把GPU端推理吞吐量最高拉高了3.18倍,端侧也快了不少。
模型越来越多,怎么调度成了新课题。arXiv最新研究指出,把不同架构的异构AI系统组合起来,通过路由把查询丢给最擅长的“专家模型”,能大幅提升整体的质量和效率。说白了,大模型行业已经过了盲目堆参数的阶段,现在拼的是组织效率、推理成本和精细化调度。