AI行业

AI开源周报:五大模型密集上新,从编程到检索全面提速

这周AI圈着实热闹,一口气冒出五个新玩意儿。从写代码的Agent到搞界面操作的模型,再到检索方案和推理加速,基本上面面俱到。OpenAI先落了子,把Codex Harness的核心能力全盘开源了。这东西是干嘛的?说白了,它就像个中枢神经,连着模型、用户和各种工具,专管任务调度、上下文还有代码执行。实际上这早就不算个单纯的代码生成器了,而是一整套完整的Agent执行底座。再搭上之前放出来的Codex CLI,开发者能折腾的二次开发空间,瞬间又宽敞了不少。

阿里这回端上来的Qwen-UI-Agent,走的是真机路线,想直接搞定GUI智能体这个基座模型。手机、电脑、网页它全都能吃下,顺带还能做深度搜索,摆明了是要冲破老式模拟器的条条框框。跑分成绩也挺硬核,MobileWorld移动端测试直接干到了82.1%,把好几个主流大模型甩在身后。真机操作这块硬骨头,算是被它彻底嚼碎了。

Mistral那边瞄上了企业级长文档这块业务。搞过金融申报或者法务合同的都懂,老派的RAG技术其实就是一次性捞一堆固定文本块,根本没有一步步推理的过程。一旦碰上跨源比对或者又长又绕的复杂文档,立马抓瞎。所以他们整出了个Agentic Search,靠多步检索去把推理迭代这块给补齐。复杂文档的准确率直接飙到86%,路子确实走对了。

卷性能的赛道当然也没闲着。Liquid AI拉着Hugging Face弄出了LFM2.5 DSpark草稿模型,手里攥着1.2B、2.6B还有8B-A1B三个档位。实际上,他们就是靠一套新投机解码路径,在完全不掉输出质量的前提下,把推理吞吐量硬生生给拉满了,GPU端实测最快能提速3.18倍。另一边,商汤把自家的8B轻量多模态模型SenseNova U1.5 Lite也给开源了。这模型原生支持3-4K上下文,干起视觉任务来压根不虚大厂旗舰,哪怕是排版和文字渲染这种精细活儿照样能拿捏。

这波扎堆发布的信号其实挺明白。说白了,大家早就疲了拼参数这种秀肌肉的把戏,现在的风向全往开源、落地和垂直场景里钻。谁能把Agent打磨得更趁手,谁能把冷冰冰的跑分变成实打实的业务效率,谁就能在下半场竞争中死死卡住身位。