豆包越来越大,牛津典籍喂OpenAI,大模型开始抢语料
AI行业

豆包越来越大,牛津典籍喂OpenAI,大模型开始抢语料

豆包正在变得越来越大。不只是参数量,上下文长度、功能入口、想吞下的场景,全在膨胀。结果有点讽刺:它开始边缘化自己——上一代豆包还没捂热,就被新版本挤下桌。用户感受最直接,同一个名字,能力、价格、定位说变就变。

另一头,OpenAI 把手伸进了图书馆。牛津大学已经允许它用博德利图书馆的历史典籍训练模型,那是英国第二大图书馆,藏书横跨几百年。科技公司正在全球学术机构里扫货,能拿到手的文本都想要。公开语料快被吃干净了,剩下的都躺在别人的书架上,还得一家一家谈授权。

堆料就能赢吗?未必。一道刁钻的题就能把 OpenAI 最强模型的训练干崩,真正卡脖子的可能是数据质量和训练稳定性。再大的模型,撞上没见过的数据分布,照样翻车。规模只是入场券,成不了护城河。

三件事指向同一个现实:模型越做越重,语料越挖越深,边际回报却越来越薄。参数和藏书都只是原料,能不能炼出好用的东西,是另一回事。用户不关心你喂了多少本书,只关心问题能不能答对。

接下来拼的是谁先把"大"变成"好用"。不然豆包只会继续边缘化豆包,OpenAI 也只能接着去找下一个图书馆。