AI大模型狂扒百科教程,离通用世界有多远?
AI技术

AI大模型狂扒百科教程,离通用世界有多远?

大模型对数据的渴望根本停不下来。最近全球最大生活指南百科WikiHow直接把OpenAI告了,指控对方未经授权爬取了超1.1万篇教程文章去训练AI。连教人修水管、做家常菜的万事指南都不放过,足以说明高质量语料已经到了饥不择食的地步。版权争议愈演愈烈,大厂获取训练数据的成本正在直线飙升。

光有海量数据还远远不够,底层训练算法也得抠细节。arXiv上新出了一篇论文,专门探讨如何稳定高效地训练critic。现在像GRPO这种基于组的强化学习方法,喜欢靠多次采样来逃避训练critic,图个省事。但要是能搞出一个靠谱的critic来精准评估token,大模型训练反而会变得更稳定高效。算法层面的微调,现在卷得比谁都厉害。

算力、算法和数据都在拼,大家最终是在赌通用世界模型。但这东西绝不是随便拼几个生成器、模拟器或者动作模型就能成的。它需要的是这三种能力深度耦合在一起的闭环反馈系统,而不是割裂的能力片段或者简单的线性串联。现在的模型看着聪明,其实离真正的“通用”还有很远的距离。路还很长,别急着吹牛。