TypeSafe的CEO Diogo Almeida放出一个数字:约四分之一的《财富》500强企业正在用Jev模型。他把Jev称作"新一类AI",并说它大约一周前就做到了每天处理一万亿个token。这个量级听着够吓人,但报道没给出独立验证——先记着,别急着信。
另一头,李飞飞不等了。"世界模型"这四个字现在被用滥了,几乎每场发布会都要蹭一下。与其在概念上跟人扯皮,不如把真东西摆出来:能不能预测、能不能跟环境交互,这才是分界线。词热不热不重要,管不管用才重要。
评测这边也出了状况。何恺明团队做了一套AGI考试,结果Claude拿了满分,GPT得了99分。一套本想用来区分模型高低的卷子,转眼就被打穿。benchmark的保鲜期越来越短,今天能拉开差距的题目,下个月可能就成了送分题。
三件事放一起看,信号很清楚。落地端在拼规模,万亿token的日处理量如果属实,说明企业侧的调用早就过了试点阶段;路线端在拼定义权,谁的世界模型能被认可,谁就拿到下一轮入场券;评测端则在失效,考卷已经追不上模型。真正该焦虑的,或许不是模型公司,而是还拿旧标准挑模型的人。