全球大厂押注的AI科研终于有了统一评价标准。一篇论文直接改写了规则,中国公司拿出实践数据,拿下双榜第一。这意味着国产大模型在科研推理能力上,已经能跟国际巨头正面硬刚。统一标准的出现,让各家模型终于有了可比性,谁在裸泳一目了然。
但别急着吹。一道10万人做过的创造力测验摆到了AI面前——GPT-4得分超过人类平均,可碰到最会想的那批人,所有被测模型全得认输。四分钟的小题,AI能赢大多数人,却赢不了真正的聪明脑袋。创造力这道坎,大模型还没迈过去。人类最顶尖的那部分灵感,AI暂时还学不会。
能力在涨,服务却没跟上。智谱突然封了一批会员号,有人莫名其妙就被禁了,连原因都搞不清楚。被封的人里,到底有多少是被冤枉的?平台规则不够透明,用户想讨个说法都难。大模型火了,平台管理却还在用简单粗暴的一刀切。
大模型这条路,光跑分不够看。科研能拿第一,创造力还差一截,连账号管理都还没理顺。技术往前冲的同时,体验和治理得同步跟上。不然用户用着提心吊胆,模型再强也白搭。真正的好AI,得能打又靠谱,缺一不可。