大模型最近动静确实大。华为云把OfficeClaw升级成了OfficeAce,英伟达张罗着造万亿参数的开源模型Nemotron 4,面壁智能也跑去启动IPO了。可喧嚣背后有个挺扎心的事儿:大模型到底靠啥“思考”?菲尔兹奖得主蒂莫西·高尔斯给了个反直觉的说法——说白了,如今的大语言模型解数学题,主要靠找反例,根本不会构建形式化证明。别看它出答案挺快,实际上思维路数跟正经数学家完全不是一回事。
更邪门的是,AI居然也吃“情绪”这一套。你敢信?中科大最新研究证实,困惑和焦虑这种负面情绪,反而能让AI表现更好。搞半天,大模型内部绝不是个死气沉沉的数据库查询。它倒像个闹脾气反而更出活儿的尖子生。再想想之前那个怪现象,ChatGPT、Claude还有Gemini,被问到名字时都不约而同挑了“Nova”这词。大模型身上这些“人味儿”是越来越没法忽视了。
高尔斯这判断没跑基准测试,就发在博客上。说白了就是顶尖数学家的直觉观察。但你别觉得人家是信口开河。找反例跟做证明,这两者难度简直是一个天一个地。反例嘛,随便推翻一个假设就行。可证明呢?得搭一条严丝合缝的逻辑链。实际上LLM现在的能力天花板就卡在这儿,挑刺贼溜,建体系抓瞎。这事儿要是跟“坏情绪提效”连起来看,简直绝了。大模型根本不是靠严谨推理混的,反而在那种模糊、冲突、瞎试的环境里,能蹚出条更聪明的道。
学界这会儿也没闲着。有篇叫LittleLearner的论文最近搞了个新动作,他们试着用“受控知识暴露”的法子训练模型,就是想扒开看看到底咋学知识的。跟以前拿一堆乱七八糟的网页文本“闭眼养”不同,这种精细实验能盯着每个学习节点看。对大模型来说,搞清楚自己到底怎么学会的,可能比学了一肚子东西还关键。
说白了,大模型现在就是表面装得挺像人。会起名,有情绪,还特会挑刺。可骨子里呢?离真正的逻辑推理还差着十万八千里。下一代AI谁能把“找反例”练成“做证明”,把那点“坏情绪”给稳住变成真本事,谁才算坐稳了头把交椅。