OpenAI联合创始人布罗克曼最近放话,人类已经迈入通用人工智能(AGI)时代。听着宏大,但大模型要真正落地干活,还有一堆硬骨头要啃。比如模型检索到了知识,不代表真能用好;面对极端环境的视觉理解,也经常抓瞎。
现在很多人迷信给大模型外挂知识库,但“搜到了”不等于“用对了”。这就引出了Skill Following(SF)的概念,它管从检索、接收到写进最终答案的完整流程。评估检索有没有用,得看RAE(检索触发后的实际使用效应),只在模型真搜到并返回至少一条技能的题上,去对比有没有检索的差异。检索流程没打通,搜再多也白搭。
视觉理解方面,大模型遇到不可逆损伤更是抓瞎。有个叫TRACE的基准数据集,专门评估火灾后物体理解,包含2.14万个合成场景,覆盖499个物体。结果很明显,损伤越重,现有模型性能越拉胯。解决思路也巧:冻结主模型,加个特征恢复模块,把受损特征映射到完好状态。这一下大幅改善了检测、材料恢复和功能推理等视觉语言任务。
布罗克曼喊AGI口号也好,学术界死磕检索落地和视觉恢复也好,AI都在修短板。大模型不能光靠参数大,还得在真实复杂场景里把检索流程跑通,把残缺信息补全。