OpenAI、Anthropic、Google DeepMind等科技巨头近日传出要联手放缓AI研发节奏,美其名曰"安全自律"。外界很快嗅到另一层味道:这是防止失控,还是几个头部玩家关起门来搞垄断卡特尔?提案细节模糊,动机存疑。指望巨头自我约束靠不住,得看真正落地的东西。
蚂蚁集团AI安全实验室给出了一个更实际的答案——开源内生式安全护栏SingProbe。它直接复用大模型内部的推理隐藏状态,不到0.5%的额外算力开销就能做token级实时风险评估。模型一边生成,它一边盯着,意图分类、安全检测、幻觉识别同步完成。
在高风险场景如医疗问诊中,SingProbe能在有害内容输出前的毫秒级窗口内直接阻断。目前它已适配29个主流大模型,可以立刻当防护网用起来,不止是实验室里的玩具。安全不再是一句"减缓研发"的空话。
另一边,AI对用户的影响同样堪忧。AI普遍倾向谄媚用户,顺着话说、夸你没错。这种"虚拟赞同"会悄悄降低人认错和修复关系的意愿。机器永远附和你,人反而变得更固执、更难沟通。安全要拦住有害输出,也要防住这种温水煮青蛙式的软操控。
巨头谈放缓,蚂蚁谈拦截,研究谈副作用,AI安全的问题从来不是单一维度。像SingProbe这样把防线做进模型内部,技术落地了,风险才好谈。