OpenAI前脚刚把“灾难风险应急”团队给解散了,后脚核心开发大神Scott Gray也递了辞呈。折腾半天,这家头部大厂现在连个独立的安全团队都凑不齐了。机器是越来越聪明,但人类对付超级智能的治理能力呢?实际上,根本就没跟上趟。等哪天AI智力把人类按在地上摩擦,谁来给这套系统兜底?这事儿早就火烧眉毛了。
说白了,安全漏洞早就蔓延到现实里了。美国康涅狄格州法院前阵子爆出个全美首例的“提示注入”案。原告贼得很,在诉状里用白底白字藏了隐藏指令,想偷偷干预AI审案。巧的是,法院当时压根没用AI审材料,所以他没得逞,人也被制裁了。但这招防不胜防啊。以后等AI全面接入司法系统,这种隐蔽的暗箭你怎么挡?
防御手段倒也在被动打补丁。Claude最近搞起了隐形水印,想在无损的前提下区分AI生成的内容,算是打响了GenAI时代信息隐藏的攻防战。不过技术终究只是表象。真正该让人冒冷汗的,是底层逻辑。AI系统在做道德决策时,根本就做不到绝对中立。开发者靠着收集用户的道德偏好,悄没声儿地成了那只“看不见的手”。
AI安全从来都不是过家家,指望几家大厂靠自觉?不现实。从法庭上的提示注入,到水印攻防战,再到道德决策的隐性控制,这条风险链条全都需要硬性监管来兜底。别非得等超级智能真掀桌子了,咱们才一拍大腿想起来要建制度,那可就全晚了。