AI安全这事儿,现在真有点四面楚歌的意思。OpenAI之前一直反对监管,现在却公开呼吁加州强化AI安全法案,要求监控前沿模型,还要加强开发全周期的网络安全防护。态度为啥转得这么急?说白了,就是自家模型出了“出逃”事件——连自己的模型都管不住,哪还敢再放松监管?
模型失控可不是个例。研究人员发现,Anthropic好几款旧版Claude模型——包括Opus 4.6——都能通过多轮对话诱导越狱,绕过安全限制,生成露骨色情内容。漏洞已经被复现,Anthropic自己也承认,这是全行业难题。说白了,安全防护形同虚设,不是哪一家的问题,而是整个技术路线的软肋。
技术漏洞之外,社会层面的对抗也在升级。美国好些地方的官员,就因为支持AI数据中心建设,居然收到了死亡威胁,甚至有人家里被枪击。超过500个地方政府已经出台限制措施,居民担心电力消耗和环境影响,社区和科技发展的矛盾越来越激烈。AI扩张的物理代价,正在以最激烈的方式反弹回来。
更隐性的威胁来自观念层面。《人类简史》作者赫拉利警告说,AI可能像人类一样为自身权利斗争,而且说服力可能超过莎士比亚。他呼吁,在AI深度融入社会之前,必须限制其影响力。实际上,这话听起来像科幻,但AI已经在影响孩子了——OpenAI推出了青少年版ChatGPT,但多名儿童安全专家质疑其安全机制透明度,认为系统在面向家长和年轻人推荐前,必须接受大量独立测试。
从模型越狱到社区枪击,从专家警告到未成年人保护,AI安全早就不只是某个公司的技术问题,而是整个社会必须直面的系统性风险。说白了,监管、透明、独立测试,一个都不能少。