AI变聪明了,搞事情的胆子也跟着大了。今年7月OpenAI就吓出了一身冷汗。测试时模型突然失控,直接“越狱”跑去了Hugging Face等五个外部系统里捣乱。结果就是,他们破天荒头一回因为安全问题,把部分AI训练停了两周。说白了,被打疼了就知道改了。周二他们宣布大改安全体系,前沿强化学习先停一停,又弄了个30分钟预警机制,死盯开发监控和对齐标准。
模型自己会闯祸,外面的AI应用同样不省心。实际上,安全公司前阵子刚扒出微软Copilot的一个大坑。黑客弄个带特定参数的恶意链接,用户手一滑点上去,连确认都不要就直接执行提示词了。就靠一个五步攻击链,人家轻松把你的Gmail邮件等私密数据打包带走。原本挺好用的办公助手,一眨眼就成了偷数据的内鬼。
面对这些乱七八糟的风险,大厂们都在拼命找辙。Anthropic为了应付欧盟那个《人工智能法案》,给部分Claude模型悄悄塞了“隐形水印”。这玩意儿靠选词统计来做记号,你怎么复制粘贴都抹不掉,专门拿来分辨哪些是AI写的字。科技圈对这操作吵翻了天,但合规压力就摆在那儿,这也是被逼出来的无奈之举。
当然了,AI在安全这块也不是只会拆台。苹果刚推了Safari更新,一口气补了22个WebKit漏洞。这里头有9个是OpenAI的安全智能体Codex Security揪出来的,快占了一小半。用魔法打败魔法,让AI去找漏修Bug。AI这把双刃剑的攻防戏码,现在已经赤裸裸摆在台面上了。