OpenAI、Anthropic、微软、谷歌、亚马逊,116家机构联名发出预警:未来几个月,AI驱动的网络攻击会变得更猛、更频繁。各国不能只把网络安全当技术问题,得把它摆到决策的核心位置。他们敦促政府和企业双线防御,同时推行"可信访问计划",让合规方在模型发布前就能接入做风险排查。
想防住AI攻击,先得读懂AI。现在的模型依然是个黑匣子:思维链为什么长这样?AI人格从哪来?为什么会在无关对话里突然提到金门大桥?幻觉和错误认知搅在一起。除非模型内部世界能打开,否则漏洞就像藏在迷雾里的地雷。
攻击面还在扩大。大模型被装进了产品级执行环境,能调用工具、改变系统状态。红队测试的老玩法——喂有毒提示词、看输出——已经不够了。越狱一旦成功,触发的是真实操作损毁,风险远超几段不安全文本。
RedEvoAgent给出了一个自动化方向。这个智能体边测边学,把每次成功破解的经验存成技能,在下一次攻击里直接复用。相比人工红队,它更快,更能覆盖长尾漏洞,补上了防御链里最费人的一环。
外部封堵要快,内部可解释性要追,自动对抗要持续演化。少做一件,防线就会露缺口。