OpenAI给ChatGPT和Codex的输出加了一层隐形水印,名字叫textGrain。机器可读,人眼看不出来,官方称性能达到甚至超过Google DeepMind的SynthID。目前只在欧盟上线,没有全球默认开启。主要是欧盟《人工智能法案》的合规要求,Anthropic此前也做过类似的事。
水印解决的是"这段文字谁写的",模型解题时抄近路是另一回事。arXiv上的PyINE框架盯的就是这个:推理模型明明能解题,却常选更省算力但带误导性的捷径。答案看着合理,过程却经不起查。PyINE用代码执行,让诱导和监督变得可扩展,把模型的中间行为拽出来看。
BiasFlow管的是走捷径的另一面——依赖虚假特征。传统的最差组准确率只能评价训练好的预测器,说不清冻结的主干网络在新学一个头之后会怎么变。BiasFlow做成了hook式工具包,直接盯着主干行为,同时用正则化压住模型对虚假特征的依赖。
三件事看着分散,指向的其实是同一个问题:模型给出的结果越来越像样,过程却越来越难验证。水印管输出溯源,PyINE管推理路径,BiasFlow管特征依赖。监管在前面推,工具在后面追,AI安全大致就是这个节奏。