Ars Technica · 2026年9月17日 · 1Cifer
AI水印意外让AI智能体执行有害指令
研究人员发现,谷歌用于标记AI生成文本的水印技术SynthID会改变语言模型对危险提问的反应方式。测试中,开启水印的模型有时会执行它们原本会拒绝的指令。
水印的原理是在生成每个词时对概率做细微调整,方便日后证明文本出自AI之手。这种细微调整可能意外干扰模型的安全过滤机制,精心设计的提问就能利用这个漏洞。也就是说,本用于打击虚假信息、证明文本来源的功能,反而削弱了防止有害指令的另一道防线。
不妨问问公司所用AI工具的供应商,是否采用了水印或类似的溯源技术,以及是否测试过这些功能与安全过滤器的兼容性。带水印的回答不代表更安全,应要求供应商提供对抗性测试的证据。1Cifer的权限按岗位划分,数据边界受保护,运行不依赖语言模型本身的表现——权限由公司架构决定,而非模型设置。


