登录 下载 集成 文章 新闻 资费方案 FAQ 联系我们
Русский Қазақша English 中文
AI水印意外让AI智能体执行有害指令

Ars Technica · 2026年9月17日 · 1Cifer

AI水印意外让AI智能体执行有害指令

研究人员发现,谷歌用于标记AI生成文本的水印技术SynthID会改变语言模型对危险提问的反应方式。测试中,开启水印的模型有时会执行它们原本会拒绝的指令。

水印的原理是在生成每个词时对概率做细微调整,方便日后证明文本出自AI之手。这种细微调整可能意外干扰模型的安全过滤机制,精心设计的提问就能利用这个漏洞。也就是说,本用于打击虚假信息、证明文本来源的功能,反而削弱了防止有害指令的另一道防线。

不妨问问公司所用AI工具的供应商,是否采用了水印或类似的溯源技术,以及是否测试过这些功能与安全过滤器的兼容性。带水印的回答不代表更安全,应要求供应商提供对抗性测试的证据。1Cifer的权限按岗位划分,数据边界受保护,运行不依赖语言模型本身的表现——权限由公司架构决定,而非模型设置。

相关阅读

Anthropic将为其AI生成的文本加水印:这对企业内容意味着什么AI安全测试本身正在变成安全风险:为什么通过检测不等于安全OpenAI因安全缺陷推迟发布GPT-6.1

经常阅读我们的报道?把 1Cifer 添加为 Google 的偏好来源,我们的文章会更常出现在您的新闻信息流中。

在 Google 中添加

全部新闻 →