OpenAI · 2026年7月15日 · 1Cifer
OpenAI打造能自我检测漏洞的AI智能体
提示注入是指通过在文档、邮件或网页中精心设计的文本欺骗AI智能体,使其执行本不该执行的操作。GPT-Red能自动生成此类攻击并训练模型加以抵御——这意味着OpenAI自己也承认,这是任何基于AI智能体产品都面临的真实且日益增长的风险。对于让智能体访问往来邮件、文档或数据库的企业来说,这是一个直接信号:应该向方案提供商询问,智能体究竟如何测试抵御输入数据中隐藏的操纵企图,而不是想当然地认为"是AI就安全"。在1Cifer,我们从一开始就把这一点融入智能体的运作方式:智能体只能查看和处理其在员工权限范围内可访问的数据,任何针对文档或邮件的操作都遵循明确规则,而不是盲目按文件内容执行。这种检查对那些智能体需要处理往来邮件、合作方扫描文档或外部文件的企业尤为重要——恶意指令最常藏在这些地方。


