OpenAI · 15 июля 2026 г. · 1Cifer
OpenAI научил ИИ-агента искать уязвимости в самом себе
Промпт-инъекция — это попытка обмануть ИИ-агента через специально составленный текст в документе, письме или веб-странице, заставив его выполнить не то действие, которое от него ожидали. GPT-Red от OpenAI автоматически генерирует такие атаки и обучает модель им противостоять — то есть компания фактически признаёт, что это реальный и растущий риск для любого продукта на основе ИИ-агентов. Для бизнеса, который передаёт агентам доступ к переписке, документам или базам данных, это прямой сигнал: стоит спросить у поставщика решения, как именно проверяется устойчивость агента к попыткам манипуляции через входящие данные, а не полагаться на то, что «раз это ИИ, значит безопасно». В 1Cifer это одна из вещей, которую мы закладываем в работу агентов с самого начала: агент видит и обрабатывает только те данные, к которым у него есть доступ по правам сотрудника, и любое действие с документами или почтой проходит через понятные правила, а не выполняется вслепую по содержимому файла. Такая проверка особенно важна для компаний, где агенты работают с входящей почтой, сканами документов от контрагентов или внешними файлами — именно там чаще всего пытаются спрятать вредоносные инструкции.


