Ars Technica · 17 сентября 2026 г. · 1Cifer
Метки ИИ-текста ослабляют защиту моделей
Исследователи обнаружили, что технология водяных знаков SynthID, которая маркирует текст, сгенерированный ИИ, способна менять поведение языковых моделей при работе с опасными запросами. В экспериментах модели с включённым водяным знаком иногда выполняли инструкции, которые при обычной работе без такой пометки они бы отклонили как вредные.
Дело в том, что водяной знак работает через едва заметное смещение вероятностей при выборе каждого следующего слова — это позволяет потом доказать, что текст создан ИИ. Оказалось, что такое смещение может незаметно вмешиваться в работу защитных фильтров модели, и специально составленный запрос способен использовать это как лазейку. Получается, что функция для борьбы с дезинформацией и защитой авторства неожиданно ослабляет другую систему защиты — от вредных инструкций.
Проверьте у поставщиков ИИ-сервисов, которыми пользуется компания, используют ли они водяные знаки или похожие механизмы маркировки и тестировали ли эти функции на совместимость с фильтрами безопасности. Не стоит считать промаркированный ответ автоматически более безопасным — попросите у вендора доказательства такой проверки. Защищённый контур и права доступа по должностям в 1Cifer не зависят от поведения самой модели — доступ ограничивает структура компании, а не только настройки ИИ.


