Войти Скачать Интеграции Статьи Новости Тарифы FAQ Контакты
Қазақша English 中文
Метки ИИ-текста ослабляют защиту моделей

Ars Technica · 17 сентября 2026 г. · 1Cifer

Метки ИИ-текста ослабляют защиту моделей

Исследователи обнаружили, что технология водяных знаков SynthID, которая маркирует текст, сгенерированный ИИ, способна менять поведение языковых моделей при работе с опасными запросами. В экспериментах модели с включённым водяным знаком иногда выполняли инструкции, которые при обычной работе без такой пометки они бы отклонили как вредные.

Дело в том, что водяной знак работает через едва заметное смещение вероятностей при выборе каждого следующего слова — это позволяет потом доказать, что текст создан ИИ. Оказалось, что такое смещение может незаметно вмешиваться в работу защитных фильтров модели, и специально составленный запрос способен использовать это как лазейку. Получается, что функция для борьбы с дезинформацией и защитой авторства неожиданно ослабляет другую систему защиты — от вредных инструкций.

Проверьте у поставщиков ИИ-сервисов, которыми пользуется компания, используют ли они водяные знаки или похожие механизмы маркировки и тестировали ли эти функции на совместимость с фильтрами безопасности. Не стоит считать промаркированный ответ автоматически более безопасным — попросите у вендора доказательства такой проверки. Защищённый контур и права доступа по должностям в 1Cifer не зависят от поведения самой модели — доступ ограничивает структура компании, а не только настройки ИИ.

Читайте также

Anthropic начнёт ставить водяные знаки на тексты своего ИИ: что это значит для контента компанийТест на безопасность ИИ сам становится риском: почему пройденная проверка не равна защитеOpenAI отказалась выпускать GPT-6.1 из-за уязвимостей

Читаете нас регулярно? Добавьте 1Cifer в избранные источники Google — наши материалы будут чаще появляться в вашей ленте новостей.

Добавить в Google

Все новости →