New-ZZZ
RU / EN
Безопасность 15 июля 2026

GPT-Red обучает модели OpenAI противостоять инъекциям промптов

Р
Редакция New-ZZZ
OpenAI Blog · 3 недели назад

OpenAI разработала GPT-Red — внутреннюю автоматизированную модель для red teaming, предназначенную для обнаружения уязвимостей в безопасности передовых систем ИИ и создания состязательных примеров, которые можно использовать при обучении. Red teaming означает намеренные попытки заставить систему дать сбой, нарушить свои правила или повести себя небезопасным образом, чтобы устранить эти слабые места до развёртывания. OpenAI утверждает, что эта работа стала узким местом, поскольку традиционные методы оценки всё чаще не способны ставить достаточно сложные задачи перед её новейшими моделями, а разработанные вручную тесты не успевают за ростом возможностей моделей.

Непосредственное внимание сосредоточено на инъекциях промптов — атаках, при которых вредоносные инструкции, скрытые во внешнем контенте, пытаются переопределить предусмотренное поведение модели. Системы ИИ сталкиваются со сторонней информацией, когда просматривают сайты, читают электронные письма и локальные файлы, используют подключённые приложения, изучают репозитории или обрабатывают ответы инструментов. Эти возможности необходимы для полезной работы в реальном мире, но вместе с тем они подвергают модели воздействию контента, контролируемого злоумышленниками. Например, внедрённая инструкция может попытаться убедить ИИ-ассистента отправить конфиденциальную информацию на внешний сервер.

Специалисты по безопасности по-прежнему играют важную роль в процессе обеспечения безопасности OpenAI, поскольку способны придумывать оригинальные атаки, понимать контекст и выявлять ранее неизвестные сценарии сбоев. Однако планирование и проведение тестирования людьми требует значительного времени. Оно позволяет получить ценные примеры успешных атак, но не обязательно обеспечивает достаточно разнообразных состязательных данных, чтобы с помощью обучения сделать модели существенно более устойчивыми. Главное утверждение OpenAI заключается в том, что автоматизированный red teaming способен повысить как скорость обнаружения уязвимостей, так и объём враждебных примеров, доступных для совершенствования будущих систем.

GPT-Red представлена как самая мощная на сегодняшний день автоматизированная модель OpenAI для проверки безопасности методом red teaming и как итог предыдущих внутренних экспериментов. Она работает итеративно, подобно человеку-тестировщику: модель преследует цель атаки, отправляет промпт целевой модели GPT, наблюдает за ответом и корректирует следующую попытку. Этот цикл обратной связи позволяет ей искать стратегии атак, а не полагаться исключительно на фиксированный набор известных промптов. По словам OpenAI, предыдущие модели, используемые в продакшене, остаются крайне уязвимыми для атак с инъекцией промптов, генерируемых GPT-Red.

Компания выделила системе необычно большой объём вычислительных ресурсов. По данным OpenAI, GPT-Red обучалась в масштабе, сопоставимом с некоторыми из крупнейших этапов постобучения компании, причём эти вычислительные мощности были специально направлены на повышение безопасности. Таким образом, в рамках проекта состязательное тестирование рассматривается как значительная обучающая нагрузка, а не как ограниченная оценка, проводимая после того, как разработка модели почти завершена. Более широкая идея представляет собой форму самоулучшения, ориентированного на безопасность: доступные сегодня модели помогают выявлять слабые места и создавать обучающие данные для более безопасных моделей следующего поколения.

OpenAI напрямую включила атаки, созданные GPT-Red, в состязательное обучение GPT-5.6 Sol. При состязательном обучении целевая модель многократно сталкивается со сложными примерами атак и учится им противостоять. Компания сообщает, что на самом сложном тесте прямых инъекций промптов GPT-5.6 Sol допускала в шесть раз меньше сбоев, чем её лучшая продакшен-модель четырьмя месяцами ранее. OpenAI называет GPT-5.6 Sol своей самой устойчивой к инъекциям промптов моделью на сегодняшний день, хотя в предоставленных материалах отсутствуют исходный набор тестов этого бенчмарка, абсолютные показатели сбоев и независимое воспроизведение результата.

Заявленное улучшение не означает, что инъекции промптов полностью устранены. Автоматизированные атакующие и защитные системы могут продолжать совершенствоваться в ответ друг на друга, а при реальном развёртывании системы могут столкнуться с ситуациями, не представленными во внутреннем бенчмарке. Этот результат скорее демонстрирует, как способную генерировать атаки модель можно встроить в производственный цикл обучения, чтобы она непрерывно находила сценарии сбоев, становящиеся материалом для следующего этапа защитного обучения.

OpenAI планирует масштабировать этот автоматизированный подход по мере развития возможностей моделей, но не представляет GPT-Red как замену внешней проверке. Компания заявляет, что автоматизированное тестирование останется одним из уровней защиты наряду с red teaming, проводимым людьми и сторонними организациями, множеством технических мер безопасности и мониторингом в реальном времени после развёртывания. Таким образом, предлагаемая модель безопасности является многоуровневой: автоматизированные противники расширяют охват и объём обучающих данных, люди привносят экспертное суждение и новые идеи атак, а мониторинг помогает обнаруживать сбои, которые всё же проникают в работающие системы.

Почему это важно

  • Автоматизированный red-teaming позволяет генерировать атаки в масштабах, необходимых для совершенствования всё более мощных систем ИИ.
  • Инъекция промптов представляет серьёзную угрозу безопасности для агентов, которые просматривают сайты, получают доступ к файлам и используют подключённые приложения.
  • OpenAI сообщает, что после обучения GPT-5.6 Sol на атаках GPT-Red количество ошибок в тестах сократилось в шесть раз.

Ключевые факты

  • GPT-Red итеративно отправляет атаки, анализирует ответы целевой модели и адаптирует свои промпты.
  • OpenAI обучила внутреннюю систему, затратив вычислительные ресурсы, сопоставимые с некоторыми из её крупнейших запусков постобучения.
  • Атаки, сгенерированные GPT-Red, были включены в состязательное обучение GPT-5.6 Sol.
  • По имеющимся данным, GPT-5.6 Sol допустила в шесть раз меньше ошибок в самом сложном тесте OpenAI на прямые инъекции промптов, чем её лучшая рабочая модель четырьмя месяцами ранее.
  • OpenAI планирует сочетать автоматизированное тестирование с red-teaming с участием людей и сторонних организаций, многоуровневыми мерами защиты и мониторингом в реальном времени.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы