OpenAI поручила GPT‑Red искать уязвимости своих моделей
OpenAI представила GPT‑Red — внутреннего автоматизированного участника красной команды, который в большом масштабе ищет уязвимости моделей к инъекциям в промпты. Такие атаки пытаются внедрить вредоносные инструкции и заставить ИИ обойти заданные ограничения. Система должна помогать укреплять защиту моделей до их широкого внедрения.
GPT‑Red обучается через состязательную самоигру: он атакует разные модели-защитники, а обнаруженные успешные приёмы используют для улучшения их безопасности. После усиления защиты атакующая система вынуждена искать новые способы обхода, создавая непрерывный цикл тестирования.
По данным OpenAI, обучение с применением GPT‑Red сделало GPT‑5.6 заметно устойчивее. При проверке ранее не встречавшимися атаками GPT‑5.6 Sol показала наибольшую сопротивляемость инъекциям в промпты среди протестированных моделей компании. OpenAI рассчитывает превратить этот подход в постоянную обратную связь, при которой нынешние модели помогают повышать безопасность следующих поколений ИИ.
Почему это важно
- —Автоматизация красного тестирования позволяет проверять больше моделей и сценариев атак до массового запуска.
- —Найденные GPT‑Red уязвимости напрямую используются для усиления защиты следующих версий моделей.
- —Подход создаёт непрерывный цикл, в котором атаки и средства защиты совершенствуются одновременно.
Ключевые факты
- GPT‑Red ищет способы атаковать модели OpenAI через инъекции вредоносных инструкций в промпты.
- Система обучается с помощью состязательной самоигры против нескольких моделей-защитников.
- Каждая успешная атака применяется для последующего укрепления защиты.
- GPT‑5.6 проверили атаками GPT‑Red, которых модель не видела во время обучения.
- GPT‑5.6 Sol показала лучшую устойчивость к инъекциям среди протестированных моделей OpenAI.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.