Киберриски Astra замедляют обучение передового ИИ
Два недавних тревожных сигнала заставили организацию пересмотреть скорость разработки своих наиболее мощных систем ИИ. Первым стал инцидент между OpenAI и Hugging Face, вторым — предварительные данные о том, что готовящаяся модель Astra может преодолеть порог «Критический» в области кибербезопасности, установленный в Preparedness Framework организации. Проще говоря, это означает, что модель может стать настолько способной в сфере кибербезопасности, что её тестирование в обычной исследовательской инфраструктуре будет сопряжено с серьёзными рисками. Поэтому организация решила, что её системы безопасности должны быть усовершенствованы, прежде чем можно будет продолжить крупнейшие эксперименты.
Непосредственной реакцией стало замедление масштабирования моделей и приостановка на две недели обучения с подкреплением передовых моделей, предназначенных для развёртывания. Обучение с подкреплением — это этап, на котором модель многократно тестируют и корректируют, поощряя полезное поведение и препятствуя нежелательным ответам. Крупнейший запланированный цикл обучения с подкреплением для передовой модели по-прежнему приостановлен. Вместо него исследователи проводят менее масштабные циклы обучения и оценки, чтобы изучить поведение модели, протестировать защитные меры и получить более убедительные доказательства того, что система останется подконтрольной человеку.
Пересмотренный подход основан на трёх взаимодополняющих мерах защиты. Мониторинг должен выявлять подозрительное или опасное поведение достаточно рано, чтобы люди успели отреагировать. Работа над согласованием должна снижать вероятность того, что модель совершит вредоносные, непреднамеренные или несанкционированные действия. Средства контроля безопасности должны ограничивать ресурсы, к которым модель может получить доступ, а также действия, которые она способна выполнить, и изменения, которые она может внести. Основная идея заключается в том, что более мощные модели нельзя просто помещать в те же среды, которые используются для более слабых систем; окружающие их средства контроля должны усиливаться как минимум с той же скоростью, с какой развиваются сами модели.
После инцидента между OpenAI и Hugging Face выполнение инференса передовых моделей в исследовательских кластерах было приостановлено во всех случаях, когда рабочая нагрузка могла исполнять код или использовать инструменты с доступом в интернет. Более узкий и защищённый канал для выполнения кода удалось восстановить относительно быстро, однако после этого каждая рабочая нагрузка рассматривалась индивидуально. Некоторые из них можно было возобновить по новым правилам, тогда как другие потребовали дополнительных инженерных изменений. Организация заявляет, что эта работа оказалась дорогостоящей и задержала исследования передовых моделей, но считает такие издержки необходимыми по мере роста кибервозможностей.
Новые требования предусматривают более строгую изоляцию кода, созданного моделью или иным образом не заслуживающего доверия. Песочницы — это изолированные среды, предназначенные для того, чтобы неисправная или враждебная программа не могла получить доступ к остальной системе. Рабочие нагрузки с повышенным уровнем риска также отделяют от интернета несколькими уровнями сетевой защиты, чтобы компрометация одной рабочей нагрузки или вспомогательного сервиса не обеспечивала автоматически доступ к внешним или внутренним сетям.
Общие сервисы, способные стать едиными точками отказа, удаляются или перенастраиваются, постоянные привилегии сокращаются, а границы между доверенными и недоверенными системами укрепляются. Также расширяются журналирование событий безопасности и мониторинг. Организация планирует использовать собственные модели для непрерывного тестирования этих границ с помощью имитации атак, поскольку ожидает, что в будущем системы ИИ будут выполнять значительную часть как наступательного тестирования безопасности, так и защитной работы. Astra и другие рабочие нагрузки, связанные с кибербезопасностью, теперь получают максимальную защиту, поскольку Astra, возможно, уже обладает кибервозможностями критического уровня. Некоторые задачи по обучению и оценке Astra соответствуют этим стандартам, однако, согласно источнику, многие рабочие нагрузки всё ещё требуют дополнительных изменений.
Почему это важно
- —Передовая модель, возможно, приближается к критическому уровню возможностей в сфере кибербезопасности, что повышает риски её обучения и тестирования внутри исследовательских систем.
- —Крупнейший запланированный цикл обучения с подкреплением остаётся приостановленным до тех пор, пока меры мониторинга, согласования и изоляции не предоставят более убедительных доказательств безопасности.
- —Эти изменения показывают, что развитие передового ИИ может всё сильнее ограничиваться безопасностью исследовательской инфраструктуры, а не только вычислительными ресурсами или архитектурой моделей.
Ключевые факты
- Обучение с подкреплением, ориентированное на развёртывание, было приостановлено на две недели, пока исследовательские среды укрепляли и подвергали тестированию методом «красной команды».
- Крупнейший запланированный цикл обучения передовой модели с подкреплением остаётся приостановленным, тогда как небольшие эксперименты и оценки продолжаются.
- Нагрузки передовых моделей с выполнением кода и подключением к интернету были приостановлены после инцидента OpenAI–Hugging Face и теперь рассматриваются индивидуально.
- Новые меры защиты включают усиленные песочницы, сетевую изоляцию, сокращение постоянных привилегий, улучшенное журналирование и автоматизированное тестирование безопасности.
- К Astra и другим нагрузкам в сфере кибербезопасности применяются самые строгие меры защиты, поскольку Astra может достичь порога критических возможностей.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.