OpenAI запускает GPT-5.6 с более быстрыми и дешевыми frontier-моделями
OpenAI представляет GPT-5.6 как новое семейство моделей, построенное вокруг простого обещания: больше полезной работы с каждого токена, более сильные результаты на каждый потраченный доллар и дополнительная способность там, где задача достаточно сложна, чтобы оправдать больше вычислений. Семейство включает три модели: Sol, новый флагман; Terra, сбалансированную модель для повседневной работы; и Luna, самый дешёвый вариант. В анонсе Sol подаётся как главный скачок вперёд, особенно в программировании, интеллектуальной работе, кибербезопасности, науке, использовании инструментов и дизайн-ориентированном сотрудничестве.
Главное утверждение в том, что GPT-5.6 Sol улучшает и «сырую» интеллектуальность, и операционную эффективность. OpenAI говорит, что она может превосходить более ранние и конкурирующие frontier-модели, используя при этом меньше токенов и обходясь дешевле по оценочной общей стоимости. Это важно, потому что продвинутые ИИ-системы всё чаще оценивают не только по результатам бенчмарков, но и по тому, сколько полезной работы они способны выполнить в рамках практичного бюджета. Главный сдвиг — производительность на доллар: GPT-5.6 описывается как модель, которая выполняет больше успешной работы за те же деньги или достигает сопоставимых результатов при меньшей общей стоимости.
OpenAI говорит, что GPT-5.6 обучали извлекать больше ценности из каждого токена, а значит, модели должно требоваться меньше слов, вызовов инструментов или повторных попыток для выполнения сложной работы. На Agents' Last Exam, бенчмарке долгих профессиональных рабочих процессов в 55 областях, GPT-5.6 Sol, как сообщается, достигает 53,6, устанавливая новый максимум и опережая Claude Fable 5 с adaptive reasoning на 13,1 пункта. Даже на среднем уровне reasoning Sol, по утверждению, превосходит Fable 5 на 11,4 пункта, обходясь примерно в четверть стоимости. OpenAI также заявляет, что меньшие модели Terra и Luna превосходят Fable 5 примерно за одну шестнадцатую стоимости, позиционируя семейство не только как флагманское обновление, но и как более широкий рывок в сторону экономической эффективности.
В анонсе также упоминается Artificial Analysis Intelligence Index, который измеряет сочетание агентной работы, программирования, научного рассуждения и общих возможностей. Там GPT-5.6 Sol с максимальным reasoning, как сообщается, оказывается в пределах одного пункта от Fable 5, завершая задачи на 61% быстрее и примерно за половину оценочной стоимости. Практически OpenAI утверждает, что Sol не всегда обязана побеждать в каждом сравнении по «сырому» баллу, чтобы быть привлекательнее: если модель почти столь же способна, намного быстрее и дешевле в эксплуатации, она может лучше подходить для реального production-использования.
Важная часть релиза — новая настройка возможностей “ultra”. OpenAI описывает ultra как режим максимальных возможностей, предназначенный для требовательных задач, где дополнительные токены и вычисления оправданы. В отличие от обычного одноагентного выполнения, ultra координирует несколько агентов в параллельных рабочих потоках, по умолчанию запуская четыре агента. Цель — дать системе возможность исследовать альтернативы, выполнять проверки, разделять подзадачи и быстрее сходиться к более сильным ответам. OpenAI говорит, что параллельные агенты улучшают компромисс между оценкой и задержкой на таких бенчмарках, как BrowseComp, SEC-Bench Pro и Terminal-Bench 2.1, то есть система может достигать лучших результатов за меньшее фактическое время.
GPT-5.6 также расширяет то, что OpenAI называет Programmatic Tool Calling в Responses API. Вместо того чтобы заставлять разработчиков вручную прописывать каждый шаг или отправлять каждый результат инструмента обратно через модель, модель может писать и запускать лёгкие программы, которые координируют инструменты, фильтруют промежуточные данные, отслеживают прогресс и решают, что делать дальше. Это важно для workflows с большим количеством инструментов, потому что крупные выводы инструментов могут быть дорогими и отвлекающими. Модель позиционируется уже не столько как чатбот, сколько как агентная рабочая система, способная управлять промежуточными шагами без постоянного надзора со стороны человека или разработчика.
Программирование — одно из самых сильных заявлений в анонсе. OpenAI называет GPT-5.6 Sol своей лучшей моделью для кодинга на данный момент. На Artificial Analysis Coding Agent Index Sol с максимальным reasoning, как сообщается, набирает 80, что OpenAI называет новым state of the art и результатом на 2,8 пункта выше Fable 5. Компания добавляет, что Sol использует менее половины выходных токенов, занимает менее половины времени и стоит примерно на треть дешевле. Преимущество, как утверждается, распространяется и на меньшие модели: Terra показывает результат немного выше Fable 5, а Luna превосходит Opus 4.8, при этом обе завершают задачи по программированию примерно за треть времени, используя около половины выходных токенов и обходясь примерно в четверть стоимости.
OpenAI также выделяет Terminal-Bench 2.1 и DeepSWE, которые проверяют более реалистичные инженерные навыки, чем простые задачи на кодинг. Terminal-Bench фокусируется на сложных рабочих процессах в командной строке, а DeepSWE оценивает более длинные задачи software engineering в реальных кодовых базах. Эти бенчмарки важны, потому что многие практические задачи по программированию требуют навигации по файлам, запуска команд, интерпретации ошибок, изменения подхода и проверки результатов, а не просто написания функции в изоляции. Если заявленные улучшения подтвердятся в реальном использовании, GPT-5.6 может быть полезнее для software-команд, которым нужна помощь ИИ с реализацией, отладкой, рефакторингом и многошаговыми инженерными задачами.
Релиз также подчёркивает безопасность. OpenAI говорит, что GPT-5.6 запускается с самыми надёжными защитными механизмами компании на сегодняшний день, рассчитанными на сопротивление настойчивому и адаптивному злоупотреблению при сохранении доступа к легитимной работе без чрезмерно широких ограничений. Перед general availability компания, по её словам, провела длительный период оценки, сочетая human red teaming с масштабным автоматизированным тестированием. Во время preview OpenAI работала с экспертными организациями и доверенными партнёрами, чтобы нагрузочно проверить защиту. Итоговая система безопасности сочетает защиты, встроенные в модель при обучении, с проверками в реальном времени, мониторингом и контролем доступа, откалиброванными по уровню доверия и риска.
Более широкий стратегический посыл в том, что OpenAI хочет, чтобы GPT-5.6 обслуживала разные уровни амбиций и бюджета. Luna призвана сделать продвинутый интеллект дешевле и доступнее. Terra ориентирована на рутинную повседневную работу, где важен баланс. Sol — флагман для задач высокой ценности. Max reasoning даёт Sol больше времени на размышление, проверку и доработку; ultra идёт дальше, координируя несколько агентов параллельно. Поэтому релиз — это не просто обновление модели, а упаковка интеллекта по стоимости, задержке, глубине reasoning и многоагентному выполнению.
Почему это важно
- —GPT-5.6 позиционируется как крупное обновление эффективности, обещающее более высокую производительность ИИ при меньшей расчетной стоимости.
- —Новый режим ultra продвигает OpenAI дальше в сторону многоагентных рабочих процессов для сложных профессиональных задач.
- —Кодинг, использование инструментов и длительная агентная работа находятся в центре релиза, показывая, в каком направлении оптимизируются frontier-модели.
Ключевые факты
- Семейство GPT-5.6 включает Sol, Terra и Luna, покрывая флагманские, сбалансированные и экономичные сценарии использования.
- OpenAI заявляет, что GPT-5.6 Sol набирает 53,6 балла в Agents' Last Exam, опережая Claude Fable 5 на 13,1 балла.
- Сообщается, что Sol достигает передового результата 80 в Artificial Analysis Coding Agent Index.
- Новая настройка ultra по умолчанию координирует четыре агента параллельно для требовательных задач.
- Programmatic Tool Calling позволяет модели запускать легковесные программы для координации инструментов и сокращения лишних обращений к модели.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.