New-ZZZ
RU / EN
Модели ИИ 29 июля 2026

GPT-5.6 нацелен на передовой ИИ при более низкой стоимости обслуживания

Р
Редакция New-ZZZ
OpenAI Blog · 1 неделю назад

OpenAI снизила цены на GPT-5.6 Luna на 80% и Terra на 20%, а для Sol добавила быстрый API-режим до 2,5 раза быстрее Standard.

Обновлено 31.07.2026 16:34

OpenAI следом снизила цены на GPT-5.6 Luna на 80% и Terra на 20%, а для GPT-5.6 Sol ввела Fast mode: до 2,5 раза быстрее Standard при двойной цене и без изменения заявленного уровня интеллекта. Компания также переносит экономию в расчёт использования Codex и ChatGPT Work. Источник: OpenAI Blog↗

Ранее писалось:

OpenAI заявляет, что разработала семейство GPT-5.6 так, чтобы сочетать передовые возможности с более низкими эксплуатационными расходами для широкого спектра задач. По имеющимся данным, флагманская модель GPT-5.6 Sol при настройке на максимальную глубину рассуждений превосходит Claude Fable 5 в рейтинге Artificial Analysis Coding Agent Index, при этом обходясь менее чем вдвое дешевле. GPT-5.6 Terra позиционируется как более доступный вариант, который соответствует GPT-5.5 по результатам тестов интеллекта при вдвое меньшей цене, а Luna представлена как самая быстрая и недорогая модель семейства — её стоимость на 80% ниже, чем у Sol. Эти уровни призваны предоставить пользователям разные варианты соотношения интеллекта, скорости и цены, а не вынуждать их поручать каждую задачу самой крупной модели. Компания связывает достигнутые улучшения с согласованной оптимизацией на трёх уровнях: самих моделей, инфраструктуры инференса, формирующей их ответы, и агентной обвязки, используемой Codex и ChatGPT Work. **Ключевое утверждение OpenAI заключается в том, что GPT-5.6 демонстрирует лучшую на сегодняшний день эффективность интеллекта на токен, научившись выполнять больше полезной работы с каждым токеном.** Во время обучения компания оптимизирует как успешное выполнение задач, так и экономичность рассуждений, побуждая модель следовать более прямым путём вместо того, чтобы тратить вычислительные ресурсы на ненужную промежуточную работу. OpenAI считает эффективность необходимым условием широкой доступности передового ИИ, особенно после того, как за четыре года её системы масштабировались до одного миллиарда активных пользователей и более чем двух миллионов компаний. Компания связывает эту работу со своей заявленной миссией — обеспечить, чтобы искусственный общий интеллект приносил пользу человечеству. На практике она стремилась повышать производительность в каждой точке кривой соотношения стоимости и интеллекта, чтобы рост спроса не приводил напрямую к пропорциональному увеличению требований к оборудованию и расходов на обслуживание. Инфраструктурная задача выходит далеко за рамки эффективности отдельно взятой модели. Инференс — процесс запуска обученной модели для формирования ответов — должен позволять обрабатывать больше токенов на том же оборудовании без ущерба для интеллекта, времени отклика, доступности и надёжности. Теоретически эффективная модель может оставаться дорогой в промышленной эксплуатации, если запросы маршрутизируются неудачно, ускорители простаивают, кэшированные вычисления не используются или избыточное перемещение данных мешает GPU выполнять полезные арифметические операции. Поэтому OpenAI рассматривает эффективность как свойство всей системы, создаваемое множеством взаимно усиливающих улучшений. Эти улучшения охватывают маршрутизацию запросов, планирование, GPU-ядра, кэширование, реализацию моделей и порядок операций, выполняемых на ускорителях. Агентный уровень также вносит свой вклад, контролируя чрезмерно разросшийся контекст, эффективнее используя инструменты и избегая повторной работы. OpenAI отмечает, что отдельные изменения могут казаться незначительными, однако их эффект накапливается по всей цепочке обслуживания. **Ещё одно примечательное утверждение заключается в том, что GPT-5.6 Sol, работая через Codex, автономно помогла обнаружить и внедрить несколько оптимизаций, используемых для запуска самого семейства моделей.** Балансировка нагрузки — один из основных примеров. На глобальном уровне OpenAI маршрутизирует запросы с учётом географического положения, доступных мощностей и типа ускорителя, способного запустить модель. Внутри вычислительного кластера работа распределяется между экземплярами модели на основе таких факторов, как текущая нагрузка, длина входного контекста, наличие пригодных для повторного использования кэшированных данных и другие характеристики запроса. Затем внутри отдельного экземпляра вычисления необходимо эффективно распределить между ускорителями, подсетями модели и вычислительными ядрами. Недостатки на любом из этих уровней могут создавать узкие места или приводить к недоиспользованию дорогостоящего оборудования. По данным OpenAI, GPT-5.6 Sol в Codex анализирует реальный производственный трафик, выявляет ранее незамеченные дисбалансы, оценивает альтернативные стратегии маршрутизации и постоянно помогает настраивать правила распределения. Компания утверждает, что одни лишь улучшения балансировки нагрузки привели к резкому снижению затрат на обслуживание модели, хотя в предоставленном тексте не указано конкретное процентное значение для этой части работы. Это показывает, что эксплуатационные изменения вокруг модели могут быть столь же экономически значимыми, как изменения в её архитектуре или обучении. Модель также участвовала в оптимизации прямого прохода — последовательности вычислений, преобразующей входные данные в прогнозы для следующего токена. Даже когда отдельные математические операции выполняются быстро, неэффективная организация памяти, задержки синхронизации и ненужное перемещение данных могут заставлять GPU простаивать. OpenAI сообщает, что Sol выявила вычисления, которые можно выполнять заранее, исключить или запускать параллельно. Затем с помощью Codex она автономно переписала и оптимизировала промышленные ядра — низкоуровневые программы, отвечающие за выполнение математических операций модели на GPU. OpenAI связывает эту возможность с обучением GPT-5.6 написанию и совершенствованию ядер на Triton и Gluon — двух языках программирования GPU с открытым исходным кодом, поддерживаемых компанией. Сообщается, что эта работа вместе с более масштабными улучшениями ядер, приписываемыми Sol, снизила совокупные затраты на обслуживание на 20%. Поскольку агрессивная низкоуровневая оптимизация может незаметно изменить численное поведение, OpenAI также вложилась в системы верификации. Один из примеров — FpSan, или Floating-Point Sanitizer, инструмент с открытым исходным кодом, используемый для проверки корректности созданных моделью ядер. Наконец, в публикации представлено спекулятивное декодирование как ещё один способ повысить скорость и эффективность. Этот метод обычно направлен на ускорение генерации токенов за счёт предварительного предложения результатов, которые можно проверить с меньшими затратами, чем при генерации каждого токена через полный процесс, однако предоставленный источник обрывается до объяснения конкретной реализации OpenAI или описания её результатов. **В совокупности раскрытые сведения представляют GPT-5.6 не только как более экономичное семейство моделей, но и как инженерного агента, который помог снизить стоимость инфраструктуры, на которой оно работает.**

Почему это важно

  • Семейство предлагает несколько уровней интеллекта, скорости и цены, потенциально делая передовой ИИ экономически доступным для более широкого спектра задач.
  • По данным OpenAI, маршрутизация с помощью моделей и оптимизация ядер GPU снизили инфраструктурные расходы, в том числе обеспечили сквозную экономию в 20% благодаря работе над ядрами.
  • Как сообщается, GPT-5.6 Sol помог оптимизировать собственный производственный стек через Codex, продемонстрировав практический цикл обратной связи между ИИ-агентами и ИИ-инфраструктурой.

Ключевые факты

  • Как сообщается, GPT-5.6 Sol превосходит Claude Fable 5 в рейтинге Artificial Analysis Coding Agent Index при стоимости менее чем вдвое ниже.
  • Утверждается, что Terra соответствует GPT-5.5 по показателям интеллектуальных тестов при вдвое меньшей цене, а Luna стоит на 80% дешевле Sol.
  • Программа повышения эффективности охватывает обучение моделей, инфраструктуру инференса и агентную обвязку, используемую Codex и ChatGPT Work.
  • Sol помог анализировать производственный трафик, настраивать балансировку нагрузки и переписывать ядра GPU на Triton и Gluon.
  • Как сообщается, оптимизация ядер и связанных с ними прямых проходов снизила сквозные затраты на обслуживание на 20%, а FpSan использовался для проверки корректности.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы