New-ZZZ
RU / EN
Бенчмарки 29 июля 2026

Настройки API почти втрое улучшили результат GPT-5.6 Sol

Р
Редакция New-ZZZ
X @OpenAI · 1 неделю назад

GPT-5.6 Sol столкнулся с трудностями в ARC-AGI-3 — тесте, где модели должны без инструкций осваивать незнакомые двумерные игры. Расследование показало, что проблема была связана не только с возможностями модели, но и с устройством тестовой среды: после каждого хода она отбрасывала рассуждения, а по мере заполнения контекста удаляла историю действий.

OpenAI создала новую тестовую оболочку на базе Responses API и включила сохранение рассуждений вместе со сжатием контекста. Благодаря этому модель смогла использовать накопленный опыт вместо постоянного повторного анализа. Результат на публичном наборе ARC-AGI-3 вырос на 188%, а расход выходных токенов сократился в шесть раз.

Эксперимент показывает, что оценка в бенчмарке зависит не только от самой модели, но и от настроек API, структуры тестовой оболочки и способа формирования запросов. Для долго работающих ИИ-агентов особенно важно сохранять рассуждения и компактно вести контекст.

Почему это важно

  • Результаты ИИ-бенчмарков могут заметно зависеть от тестовой среды и настроек API, а не только от возможностей модели.
  • Сохранение рассуждений помогает долго работающим агентам использовать накопленный опыт.
  • Сжатие контекста одновременно повысило качество прохождения теста и сократило расход токенов.

Ключевые факты

  • ARC-AGI-3 проверяет способность моделей осваивать незнакомые двумерные игры без инструкций.
  • Стандартная среда удаляла рассуждения после каждого хода и постепенно очищала историю действий.
  • OpenAI включила сохранение рассуждений и сжатие контекста через Responses API.
  • Результат GPT-5.6 Sol на публичном наборе вырос на 188%.
  • Модель использовала в шесть раз меньше выходных токенов.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы