New-ZZZ
RU / EN

OpenAI улучшает кэширование GPT-6 для более быстрых и дешевых AI-агентов

Р
Редакция New-ZZZ
OpenAI Blog · 6 дней назад

OpenAI объявила о значительном обновлении своей системы кэширования промптов для семейства моделей GPT-6 — крупное улучшение, разработанное специально для повышения производительности, надежности и экономической эффективности постоянных AI-агентов. Эти продвинутые агенты способны выполнять сложные многоэтапные задачи — от комплексного рефакторинга кода во всей кодовой базе до генерации высокодетализированных, хорошо исследованных документов и профессиональных презентаций. Основная проблема, которую решает это обновление, заключается в природе рабочих процессов агентов: это не отдельные, изолированные запросы, а непрерывная серия вызовов API, которые строятся друг на друге. Крайне важно, что эти последовательные вызовы часто передают идентичные или очень похожие инструкции, определения инструментов и контекстную информацию из предыдущих итераций. Исторически OpenAI использовала кэширование для хранения и повторного использования этого общего контекста, что значительно сокращало время ответа и предлагало разработчикам существенную экономию средств, иногда скидки до 90% на входные токены, которые были успешно закэшированы. Новая система основывается на этой базе, обеспечивая более высокие показатели попадания в кэш (cache hit rates) по умолчанию, и вводит мощный финансовый стимул: теперь предоставляются скидки на кэш за соответствующие общие префиксы, которые повторно используются в течение 30-минутного временного окна. Этот акцент на максимизации попаданий в кэш и предоставлении гранулированных экономических стимулов коренным образом меняет то, как разработчики могут проектировать долгосрочные, дорогостоящие AI-приложения.

Чтобы дать разработчикам возможность в полной мере использовать эти расширенные возможности кэширования, OpenAI запустила несколько сложных инструментов мониторинга и диагностики. Новая Панель управления кэшированием промптов (Prompt Caching Dashboard) является центральным узлом, который предоставляет разработчикам глубокую видимость того, какая часть входных данных их приложения обслуживается непосредственно из кэша. Пользователи могут отслеживать показатели попадания в кэш в течение длительных периодов и использовать диаграмму состава входных данных (input composition chart). Эта диаграмма бесценна, поскольку она позволяет разработчикам визуально сравнить долю токенов, которые были закэшированы, с долей тех, которые не были закэшированы. Такой уровень гранулярного отслеживания позволяет командам проактивно выявлять любые неожиданные падения показателей попадания в кэш, позволяя им точно оценить, как изменения, внесенные в логику или входные данные их приложения, могут негативно повлиять на общую производительность кэширования. Более того, когда разработчик сталкивается с неожиданным промахом кэша (cache miss) — неспособностью повторно использовать закэшированный контекст — в дело вступает специализированный инструмент диагностики кэширования промптов. Этот инструмент разработан как высококриминалистический, позволяя пользователю сравнить неудачный запрос с недавним успешным ответом. Таким образом, разработчик может точно определить причину сбоя, выяснив, связано ли это с изменениями в самой модели, модификациями доступных инструментов, изменениями в настройках или тонкими изменениями во входном промпте. Система даже предоставляет оценку количества затронутых токенов, давая разработчику четкую меру потенциального воздействия и направляя его на необходимые оптимизации для максимизации будущего повторного использования кэша.

Помимо простого мониторинга, обновление предоставляет разработчикам беспрецедентный контроль над механизмом кэширования. Ключевой функцией является введение явных точек останова кэша (explicit cache breakpoints). Эти точки останова позволяют разработчикам принимать осознанные архитектурные решения о том, какие именно префиксы промптов они хотят, чтобы модель повторно использовала в нескольких запросах. Сопутствующее руководство подробно описывает, как реализовать эти точки останова, как долго закэшированные префиксы остаются пригодными для повторного использования и, что критически важно, как изменения в доступных инструментах или входных данных могут повлиять на долговечность и пригодность закэшированного контекста. Такой уровень контроля превращает кэширование из пассивного преимущества в активный, программируемый компонент архитектуры приложения. Кроме того, OpenAI решила распространенный сценарий, когда агенту необходимо скорректировать свой внутренний мыслительный процесс, не теряя накопленного контекста. В моделях GPT-6 разработчики теперь могут регулировать «усилие рассуждения» (reasoning effort) между ответами. Это означает, что разработчик может решить повысить уровень усилий для особенно сложной задачи — требующей более глубокого, комплексного мышления — или понизить его для простого последующего запроса. Эта корректировка достигается путем добавления конкретного configuration_update, при этом уровень рассуждения на уровне запроса остается неизменным, что позволяет модели адаптировать свою когнитивную нагрузку, сохраняя при этом ценный, повторно используемый контекст, хранящийся в кэше. Эта возможность отделить усилие рассуждения от сохранения контекста — это огромный шаг вперед в создании сложных, поддерживающих состояние агентов.

Чтобы гарантировать, что кэш остается надежным даже по мере эволюции операционных требований агента, OpenAI предоставила лучшие практики по сохранению целостности кэша при изменении инструментов и инструкций. Когда меняются потребности агента в использовании инструментов — например, если ему требуется новый API или если обновляется схема существующего инструмента — разработчик должен предпринять упреждающие шаги, чтобы сохранить стабильность определений инструментов, схем и общего порядка. Вместо полного удаления определений инструментов, что нарушило бы кэш, разработчикам следует использовать параметр allowed_tools, чтобы ограничить модель только инструментами, актуальными для текущей задачи, или установить tool_choice в none, когда инструменты не требуются. Для управления развивающимися инструкциями система рекомендует использовать новые сообщения разработчика, добавленные в конец контекста. Эта техника позволяет разработчикам вводить новые, переопределяющие инструкции, не делая недействительными более старые, основополагающие инструкции, которые все еще необходимы для основной функциональности агента. Наконец, чтобы минимизировать воспринимаемую задержку для конечного пользователя, OpenAI ввела концепцию «предварительного прогрева» (prewarming). Предварительный прогрев позволяет приложению проактивно подготовить и загрузить известный контекст — такой как общие инструкции, основные определения инструментов или основополагающий справочный материал — во время этапа запуска приложения, до того, как пользователь отправит свой первый запрос. Вынося это необходимое время обработки за пределы окна ожидания пользователя, модель может начать отвечать гораздо раньше, когда поступает фактический запрос, значительно улучшая воспринимаемую скорость и отзывчивость всей системы. Эти необязательные, но мощные элементы управления позволяют разработчикам тонко настроить механизм кэширования, чтобы он идеально соответствовал уникальным требованиям и шаблонам рабочей нагрузки их конкретных AI-приложений, выходя за рамки производительности по умолчанию движка для достижения оптимальной, индивидуальной эффективности.

Почему это важно

  • —Значительно снижает эксплуатационные расходы на запуск сложных многоэтапных AI-агентов за счет максимального повторного использования контекста.
  • —Предоставляет разработчикам расширенные диагностические инструменты для выявления и устранения сбоев кэша, повышая надежность.
  • —Вводит детальный контроль над сохранением контекста, позволяя агентам адаптировать усилия рассуждения и набор инструментов без потери накопленной памяти.

Ключевые факты

  • Новая система по умолчанию предлагает более высокий коэффициент попадания в кэш и предоставляет скидки на общие префиксы, повторно используемые в течение 30 минут.
  • Разработчики получают доступ к Панели управления кэшированием промптов (Prompt Caching Dashboard) и диагностическому инструменту для мониторинга и устранения неполадок производительности кэша.
  • Новые элементы управления позволяют регулировать «усилия рассуждения» модели между ответами без нарушения повторно используемого контекста.
  • Возможность «предварительной загрузки» (prewarm) кэша означает, что необходимый контекст может быть загружен во время запуска, снижая воспринимаемую пользователем задержку.
Читать первоисточник →

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы