Память ИИ-агентов необходимо калибровать под их модель
Предоставление ИИ-агенту памяти о его предыдущей работе кажется очевидным улучшением: собрать всё, чему он научился, включить эти уроки в промпт и позволить опыту направлять будущие решения. Однако оценка ALTK-Evolve на восьми моделях показывает, что в действительности всё сложнее. Память агента работает не как функция, которую можно просто включить или выключить, а скорее как доза, которую необходимо подбирать для каждой модели. При недостаточном объёме рекомендаций полезный опыт может остаться невостребованным, а их избыток способен отвлечь или перегрузить модель, которая не умеет надёжно отделять важные уроки от менее значимых.
ALTK-Evolve формирует такую память без дообучения базовой модели и без привлечения людей для разметки примеров. Сначала агент выполняет задачи, создавая записи о предпринятых шагах и полученных результатах. Затем система анализирует успешные и неудачные попытки, преобразует их в пригодные для повторного использования поведенческие рекомендации и объединяет накопленные уроки. Они могут описывать эффективные стратегии, ошибки, которых следует избегать, или нестандартные ситуации, требующие особого подхода. При выполнении последующей задачи рекомендации добавляются в контекст агента либо целиком, либо в виде небольшой подборки, выбранной с учётом текущей проблемы. Проще говоря, сама модель не меняется — меняются практические советы, которые она получает перед началом работы.
Эксперименты выявили три общие закономерности. Сильные модели, у которых ещё оставался потенциал для улучшения, выигрывали от получения памяти целиком, включая уроки, связанные с редкими пограничными случаями. DeepSeek-V3.2 — модель типа «смесь экспертов» с 671 миллиардом параметров — повысила долю выполненных задач на 9,5 процентного пункта благодаря полному набору самостоятельно сформированных рекомендаций. Модели меньшего размера или с более слабыми возможностями показывали лучшие результаты, когда получали компактный набор надёжных правил и несколько рекомендаций, подобранных специально для каждой задачи. Для gpt-oss-120b такой избирательный метод повысил долю выполненных задач на 16,1 процентного пункта, увеличив расход токенов всего на 5%. Передача всей коллекции рекомендаций дала меньшее улучшение и потребовала примерно на 50% больше токенов.
У третьей группы измеримой пользы не наблюдалось. GLM-5 продемонстрировала выявленную в ходе наблюдений картину «насыщения», хотя исследователи не утверждают, что знают её точную причину. Возможно, модель уже приблизилась к своему пределу на оцениваемых задачах, извлечённые уроки не затрагивали оставшиеся ошибки или модель не смогла их применить. Один лишь размер модели не определяет правильную стратегию работы с памятью. На результат могут влиять потенциал дальнейшего улучшения показателей в бенчмарке, ёмкость контекстного окна, архитектура модели, качество рекомендаций и состав задач.
Практический вывод заключается в том, что командам следует проверять, какой объём сохранённых рекомендаций каждый агент действительно способен использовать, вместо того чтобы автоматически добавлять все накопленные им уроки. Избирательное извлечение может повышать точность, одновременно ограничивая длину промпта и эксплуатационные расходы, а кэширование промптов способно сделать экономически приемлемым в рабочей среде даже использование полного набора рекомендаций. Самая полезная память — не обязательно самая большая; важны объём и форма рекомендаций, соответствующие возможностям модели и стоящей перед ней задаче.
Почему это важно
- —Память агента может существенно повысить успешность выполнения задач, однако оптимальный объём инструкций различается в зависимости от модели.
- —Выборочное извлечение может превосходить полную память, добавляя значительно меньше токенов и снижая затраты в продакшене.
- —Результаты ставят под сомнение предположение, что увеличение объёма знаний о прошлом автоматически повышает возможности агента.
Ключевые факты
- ALTK-Evolve извлекает повторно используемые рекомендации из истории успешного и неудачного выполнения задач агентом, не изменяя веса модели и не требуя разметки человеком.
- DeepSeek-V3.2 повысила успешность выполнения задач на 9,5 процентного пункта, получив полный набор рекомендаций.
- gpt-oss-120b прибавила 16,1 процентного пункта при использовании компактного базового набора и извлечения данных под конкретную задачу — при увеличении расхода токенов всего на 5%.
- Для gpt-oss-120b полный набор рекомендаций обеспечил меньший прирост и потребовал примерно на 50% больше токенов.
- GLM-5 не показала измеримого улучшения при использовании протестированных подходов к памяти.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.