Новый метод RL: как обучать AI-агентов на множестве сред
Исследователи из Hugging Face и команда @adithya_s_k представили передовое руководство по многоуровневому обучению с подкреплением (RL), которое кардинально меняет подход к тренировке AI-агентов.
Вместо того чтобы напрямую модифицировать тестовое окружение, авторы разработали инновационный метод с использованием «прокси». Этот прокси-слой перехватывает точные идентификаторы токенов и логиты (logprobs), которые генерирует модель (например, vLLM), независимо от того, какой API используется кодовыми агентами (OpenAI, Anthropic, Gemini).
Это позволяет обучать агентов на данных, полученных из множества тестовых сред, без необходимости изменения базового кода. Результаты показали, что модель LFM2.5-2.6B улучшилась с 42% до 54%, а OpenCode — с 34% до 58%.
Кроме того, авторы доказали, что простое дообучение на успешных запусках крупной модели (Qwen3.8-27B) менее эффективно, чем структурированный подход RL. Ключевым выводом является то, что практический, многоуровневый подход превосходит простое копирование весов.
Почему это важно
- —Представлен практичный и открытый фреймворк для многоуровневого RL, который значительно повышает эффективность обучения AI-агентов.
- —Метод с использованием «прокси» позволяет собирать данные из разных API и тестовых окружений без изменения базового кода агента.
- —Результаты демонстрируют, что структурированное обучение (RL) намного эффективнее, чем простое дообучение на успешных кейсах.
Ключевые факты
- Модель LFM2.5-2.6B улучшилась с 42% до 54% после обучения на 4 тестовых окружениях.
- Внедрение прокси-слоя позволяет захватывать точные идентификаторы токенов и logprobs из разных API (OpenAI, Anthropic и др.).
- Обучение на множестве сред повысило точность агентов и сократило количество вызовов инструментов на 31%.
- Авторы доказали, что имитация обучения на базе крупной модели (Qwen3.8-27B) менее эффективна, чем специализированный RL-подход.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.