New-ZZZ
RU / EN
LLM 1 октября 2026

Запуск Olmo-core 3: Новая инфраструктура для MoE-моделей с триллионными параметрами

Р
Редакция New-ZZZ
Hugging Face Blog · 14 часов назад

Выпуск Olmo-core 3 знаменует собой крупный прорыв в инфраструктуре, необходимой для обучения массивных, передовых Больших языковых моделей (LLMs), в частности тех, которые используют архитектуру Mixture-of-Experts (MoE). Эта новая система разработана для преодоления значительных вычислительных и логистических препятствий, связанных с масштабированием моделей MoE до диапазона триллионов параметров, обеспечивая при этом доступность и вычислительную эффективность передовой разработки моделей. Основная проблема, которую решает Olmo-core 3, — это присущая неэффективность, возникающая при масштабировании моделей MoE. Хотя модели MoE по своей природе эффективны, поскольку для любого заданного входного токена активируется только небольшая подмножество параметров («эксперты»), огромный общий размер модели — который все равно должен храниться и управляться в кластере GPU — вносит существенные накладные расходы на связь и координацию. По мере роста числа потенциальных экспертов эти коммуникационные затраты могут быстро подорвать вычислительное преимущество, которое предоставляют модели MoE, что затрудняет масштабирование.

Olmo-core 3 решает это узкое место масштабирования путем внедрения высокооптимизированной и переработанной системы обучения. Ключевой демонстрацией его возможностей является способность резко увеличить размер пула экспертов — в одном из бенчмарков, увеличив его с 8 до 128 экспертов — при сохранении стабильного, низкого числа активных параметров на токен, которое оставалось фиксированным на уровне приблизительно 3,2 миллиарда параметров. Что особенно важно, этот массивный рост общей емкости модели, с 4,6 миллиарда до 47 миллиардов параметров, был достигнут с минимальной деградацией пропускной способности обучения, падением менее чем на 5%. Эта стабильность при экспоненциальном росте является самым критическим прорывом, позволяющим отрасли заниматься моделями беспрецедентного масштаба.

С технической точки зрения, фреймворк представляет собой значительную эволюцию по сравнению с предыдущими итерациями. Более ранние реализации MoE часто полагались на Fully Sharded Data Parallelism (FSDP) — метод, который собирает и перераспределяет веса модели для каждой небольшой порции обучающих данных. Olmo-core 3 совершает ключевой переход к системе, основанной на Distributed Data Parallelism (DDP). Это изменение фундаментально, поскольку DDP позволяет специализированным экспертам оставаться непосредственно на GPU. Сохраняя экспертов локализованными, система избегает дорогостоящего и времязатратного процесса многократного сбора и перераспределения всех весов модели для каждого шага обучения, тем самым резко повышая эффективность и снижая задержку.

Кроме того, Olmo-core 3 интегрирует и оптимизирует несколько передовых методов параллелизации для управления огромным размером модели в нескольких кластерах GPU. К этим методам относятся Expert Parallelism, который распределяет весь пул экспертов по различным GPU, чтобы ни один отдельный GPU не должен хранить всю модель. Pipeline Parallelism разделяет последовательные слои модели — последовательные вычислительные этапы, преобразующие входные данные — между группами GPU, тем самым снижая нагрузку на память любого отдельного устройства. Наконец, Distributed Optimizer распределяет состояние оптимизатора (вспомогательные данные, используемые для расчета обновления весов во время обучения) по GPU, не позволяя ни одному GPU хранить полную копию этого состояния. Синергия этих трех методов параллелизации позволяет архитектуре MoE эффективно масштабироваться без требования, чтобы каждое аппаратное обеспечение хранил всю модель и связанное с ней состояние обучения в памяти.

Помимо основных стратегий параллелизации, Olmo-core 3 вводит несколько специализированных оптимизаций, которые тонко настраивают поток данных и процесс вычислений. Одной из таких оптимизаций является Rowwise Expert Parallelism, разработанный для размещения маршрутизированных данных непосредственно в буферы ввода эксперта. Это минимизирует необходимость сложной перестановки данных, что является основным источником вычислительных потерь. Другое улучшение — это GPU-resident routing, который хранит метаданные, связанные с маршрутизацией данных, непосредственно на GPU. Это не позволяет ЦП ждать копирования этой критически важной информации туда-обратно, оптимизируя весь рабочий процесс. Кроме того, фреймворк включает Grouped GEMM (General Matrix Multiplication) — технику, которая группирует несколько небольших вычислений экспертов вместе, позволяя GPU выполнять их высокоэффективным, пакетным способом, максимизируя использование оборудования.

Еще одно крупное улучшение — поддержка MXFP8, формата чисел с более низкой точностью. Этот формат представляет числовые значения, используя меньше бит, чем стандартные форматы, такие как BF16. Хотя использование более низкой точности вносит потенциальные затраты на преобразование, экономия в вычислениях и, что критически важно, сокращение объема данных, которые необходимо перемещать между GPU, часто перевешивает эти затраты. В контролируемых бенчмарках включение MXFP8 привело к значительному увеличению общей пропускной способности обучения на 21% по сравнению с базовым уровнем BF16. Одновременно значительно снизилась пиковая требуемая активная память: с 103 GiB до 95 GiB. Этот прирост эффективности в первую очередь обусловлен оптимизацией прямого прохода вычислений и перемещения данных между экспертами, а не только опорой на механизм внимания.

На практике прирост производительности ошеломляет. В предварительном тесте, проведенном на восьми GPU NVIDIA B300, новый стек Olmo-core 3 смог обрабатывать 52 000 токенов в секунду на GPU при работе с MoE на 47 миллиардов параметров. Это представляет собой огромное улучшение — примерно в 2,7 раза быстрее — по сравнению с 19 400 токенов в секунду на GPU, достигнутыми с использованием предыдущей реализации фреймворка на основе FSDP. Этот резкий рост пропускной способности закрепляет Olmo-core 3 в качестве фундаментального инструмента, который значительно снижает барьер входа для разработки и обучения следующего поколения массивных, высокоэффективных моделей ИИ. Непрерывное развитие фреймворка, основанное на более ранних работах, таких как OlmoE (который использовал MoE с 64 экспертами) и Olmo 3 (который использовал плотную архитектуру), позиционирует его как комплексную, масштабируемую и высокооптимизированную обучающую платформу для будущего LLMs.

Почему это важно

  • —Значительно снижает вычислительный барьер для разработки LLM с триллионными параметрами за счет оптимизации масштабирования MoE.
  • —Переход от FSDP к DDP резко повышает пропускную способность и эффективность обучения, удерживая экспертов в памяти GPU.
  • —Интеграция передовых методов, таких как MXFP8 и специализированные методы распараллеливания, максимизирует использование оборудования и уменьшает потребление памяти.

Ключевые факты

  • Olmo-core 3 масштабирует обучение MoE до диапазона триллионных параметров.
  • Он увеличил пул экспертов с 8 до 128, сохраняя при этом стабильное количество активных параметров (~3.2B).
  • Новый стек достиг пропускной способности в 2,7 раза выше (52 000 токенов/сек/GPU) по сравнению с предыдущей реализацией на MoE с 47B.
  • Поддержка MXFP8 повысила пропускную способность обучения на 21% и снизила пиковое активное потребление памяти с 103 GiB до 95 GiB.
Читать первоисточник →

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы