Meta выпустила мультимодальную ИИ-модель Muse Glimmer с открытым исходным кодом для локального запуска
Meta выпустила Muse Glimmer — мультимодальную модель с открытым исходным кодом, предназначенную для локального запуска и работы с текстом, изображениями и видео без звука. Её плотная архитектура насчитывает 30 миллиардов параметров, включая крупный визуальный энкодер на 2 миллиарда параметров, который обрабатывает изображения и видеокадры в рамках единой системы. Языковой компонент чередует локальное внимание, сосредоточенное на соседних токенах, с полным вниманием, позволяющим учитывать информацию во всём входном контексте. Механизм grouped-query attention снижает требования модели к оперативной памяти и может ускорить и удешевить генерацию. Опциональная вспомогательная модель DFlash использует спекулятивное декодирование — то есть заранее подготавливает вероятный результат, — чтобы ускорить выполнение структурированных задач, таких как программирование, ценой дополнительного потребления памяти. Muse Glimmer умеет отвечать на вопросы о визуальном контенте, находить объекты и выбирать инструменты на основе изображения. Поддержка с первого дня доступна в Transformers и llama.cpp, также предусмотрены интеграции с vLLM и Inference Endpoints. Один и тот же код Transformers поддерживает ускорители NVIDIA, AMD и Intel.
Почему это важно
- —Модель объединяет работу с текстом, изображениями, видео и инструментами в одной открытой системе, которую разработчики могут запускать на собственном оборудовании.
- —Поддержка ускорителей NVIDIA, AMD и Intel делает локальный мультимодальный ИИ доступным на более широком спектре устройств.
- —Опциональный спекулятивный декодер может ускорить генерацию структурированного вывода, например кода, однако требует дополнительной памяти.
Ключевые факты
- Muse Glimmer — плотная модель с 30 миллиардами параметров и визуальным энкодером на 2 миллиарда параметров.
- Один визуальный энкодер обрабатывает как изображения, так и видео — с целевой частотой два кадра в секунду и выборкой до 96 кадров.
- Языковая модель состоит из 52 слоёв и чередует три слоя внимания со скользящим окном с одним слоем полного внимания.
- Внимание с группировкой запросов распределяет каждую пару голов ключей и значений между 16 головами запросов, сокращая требования к памяти KV-кэша.
- Поддержка с первого дня включает Transformers и llama.cpp, а также опциональное спекулятивное декодирование DFlash.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.