New-ZZZ
RU / EN

Meta выпустила мультимодальную ИИ-модель Muse Glimmer с открытым исходным кодом для локального запуска

Р
Редакция New-ZZZ
Hugging Face Blog · 2 дня назад

Meta выпустила Muse Glimmer — мультимодальную модель с открытым исходным кодом, предназначенную для локального запуска и работы с текстом, изображениями и видео без звука. Её плотная архитектура насчитывает 30 миллиардов параметров, включая крупный визуальный энкодер на 2 миллиарда параметров, который обрабатывает изображения и видеокадры в рамках единой системы. Языковой компонент чередует локальное внимание, сосредоточенное на соседних токенах, с полным вниманием, позволяющим учитывать информацию во всём входном контексте. Механизм grouped-query attention снижает требования модели к оперативной памяти и может ускорить и удешевить генерацию. Опциональная вспомогательная модель DFlash использует спекулятивное декодирование — то есть заранее подготавливает вероятный результат, — чтобы ускорить выполнение структурированных задач, таких как программирование, ценой дополнительного потребления памяти. Muse Glimmer умеет отвечать на вопросы о визуальном контенте, находить объекты и выбирать инструменты на основе изображения. Поддержка с первого дня доступна в Transformers и llama.cpp, также предусмотрены интеграции с vLLM и Inference Endpoints. Один и тот же код Transformers поддерживает ускорители NVIDIA, AMD и Intel.

Почему это важно

  • Модель объединяет работу с текстом, изображениями, видео и инструментами в одной открытой системе, которую разработчики могут запускать на собственном оборудовании.
  • Поддержка ускорителей NVIDIA, AMD и Intel делает локальный мультимодальный ИИ доступным на более широком спектре устройств.
  • Опциональный спекулятивный декодер может ускорить генерацию структурированного вывода, например кода, однако требует дополнительной памяти.

Ключевые факты

  • Muse Glimmer — плотная модель с 30 миллиардами параметров и визуальным энкодером на 2 миллиарда параметров.
  • Один визуальный энкодер обрабатывает как изображения, так и видео — с целевой частотой два кадра в секунду и выборкой до 96 кадров.
  • Языковая модель состоит из 52 слоёв и чередует три слоя внимания со скользящим окном с одним слоем полного внимания.
  • Внимание с группировкой запросов распределяет каждую пару голов ключей и значений между 16 головами запросов, сокращая требования к памяти KV-кэша.
  • Поддержка с первого дня включает Transformers и llama.cpp, а также опциональное спекулятивное декодирование DFlash.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы