New-ZZZ
RU / EN
Модели ИИ 7 октября 2026

Открытые мультимодальные модели принятия решений устанавливают новые стандарты эффективности для Edge AI

Р
Редакция New-ZZZ
Hugging Face Blog · 3 часа назад

Релиз представляет новое поколение открытых моделей принятия решений с мультимодальностью и открытыми весами: d1-3B и d1-omni-600M. Они разработаны специально для высокоскоростного структурированного принятия решений, особенно оптимизированы для развертывания на периферийных устройствах (edge devices). Эти модели представляют собой значительный архитектурный отход от традиционных больших языковых моделей (LLMs) или систем генеративного ИИ. В отличие от генеративных моделей, которые работают путем прогнозирования и создания последовательностей токенов (процесс, который может быть вычислительно интенсивным и последовательным), эти модели принятия решений функционируют путем выполнения одного эффективного прямого прохода (forward pass). Это фундаментальное различие позволяет им предоставлять прямые, структурированные ответы на сложные запросы, что делает их исключительно быстрыми и надежными для приложений реального времени.

Основная сила этих моделей заключается в их способности обрабатывать несколько типов данных — мультимодальность — при сохранении удивительно малого количества параметров, что позволяет им достигать передовых результатов даже на аппаратуре с ограниченными ресурсами.

Представлены две отдельные модели: d1-3B и d1-omni-600M. Модель d1-3B построена на основе архитектуры LFM2.5-VL-3B, которая описывается как Vision-Language Model (VLM) с декодером. Эта архитектура позволяет d1-3B принимать и обрабатывать входные данные, сочетающие текст и изображения. В то время как модель d1-omni-600M использует другую, очень универсальную основу: LFM2.5-Encoder-350M. Эта основа является двунаправленным кодировщиком (bidirectional encoder) — типом архитектуры нейронной сети, известной своей способностью обрабатывать контекст в обоих направлениях (слева направо и справа налево), что критически важно для глубокого понимания. Важно отметить, что d1-omni-600M разработана для еще более широкого мультимодального ввода, принимая либо комбинацию текста и изображений, либо, альтернативно, комбинацию текста и аудио. Отмечается, что d1-omni-600M в настоящее время находится на стадии раннего исследовательского релиза, что указывает на продолжающуюся разработку и доработку.

Для проверки своих возможностей разработчики провели бенчмаркинг обеих моделей, d1-3B и d1-omni-600M, на семи различных публичных наборах данных. Эти наборы данных охватывают широкий спектр задач ИИ в реальном мире, включая понимание прочитанного (reading comprehension), обнаружение токсичности (идентификация вредоносного контента), классификацию намерений (определение цели пользователя), медицинский вопрос-ответ (QA) и межъязыковое понимание (понимание смысла в разных языках). Результаты демонстрируют превосходную производительность: d1-3B достигла среднего балла 82,9, установив самый высокий балл среди протестированных сравнений и превзойдя даже производительность модели Decider 4B. d1-omni-600M набрала 78,4, что очень впечатляет, поскольку она превосходит балл модели Decider 2B (77,1), содержа при этом только четверть параметров. Этот прирост эффективности — высокая производительность при минимальном размере — является ключевым преимуществом для периферийных вычислений (edge computing).

Помимо общих бенчмарков, модели были проверены на предмет их специфической мультимодальной удержания. Было подтверждено, что d1-3B сохраняет надежные возможности обработки изображений, присущие ее основе LFM2.5-VL-3B, при тестировании на стандартных визовых бенчмарках. Аналогично, d1-omni-600M успешно справляется с интеграцией всех трех модальностей (текст, изображение и аудио). В отчете признается, что хотя Decision Index v0.3 включает частный визовый сплит, комплексные бенчмарки аудио-решений остаются открытой исследовательской проблемой, что является необходимым предупреждением для пользователей.

Развертывание и эффективность являются центральными элементами этого релиза. Модели были оценены в сотрудничестве с NVIDIA на различных аппаратных платформах, включая высокопроизводительный графический процессор NVIDIA GeForce RTX 4090 и различные встраиваемые системы Jetson (AGX Thor, AGX Orin и Orin Nano). Метрики производительности подчеркивают исключительную скорость d1-3B, особенно в сценариях периферийного вывода (edge inference). На периферии d1-3B может ответить на один вопрос менее чем за 50 миллисекунд на всех измеренных устройствах Jetson. Более того, скорость масштабируется эффективно: обработка трех вопросов занимает всего в 1,3 раза больше времени, чем один вопрос, при этом продвинутый AGX Thor демонстрирует впечатляльный скачок с 16 мс до всего 20 мс. При развертывании на мощной GPU-инфраструктуре d1-3B сохраняет свою скорость, отвечая на один вопрос менее чем за 10 миллисекунд и обрабатывая изображение 384px менее чем за 18 миллисекунд на обеих протестированных GPU-платформах. Эта комбинация низкой задержки и высокой точности делает модели идеальными для критически важных, работающих в реальном времени приложений.

Таким образом, модели d1 позиционируются как идеальное решение, когда требуется быстрое, структурированное и мультимодальное принятие решений. d1-3B выделяется за предоставление самой высокой качества решений относительно своего размера, что делает его мощным универсальным выбором. Напротив, d1-omni-600M специально рекомендуется для сценариев, где физический размер и количество параметров являются наиболее критическими ограничивающими факторами. Обе модели открыто доступны в качестве моделей с открытыми весами на Hugging Face, что способствует широкому внедрению и исследованиям, а разработчики предоставили необходимый код и документацию для немедленного использования.

Почему это важно

  • —Они фундаментально меняют парадигму от генеративного предсказания токенов к принятию решений за один проход, обеспечивая более быстрые и надежные приложения в реальном времени.
  • —Модели достигают передовых результатов (например, средний балл d1-3B — 82,9) при сохранении крайне малого количества параметров, что делает их идеальными для ресурсоограниченных периферийных устройств.
  • —Мультимодальная возможность (текст, изображение и аудио) в сочетании с низкой задержкой делает их очень ценными для сложных систем восприятия и принятия решений в реальном мире.

Ключевые факты

  • d1-3B и d1-omni-600M — это модели принятия решений, которые используют один прямой проход, в отличие от генеративных моделей, которые производят токены.
  • d1-3B достигает самого высокого среднего балла (82,9) на семи публичных мультимодальных наборах данных, превосходя конкурентов, таких как Decider 4B.
  • Модели демонстрируют исключительную эффективность на периферии: d1-3B отвечает на один вопрос менее чем за 50 мс на Jetson AGX Thor.
  • d1-omni-600M — это высокоэффективная мультимодальная модель, которая набирает 78,4 балла, используя при этом только четверть параметров по сравнению с конкурентной моделью.
  • Обе модели имеют открытые веса и доступны на Hugging Face для немедленного использования.
Читать первоисточник →

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы