Google DeepMind выпустила мультимодальную модель встраиваний для устройств
Google DeepMind представила EmbeddingGemma 2 — первую нативно мультимодальную открытую модель для создания встраиваний (embeddings), предназначенную для работы непосредственно на устройстве.
Модель значительно расширяет возможности векторного поиска, поскольку объединяет в единое математическое пространство не только текст, но и код, изображения, аудио и видео. Это позволяет создавать гораздо более комплексные и точные системы поиска.
EmbeddingGemma 2 имеет всего 740 миллионов параметров, что делает её чрезвычайно компактной и эффективной для девайсов. При этом она демонстрирует высокую конкурентоспособность, превосходя по бенчмаркам некоторые специализированные модели, которые значительно крупнее.
Разработчики могут использовать эту модель для добавления мультимодального поиска в свои приложения, например, для поиска конкретных моментов в видео или аудиоматериалах.
Почему это важно
- —Позволяет создавать мультимодальный поиск, который работает с разными типами данных (видео, аудио, код).
- —Оптимизирована для работы на устройстве (on-device), что повышает скорость и конфиденциальность.
- —Сочетает высокую производительность с компактным размером (740 млн параметров), что является техническим прорывом.
Ключевые факты
- Это первая нативно мультимодальная открытая модель для встраиваний.
- Поддерживает кодирование, изображения, аудио и видео в едином пространстве.
- Модель имеет 740 миллионов параметров.
- Оптимизирована для развертывания на периферийных устройствах.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.