Perplexity AI выпустила мультимодальные модели встраивания для поиска
Perplexity AI представила две новые модели встраивания — pplx-embed-v2-late. Это передовые модели с поздним взаимодействием, которые позволяют извлекать и индексировать не только текст, но и изображения, а также целые страницы, используя единое кросс-модальное пространство.
Традиционные плотные эмбеддинги часто теряют детали при работе с длинными или визуально насыщенными документами. Новые модели решают эту проблему, сохраняя векторное представление для каждого токена (128 измерений) и позволяя искать информацию в PDF, слайдах и сканах без необходимости использования OCR, что сохраняет структуру, таблицы и рисунки.
Модели достигли высоких показателей в различных задачах: на бенчмарке Q2D-Web 9B-модель показала Recall@1000 на уровне 74.8%, а в задаче MADQA (поиск по PDF) — 92.4%, превзойдя конкурентов. Доступность в двух размерах (9B и 0.6B) и высокая производительность делают эти модели мощным инструментом для RAG-систем и поисковых агентов.
Почему это важно
- —Решает проблему потери деталей при индексации сложных документов (PDF, изображения).
- —Позволяет проводить кросс-модальный поиск, объединяя текст и визуальный контент в одном пространстве.
- —Высокая производительность в задачах RAG и агентского поиска, превосходя конкурентов.
Ключевые факты
- Модели способны извлекать текст, изображения и страницы, используя общее встраивание.
- Вместо одного вектора на документ, используется вектор на каждый токен (128 измерений).
- На бенчмарке Q2D-Web 9B-модель достигла 74.8% Recall@1000.
- В задаче MADQA (поиск по PDF) 9B-модель показала 92.4% точность.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.