New-ZZZ
RU / EN
Модели ИИ 16 июля 2026

NVIDIA Nemotron 3 Embed возглавила рейтинг RTEB по поиску

Р
Редакция New-ZZZ
Hugging Face Blog · 3 недели назад

NVIDIA выпустила Nemotron 3 Embed — семейство открытых, доступных для коммерческого использования моделей эмбеддингов, созданных для улучшения этапа поиска информации в ИИ-системах. Модели эмбеддингов преобразуют текст, код и другой поддерживаемый контент в числовые представления, позволяя системе находить материалы со схожим смыслом. Эта возможность играет ключевую роль в генерации с дополнением поиском (RAG), поисковых агентах, ассистентах для работы с кодом и памяти агентов, где качество найденных данных может напрямую влиять на качество, скорость и стоимость итогового ответа. Флагманская модель Nemotron-3-Embed-8B-BF16 занимает первое место в общем зачёте многоязычного рейтинга качества поиска RTEB по состоянию на 15 июля 2026 года.

Коллекция включает модель с 8 миллиардами параметров, призванную задать высший уровень качества поиска, а также более компактные варианты с 1 миллиардом параметров — BF16 и NVFP4, предназначенные для более экономичного промышленного развёртывания с высокой пропускной способностью. NVIDIA позиционирует это семейство как набор моделей, охватывающий разные точки соотношения точности и эффективности, чтобы организациям не приходилось всегда развёртывать крупнейшую модель. Версия 8B BF16 предназначена для сценариев, в которых главным приоритетом является качество поиска, а модели 1B переносят тот же ориентированный на поиск подход в среды с более жёсткими ограничениями по задержке, памяти и инфраструктуре.

Nemotron 3 Embed выпускается с открытыми весами, наборами данных и рецептами обучения. Это позволяет командам разработчиков изучать модели, развёртывать их в собственной инфраструктуре, адаптировать к специализированным предметным областям и дообучать на частных или отраслевых данных. NVIDIA также предоставляет рецепты NeMo AutoModel для адаптации к предметной области, дистилляции знаний и сжатия моделей. Эти ресурсы призваны помочь организациям адаптировать универсальную поисковую модель к собственным документам, терминологии, кодовым базам или рабочим процессам без полной зависимости от закрытого облачного сервиса.

Модели поддерживают контекстное окно объёмом до 32 000 токенов. Такая ёмкость позволяет поисковой системе обрабатывать более длинные документы, крупные фрагменты исходного кода и продолжительные истории многошагового взаимодействия с агентами, теряя меньше информации из-за обрезки. Семейство также поддерживает многоязычный поиск и поиск по коду, что отвечает потребностям организаций, чьи индексируемые данные охватывают несколько языков, техническую документацию и репозитории с множеством взаимосвязанных файлов. Сразу после выпуска модели доступны через Hugging Face, могут развёртываться в виде микросервиса NVIDIA NIM, совместимы с vLLM и доступны через партнёров, предоставляющих облачные ИИ-сервисы и инфраструктуру для инференса.

NVIDIA оценила модели по качеству поиска, эффективности последующих этапов агентных рабочих процессов и практическим компромиссам при развёртывании. Представленные тесты охватывают RTEB, ViDoRe V3 Text, MMTEB Retrieval и LongEmbed, а в качестве метрики качества поиска используется среднее значение NDCG@10. NDCG@10 измеряет, появляются ли релевантные результаты среди первых десяти возвращённых элементов, и присваивает более высокий балл, если лучшие подтверждающие данные расположены ближе к началу списка. Nemotron-3-Embed-8B-BF16 набрала 78,5% в RTEB и 75,5% в MMTEB Retrieval, причём результат RTEB обеспечил ей первое место в указанном рейтинге.

Более компактная модель Nemotron-3-Embed-1B-BF16 набрала 72,4% в RTEB. По данным NVIDIA, это соответствует снижению частоты ошибок на 27% по сравнению с предыдущей моделью компании с 1 миллиардом параметров — llama-nemotron-embed-vl-1b-v2. В MMTEB Retrieval новая модель 1B BF16 набрала 71,0%, что, согласно опубликованным данным, соответствует снижению частоты ошибок на 28% относительно предшественницы. Эти результаты указывают на то, что компактная модель сохраняет значительную часть поисковой производительности флагманской версии, требуя при этом меньше ресурсов для развёртывания.

Компания также проверила, как выбор модели эмбеддингов влияет на работу ИИ-агента после поиска. В этом тесте поисковый агент на базе Nemotron 3 Ultra использовал разные модели эмбеддингов для поиска подтверждающих данных в ViDoRe V3, BRIGHT и BrowseComp-Plus. В ходе оценки сравнивались средняя точность поиска и расчётное количество и стоимость токенов, используемых агентом на последующих этапах обработки одного запроса. NVIDIA рассчитала стоимость на основе количества входных и выходных токенов Nemotron 3 Ultra, применив формулу ценообразования GPT-5.5; таким образом, это смоделированное сравнение затрат, а не прямое измерение стоимости использования самих моделей эмбеддингов.

Основная идея заключается в том, что более качественный поиск способен сократить объём работы на других этапах агентного конвейера. Если релевантные данные появляются раньше, агенту может потребоваться меньше повторных поисков, циклов рассуждения и проверок нерелевантного контекста. В оценках NVIDIA модель 8B сочетала наивысшую среднюю точность поиска с самой низкой расчётной стоимостью токенов на последующих агентных этапах среди сравниваемых вариантов Nemotron 3 Embed. Этот результат показывает, что более крупная поисковая модель потенциально способна снизить общую стоимость системы, если улучшенное ранжирование избавляет дорогостоящую модель рассуждений от ненужной работы.

Для развёртываний, где важнее пропускная способность и объём используемой памяти, NVIDIA предлагает Nemotron-3-Embed-1B-NVFP4. В ней применяется 4-битный числовой формат NVFP4 для весов и активаций линейных слоёв, а сама модель оптимизирована для оборудования NVIDIA Blackwell. Вычисления с пониженной точностью сокращают объём ресурсов, необходимых для инференса, но также могут снижать качество модели. Чтобы минимизировать эти потери, NVIDIA применяет дистилляцию с учётом квантизации — метод обучения, при котором сжатую модель учат сохранять поведение более точной версии, в том числе при обработке длинных входных последовательностей.

По данным NVIDIA, нативный инференс NVFP4 на Blackwell способен обеспечить до двукратного увеличения пропускной способности по сравнению с BF16 при обслуживании поисковых запросов с высокой пропускной способностью и низкой задержкой. Компания также заявляет, что модель NVFP4 сохраняет более 99% поисковой точности варианта BF16. В сравнение эффективности на ViDoRe V3 включены более компактные открытые базовые модели эмбеддингов, такие как Qwen3-Embedding-0.6B и EmbeddingGemma-300M. В совокупности эти релизы представляют качество поиска как оптимизацию на уровне всей системы: более мощная модель эмбеддингов может повысить обоснованность ответов, одновременно сокращая количество поисковых запросов, шагов рассуждения, расход токенов и инфраструктурных ресурсов, необходимых агенту в целом.

Почему это важно

  • Более качественный поиск может улучшить отбор подтверждающих материалов, одновременно сокращая число повторных поисковых запросов, этапов рассуждения и затраты токенов на последующих этапах работы ИИ-агентов.
  • Открытые веса, наборы данных и методики обучения дают компаниям больше контроля над развертыванием в закрытой инфраструктуре и адаптацией под конкретные предметные области.
  • Модель 1B NVFP4 требует меньше памяти для развертывания на Blackwell и, по имеющимся данным, сохраняет более 99% точности поиска версии BF16.

Ключевые факты

  • Nemotron-3-Embed-8B-BF16 занимает первое место в указанном рейтинге RTEB с результатом 78,5%.
  • Модель 8B набрала 75,5% в категории MMTEB Retrieval, а версия 1B BF16 — 72,4% в RTEB и 71,0% в MMTEB Retrieval.
  • Модели поддерживают контекстное окно на 32 000 токенов, многоязычный поиск и поиск по коду.
  • В тестах агентов с использованием Nemotron 3 Ultra более эффективный поиск был связан с сокращением расхода токенов на последующих этапах и снижением предполагаемой стоимости.
  • По данным NVIDIA, модель 1B NVFP4 способна обеспечить на Blackwell до двукратного увеличения пропускной способности по сравнению с BF16, сохраняя более 99% ее точности поиска.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы