New-ZZZ
RU / EN
Бенчмарки 14 июля 2026

Perplexity открыла бенчмарк WANDR для исследовательских ИИ-агентов

Р
Редакция New-ZZZ
X @perplexity_ai · 3 недели назад

Perplexity открыла исходный код WANDR — внутреннего бенчмарка, созданного для развития исследовательских функций Perplexity Computer. Он оценивает две ключевые способности ИИ-агентов: находить широкий круг релевантных объектов и подтверждать каждое утверждение источниками.

Набор включает 500 исследовательских задач трёх уровней сложности и требует собрать 170 495 записей со ссылками на доказательства. Иерархическая структура и независимо проверяемые элементы помогают определить не только итоговое качество ответа, но и конкретное место, где агент допустил ошибку.

WANDR основан на обезличенных практических сценариях — от анализа конкурентов и рынков до обзора литературы, сравнения продуктов и поиска специалистов. Система заново загружает процитированные страницы и сверяет утверждения с их содержанием, поэтому может работать и с фактами, которые меняются со временем.

Почему это важно

  • WANDR позволяет отдельно измерять широту поиска и глубину проверки фактов исследовательскими агентами.
  • Открытый набор может помочь разработчикам точнее находить слабые места ИИ-систем, а не ограничиваться общей оценкой ответа.
  • Проверка утверждений по актуальному содержимому источников подходит для задач с меняющимися со временем фактами.

Ключевые факты

  • WANDR содержит 500 исследовательских задач трёх уровней сложности.
  • Для выполнения задач требуется сформировать 170 495 записей, подкреплённых источниками.
  • Бенчмарк создан на основе обезличенных практических сценариев использования.
  • Мягкая оценка начисляет частичные баллы, а жёсткая требует полноты и правильности всех компонентов.
  • Каждая цитируемая страница загружается повторно для сверки утверждений с доказательствами.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы