Perplexity открыла бенчмарк WANDR для исследовательских ИИ-агентов
Perplexity открыла исходный код WANDR — внутреннего бенчмарка, созданного для развития исследовательских функций Perplexity Computer. Он оценивает две ключевые способности ИИ-агентов: находить широкий круг релевантных объектов и подтверждать каждое утверждение источниками.
Набор включает 500 исследовательских задач трёх уровней сложности и требует собрать 170 495 записей со ссылками на доказательства. Иерархическая структура и независимо проверяемые элементы помогают определить не только итоговое качество ответа, но и конкретное место, где агент допустил ошибку.
WANDR основан на обезличенных практических сценариях — от анализа конкурентов и рынков до обзора литературы, сравнения продуктов и поиска специалистов. Система заново загружает процитированные страницы и сверяет утверждения с их содержанием, поэтому может работать и с фактами, которые меняются со временем.
Почему это важно
- —WANDR позволяет отдельно измерять широту поиска и глубину проверки фактов исследовательскими агентами.
- —Открытый набор может помочь разработчикам точнее находить слабые места ИИ-систем, а не ограничиваться общей оценкой ответа.
- —Проверка утверждений по актуальному содержимому источников подходит для задач с меняющимися со временем фактами.
Ключевые факты
- WANDR содержит 500 исследовательских задач трёх уровней сложности.
- Для выполнения задач требуется сформировать 170 495 записей, подкреплённых источниками.
- Бенчмарк создан на основе обезличенных практических сценариев использования.
- Мягкая оценка начисляет частичные баллы, а жёсткая требует полноты и правильности всех компонентов.
- Каждая цитируемая страница загружается повторно для сверки утверждений с доказательствами.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.