Perplexity выпустила WANDR: бенчмарк для проверки исследовательских ИИ-агентов

Новый тест для задач, где одного ответа мало
Perplexity представила WANDR (Wide ANd Deep Research) - открытый бенчмарк и набор инструментов оценки для исследовательских ИИ-агентов. Компания описывает его как тест для «широкой и глубокой» исследовательской работы: агент должен найти большой набор релевантных объектов и подтвердить каждый из них конкретными доказательствами.
В WANDR вошли 500 реалистичных задач по сбору данных. Они основаны на сценариях, которые пользователи уже поручают исследовательским агентам: конкурентный анализ, due diligence, обзор литературы, анализ рынка, сравнение продуктов, поиск специалистов и похожие задачи. Общий объём бенчмарка - 170 495 записей, которые должны быть подтверждены источниками.

Это заметно отличается от привычных тестов формата «вопрос - ответ». Здесь агенту мало найти один факт или подготовить аккуратный отчёт. Он должен удержать полноту поиска и не потерять качество проверки на каждом отдельном элементе.
WANDR проверяет ширину поиска и глубину доказательств
Логика бенчмарка строится вокруг двух требований. «Wide» означает поиск большого и часто открытого набора сущностей: компаний, людей, документов, публикаций, страниц или других объектов. «Deep» означает проверку каждой найденной сущности до уровня, где утверждение можно подтвердить ссылкой и выдержкой из источника.
В статье Perplexity приводит пример задачи про назначения CEO и CFO в американских компаниях. Агент должен найти не менее 70 компаний с соответствующими назначениями, подтверждёнными авторитетной страницей, а затем отдельно доказать, что эти же компании торгуются на национальной бирже США или являются американскими эмитентами по требованиям SEC. В сумме такая задача требует 140 записей: 70 записей о назначениях и 70 записей о статусе компаний.
Такой формат бьёт по слабому месту современных агентов. Модель может найти несколько хороших примеров и убедительно их описать, но провалиться на полном покрытии задачи. Для рынка это важная оговорка: красивый исследовательский отчёт ещё не доказывает, что исследование было полным.
Оценка работает без фиксированного списка правильных ответов
Perplexity отказалась от классического «золотого» набора ответов, потому что открытые исследовательские задачи быстро устаревают и часто не имеют единственного закрытого списка решений. Вместо этого WANDR проверяет каждую запись по источнику, который указал сам агент.
Каждая запись содержит объект, URL, выдержки из страницы и ответ. Проверяющая система заново загружает страницу и оценивает, подходит ли она для задачи, есть ли на ней заявленные фрагменты и подтверждают ли они все требования. Затем оценки сворачиваются по иерархии задачи: отдельно считаются точность, полнота и F1. Soft-оценка даёт частичный кредит за неполные ветки, hard-оценка засчитывает только полностью корректные элементы.
Это делает провалы более видимыми. Если точность высокая, а полнота низкая, агент нашёл хорошие элементы, но нашёл их слишком мало. Если soft-оценка заметно выше hard-оценки, система продвинулась в задаче, но редко закрывала все обязательные ветки до конца.
Даже лучшие системы пока далеки от полного решения
Perplexity сравнила шесть производственных систем: поисковые и агентские API, продукт для глубоких исследований и собственную систему Search as Code. Все они проходили одни и те же 500 задач с одинаковым процессом загрузки страниц, проверки, разрешения сущностей и подсчёта баллов.
Лидером стала Perplexity Search as Code: 0,363 soft F1 и 0,133 hard F1. Anthropic заняла второе место с 0,249 soft F1 и 0,072 hard F1. Остальные системы не поднялись выше 0,121 soft F1 и 0,035 hard F1. Даже при высоком уровне усилий лучший результат остаётся низким по абсолютной шкале.
Самый жёсткий вывод из публикации: полное покрытие пока плохо даётся всем. Perplexity прямо пишет, что wide-and-deep research остаётся далёкой от решённой задачи. В практическом смысле это означает, что исследовательским агентам пока нельзя без проверки поручать задачи, где пропуск части данных меняет вывод.
Масштаб и вложенная структура резко усложняют задачу
Чем больше требуемый объём и глубже структура задачи, тем сильнее падают результаты. По данным Perplexity, при переходе от самых маленьких к самым крупным задачам hard precision у Perplexity снизилась с 0,235 до 0,096, а hard recall - с 0,219 до 0,079. У OpenAI падение оказалось ещё сильнее: hard precision снизилась с 0,109 до 0,034, hard recall - с 0,102 до 0,016.
Отдельная проблема - вложенные иерархии. Когда задаче нужно не просто найти компанию, а затем связать её с людьми, ролями, датами и несколькими доказательствами, каждая дополнительная ветка создаёт новое место для ошибки. Для Perplexity hard precision при переходе от задач без промежуточного ключа к задачам с тремя и более уровнями упала с 0,392 до 0,019.
Здесь хорошо видно расхождение между маркетингом и реальностью. Производители ИИ всё чаще говорят о полноценных исследовательских агентах, но бенчмарк показывает: системы уже умеют начинать сложное исследование, однако редко доводят все элементы до проверяемого результата.
Главный сбой происходит до финальной ссылки
Одна из полезных частей WANDR - диагностика места, где агент теряет качество. По данным Perplexity, финальная ссылка часто находится успешно: среди пяти систем только 3,2–8,9% отправленных страниц оказались непригодными, хотя OpenAI стала исключением с 23,1%. Основные потери возникают дальше: 33,6–68,3% страниц не закрывают хотя бы одно существенное требование задачи, а 57,5–86,6% выдержек не подтверждают всё, что заявлено в записи.
Проще говоря, агент часто находит похожую страницу, но не доказывает нужный факт полностью. Для пользователя это особенно опасный тип ошибки: ссылка выглядит убедительно, страница открывается, но источник не подтверждает именно то утверждение, ради которого его добавили.
Зачем Perplexity выпускает этот бенчмарк
WANDR продолжает линию Perplexity на оценку исследовательских агентов в реальных сценариях. Ранее компания выпустила DRACO - бенчмарк для проверки длинных исследовательских отчётов. WANDR закрывает соседнюю часть проблемы: не качество итогового текста, а способность собрать большую проверяемую коллекцию данных.
У релиза есть и рыночный подтекст. Perplexity строит продукты вокруг поиска и исследовательской работы, поэтому ей выгодно смещать разговор от «какая модель лучше пишет» к «какая система лучше находит и проверяет». Это не делает бенчмарк бесполезным, но задаёт правильную планку скепсиса: ценность WANDR станет понятнее, если его начнут использовать независимые исследователи и конкуренты.
Для пользователей главный вывод проще. Исследовательские агенты уже полезны для первичного сбора информации, построения списков и проверки гипотез. Но задачи с высоким риском - due diligence, юридическая проверка, инвестиционная аналитика, аудит поставщиков - всё ещё требуют ручной перепроверки покрытия и источников.