Содержание
Что WANDR рассказал о возможностях исследовательских AI-агентов
Perplexity выпустила WANDR — открытый бенчмарк для AI-агентов, которые собирают большие массивы информации из интернета. В отличие от тестов с одним правильным ответом, здесь системе нужно найти десятки или сотни подходящих объектов, проверить каждый факт и приложить подтверждающие ссылки с цитатами.
500 задач вместо коротких вопросов
В набор вошли 500 реалистичных задач, созданных на основе обезличенных сценариев использования исследовательских инструментов. Например, агенту могут поручить найти не меньше 70 американских компаний с назначениями CEO или CFO за заданный период, а затем подтвердить каждое назначение и статус компании отдельными источниками. В одной такой задаче получается уже 140 проверяемых записей.
Оценка устроена жёстко: проверяющая система заново открывает каждую указанную страницу и убеждается, что приведённая цитата действительно есть на сайте и подтверждает заявленный факт. Поэтому красивого отчёта или правдоподобной формулировки недостаточно — важны полнота, точность и воспроизводимые доказательства.
Даже лидер далёк от надёжного результата
Perplexity сравнила шесть работающих исследовательских систем. Лучший результат показал подход Search as Code, в котором поиск, фильтрация и объединение данных оформляются как программируемый процесс. Но даже он набрал только 0,363 по мягкой метрике soft F1 и 0,133 по строгой hard F1. Авторы прямо называют бенчмарк далёким от насыщения.
Главные сбои знакомы всем, кто поручал нейросети большое исследование: агент находит лишь часть объектов, доверяет поисковым сниппетам без проверки страницы, забывает ограничения по ходу работы, пропускает дополнительные источники или слишком рано завершает поиск. Чем длиннее задача, тем сильнее мешают переполнение контекста и потеря структуры.
Что это значит для бизнеса и авторов
WANDR не доказывает, что AI-исследования бесполезны. Он показывает, где необходим человеческий контроль: в конкурентном анализе, поиске партнёров, подготовке каталогов и фактчекинге нельзя принимать объёмный ответ за достоверный только из-за уверенного тона. Практический вывод простой — дробить задачу на проверяемые этапы, требовать ссылки и цитаты для каждой записи, а ключевые выводы перепроверять вручную.