Содержание
Поиск для AI-агентов проверили на 1700 задачах
Artificial Analysis запустила новый Search Index — независимый тест поисковых API, которыми пользуются AI-агенты. В первом сравнении участвовали Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave. Все сервисы проверяли в одинаковой агентной среде, поэтому на результат влиял именно поставщик поиска, а не замена модели или промпта.
Кто оказался в лидерах
Без доступа к интернет-поиску модель набрала 33 балла. Подключение поисковых API подняло результат до 65–75 баллов: Parallel Advanced получил 75, Exa — 74, Firecrawl — 73. Итоговый индекс складывается из трёх наборов задач: DeepSearchQA, BrowseComp и AA-Omniscience — всего около 1700 вопросов на глубокий поиск, редкие факты и проверку знаний.
Качественный поиск снижает расходы
Один из самых практичных выводов теста: более дорогой запрос к поисковому API не всегда делает работу агента дороже. Parallel Advanced сократил расход токенов модели более чем на 40% по сравнению с базовым режимом, а общая стоимость решения задачи снизилась примерно с $0,11 до $0,084. Причина проста: когда агент сразу получает релевантные источники, ему требуется меньше повторных поисков и рассуждений.
Скорость отдельного запроса тоже оказалась не главным показателем. Быстрый режим Parallel Turbo отвечал примерно за 0,51 секунды, но из-за менее точных результатов агент чаще повторял поиск. В итоге общее время решения задачи почти не отличалось от более медленного базового режима.
Что это значит для разработчиков и бизнеса
При выборе поиска для AI-ассистента стоит сравнивать не только тариф и задержку API. Важнее смотреть на итоговое качество ответа, число дополнительных обращений модели и полную стоимость выполнения сценария. Для исследовательских ассистентов, поддержки, мониторинга рынка и контентных агентов хороший поиск может одновременно повысить точность и сократить расходы на токены.
Методология Artificial Analysis открыта: все провайдеры тестируются с GPT-5.6 Luna в одинаковом цикле до 25 шагов, а потенциальные утечки тестовых ответов фильтруются. Рейтинг планируют расширять, поэтому он может стать полезной отправной точкой для тех, кто выбирает поисковый слой для собственного AI-продукта.