Содержание
Что показала массовая проверка научных работ с помощью AI-агентов
Hugging Face подвела итоги необычного эксперимента: более 1200 участников с помощью Claude Code, Codex, Cursor и других AI-агентов попытались воспроизвести результаты 2226 работ с конференции ICML 2026. За 19 дней команды опубликовали 6816 журналов экспериментов и проверили 35 908 отдельных научных утверждений.
Каждая четвертая работа вызвала вопросы
Хотя бы одно утверждение удалось независимо подтвердить в 51% проверенных работ. При этом у 23% исследований нашли как минимум один спорный или опровергнутый вывод. В 49 работах агенты не смогли подтвердить ни одного ключевого утверждения, а в 242 случаях разные команды пришли к противоположным результатам.
Среди найденных проблем были ошибки в доказательствах, несовпадение формул с опубликованным кодом и некорректные методики оценки. Например, в одной работе результат выглядел лучше из-за большого числа служебных токенов в тестовых данных, а в другой контрпример появился только после сотен шагов — более короткие проверки его не замечали.
AI ускоряет аудит, но не заменяет эксперта
Эксперимент показал, что современные агенты уже умеют читать научные статьи, писать код, запускать вычисления и проверять отдельные заявления в большом масштабе. То, на что у рецензента мог уйти целый уикенд, агент способен попытаться воспроизвести за несколько часов — одновременно с тысячами других проверок.
Однако автономная проверка сама по себе тоже ошибается. Участники сталкивались с зацикливанием агентов, неверными единицами измерения и слишком короткими экспериментами. Самые надежные результаты получались там, где человек направлял работу: замечал сомнительное допущение, менял план проверки и оценивал качество там, где числовых метрик было недостаточно.
Почему это важно
Для разработчиков и бизнеса вывод практичный: ссылки на научную работу или красивый бенчмарк больше недостаточно считать гарантией качества. AI-агенты могут заметно удешевить техническую экспертизу модели или нового метода, но финальные решения по-прежнему требуют прозрачных данных, воспроизводимого кода и человеческой проверки.