Нейролюб
НовостьНейросетиAI-агентыHugging Face

AI-агенты перепроверили 2200 научных работ — у 23% нашли спорные или ошибочные выводы

Hugging Face провела крупнейшую открытую проверку исследований ICML 2026: AI-агенты воспроизвели 2226 работ и обнаружили спорные или опровергнутые утверждения почти в каждой четвертой.

Кирилл Киреев

13.08.2026 · 4 минут чтения · Нейросети

AI-агенты проверяют научные работы ICML 2026

Содержание

Что показала массовая проверка научных работ с помощью AI-агентов

Hugging Face подвела итоги необычного эксперимента: более 1200 участников с помощью Claude Code, Codex, Cursor и других AI-агентов попытались воспроизвести результаты 2226 работ с конференции ICML 2026. За 19 дней команды опубликовали 6816 журналов экспериментов и проверили 35 908 отдельных научных утверждений.

Каждая четвертая работа вызвала вопросы

Хотя бы одно утверждение удалось независимо подтвердить в 51% проверенных работ. При этом у 23% исследований нашли как минимум один спорный или опровергнутый вывод. В 49 работах агенты не смогли подтвердить ни одного ключевого утверждения, а в 242 случаях разные команды пришли к противоположным результатам.

Среди найденных проблем были ошибки в доказательствах, несовпадение формул с опубликованным кодом и некорректные методики оценки. Например, в одной работе результат выглядел лучше из-за большого числа служебных токенов в тестовых данных, а в другой контрпример появился только после сотен шагов — более короткие проверки его не замечали.

AI ускоряет аудит, но не заменяет эксперта

Эксперимент показал, что современные агенты уже умеют читать научные статьи, писать код, запускать вычисления и проверять отдельные заявления в большом масштабе. То, на что у рецензента мог уйти целый уикенд, агент способен попытаться воспроизвести за несколько часов — одновременно с тысячами других проверок.

Однако автономная проверка сама по себе тоже ошибается. Участники сталкивались с зацикливанием агентов, неверными единицами измерения и слишком короткими экспериментами. Самые надежные результаты получались там, где человек направлял работу: замечал сомнительное допущение, менял план проверки и оценивал качество там, где числовых метрик было недостаточно.

Почему это важно

Для разработчиков и бизнеса вывод практичный: ссылки на научную работу или красивый бенчмарк больше недостаточно считать гарантией качества. AI-агенты могут заметно удешевить техническую экспертизу модели или нового метода, но финальные решения по-прежнему требуют прозрачных данных, воспроизводимого кода и человеческой проверки.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости