Содержание
Science One: как Google делает автономные AI-исследования проверяемыми
Google Research представила Science One Framework — экспериментальную систему, которая может самостоятельно пройти весь исследовательский цикл: изучить литературу, сформулировать идеи, провести вычислительные эксперименты и подготовить научную работу. Главное отличие проекта от других AI-учёных — встроенная проверяемость: каждое утверждение должно быть связано с реальным источником, кодом или результатом запуска.
Почему обычным AI-исследователям нельзя слепо доверять
По данным Google, современные автономные исследовательские системы уже создают убедительно выглядящие статьи, но качество текста скрывает структурные ошибки. В тестах конкурирующие решения выдумывали до 21% ссылок, описывали в статье не тот метод, который был реализован в коде, и приводили результаты, которые не удавалось воспроизвести.
Как работает Chain-of-Evidence
Science One строится вокруг подхода Chain-of-Evidence — «цепочки доказательств». Система ищет литературу через Semantic Scholar и может изучить до 100 полнотекстовых PDF по теме, параллельно проверяет несколько исследовательских гипотез, сохраняет журналы экспериментов и привязывает фактические заявления в итоговой статье к конкретным артефактам. Отдельный модуль сверяет текст с заявленным источником и осторожно переформулирует вывод, если доказательств недостаточно.
Для независимой проверки Google также разработала CoE Audit. Аудит повторно запускает код, ищет нарушения условий задачи, проверяет библиографию по академическим базам и сравнивает описание метода с реальной реализацией. В экспериментах Science One не создала ни одной фиктивной ссылки, показала полностью проверяемые результаты и лучше других систем согласовала текст статьи с кодом.
Что это меняет для AI-агентов
На задачах ADRS система сравнялась с экспертами или превзошла их, а в сложных внешних тестах получила две золотые и две серебряные медали на задачах MLE-Bench. Для бизнеса и исследовательских команд важен сам принцип: агент должен не просто выдавать правдоподобный ответ, а оставлять понятный след — от вывода до исходных данных и выполненного действия.
Пока Science One остаётся исследовательским прототипом и не предлагается как готовый продукт. Но подход Google показывает направление развития надёжных AI-агентов: проверяемость и воспроизводимость становятся частью архитектуры, а не дополнительной ручной проверкой после генерации результата.