Содержание
Faraday учится работать как AI-учёный, а не просто отвечать на вопросы
Лондонская AI-лаборатория Inherent, основанная выходцами из Google DeepMind, представила Faraday — 27B-параметрического AI-агента для научной работы. Компания утверждает, что Faraday обошёл Claude Opus 4.8 и GPT-5.5 в задачах репликации исследований: агенту нужно было самостоятельно воспроизвести результаты из научных статей, не имея готового ответа.
Важно, что речь не о простом пересказе публикации. В тестах Faraday получал исследовательскую работу и ограниченный бюджет времени/вычислений, а затем должен был восстановить экспериментальный путь к графику или результату. Inherent сравнивает это с тем, как аспиранты учатся науке: сначала повторяют уже опубликованные результаты, а затем переходят к собственным гипотезам.
Почему это не просто ещё один бенчмарк
Для обучения Inherent создала набор Replica: 310 задач из 100 статей по машинному обучению и AI for science — от NLP до материаловедения и прогноза погоды. В отличие от привычных тестов, где достаточно выбрать правильный ответ, здесь агенту нужно планировать эксперименты, писать код, проверять промежуточные версии и понимать, какие попытки научно осмысленны.
Faraday работает поверх сравнительно небольшой модели Qwen 3.6 на 27 млрд параметров, но использует coding agent как инструмент — примерно так же, как реальный исследователь пользуется софтом и помощниками. Inherent подчёркивает, что ключевой слой здесь не размер базовой модели, а способность агента направлять работу, выбирать эксперименты и не тратить ресурс на случайные действия.
Что это меняет для AI-агентов
Если подход масштабируется, такие системы могут стать полезны не только в лабораториях. Для бизнеса и команд, которые работают с данными, это сигнал: ценность AI-агентов смещается от «быстро написать текст или код» к умению проверять гипотезы, находить слабые места в доказательствах и возвращаться с результатами, которые можно обсудить с человеком.
Для креаторов и маркетинга идея тоже важна: агент будущего будет не просто генерировать варианты, а проверять, почему один подход сработал лучше другого. Например, анализировать креативы, тестировать гипотезы по аудитории, находить закономерности в контенте и предлагать следующий эксперимент не наугад, а с понятной логикой.
Но человека пока не убирают из цикла
Inherent прямо пишет, что держит людей в контуре и изучает риски reward hacking — ситуации, когда агент учится получать высокий балл, но не делает по-настоящему полезную работу. Это особенно важно для науки: красивая репликация графика не равна корректному исследованию, если эксперимент поставлен плохо или выводы не соответствуют данным.
Пока Faraday выглядит скорее как ранний шаг к AI-лабораториям, чем готовая замена исследователя. Но направление заметное: сильные агенты начинают конкурировать не только в скорости генерации, а в исследовательском качестве — умении задавать правильные вопросы, проверять себя и приносить человеку не «ответ», а осмысленную работу.