ИИ-учёному недостаточно интеллекта: как Faraday учат воспроизводить исследования
Из научной статьи убирают график, а ИИ-агенту дают час и одну семнадцатую ресурсов GPU NVIDIA H200, чтобы заново провести описанный эксперимент и…
Из научной статьи убирают график, а ИИ-агенту дают час и одну семнадцатую ресурсов GPU NVIDIA H200, чтобы заново провести описанный эксперимент и восстановить результат. Так устроена Replica — набор задач, на котором команда Inherent обучает систему Faraday. Агент должен не угадать вид пропавшего изображения, а разобраться в методе, выбрать подходящий масштаб эксперимента и заново получить основной результат работы.
В разговоре на канале Machine Learning Street Talk сооснователь и главный научный сотрудник Inherent Эдвард Хьюз объясняет, почему для создания ИИ-учёного недостаточно одной лишь способности решать поставленные задачи. Современные агенты для программирования, по его оценке, уже неплохо справляются с инженерной работой, но хуже определяют, какие вопросы стоит задать и какие эксперименты способны принести новые знания.
Для Replica языковая модель удаляет графики из научных статей, оставляя агенту текст с описанием исследования. Качество его работы оценивают не только по сходству восстановленного изображения с оригиналом. Отдельные критерии учитывают научную строгость, получение основного результата статьи и попытки обойти эксперимент — например, перенести готовые числа из другой части работы вместо самостоятельной проверки.
Faraday построена на модели с 27 млрд параметров, которая использует более мощного агента для программирования как инструмент. Она поручает ему отдельные действия, следит за ходом работы и решает, когда следует продолжить вычисления, остановить их или скорректировать подход. Faraday обучали на 242 задачах, а проверяли на 68 отложенных примерах из другой области — исследованиях о применении ИИ в науке. По словам Хьюза, система превзошла как агента, которым управляла, так и другие модели, включая Claude и GLM 5.2.
Преимущество проявлялось не в умении нарисовать внешне похожий график, а в исследовательской аккуратности. При воспроизведении работы Voyager конкурирующий агент заранее задал библиотеку навыков, хотя исходный метод предполагал, что система сама создаёт эти навыки и затем использует их повторно. Faraday точнее сохранила логику эксперимента. В задании по работе GNoME она провела несколько запусков, показала разброс результатов и проверила поведение модели в разных физических условиях. Конкурирующее решение ограничилось одним запуском и пропустило часть анализа.
Обучение потребовало особого способа распределять обратную связь. Модель-судья несколько раз оценивала каждый полный запуск, а затем определяла, какие действия Faraday сильнее всего повлияли на итог. Наибольший вес часто получали решения в середине работы и указания, которые Faraday давала агенту для программирования. Благодаря этому обучение меньше затрагивало уже освоенные рутинные операции и сильнее влияло на выбор экспериментов и изменение стратегии.
Хьюз рассматривает воспроизведение исследований как первый этап на пути к инновациям. Агент, способный вдумчиво повторить существующую работу, учится находить недостающие сведения, проверять собственные действия и быстро выяснять, заслуживает ли гипотеза дальнейшего изучения. Следующим шагом может стать задача получить изменённый результат, которого ещё не существует: навыки воспроизведения тогда превращаются в основу для нового исследования.
Такой подход связан и с более широким пониманием творчества. Хьюз называет знаменитый 37-й ход AlphaGo инновационным, но не творческим: сама система не осознала, что совершила нечто примечательное. Для творчества, по его мнению, недостаточно неожиданного и полезного результата — необходимо распознать его значение в контексте накопленных знаний. Поэтому оценка ИИ-учёного не должна заранее сводиться к нескольким вопросам с известными ответами. Его работу придётся рассматривать постфактум, подобно тому как научное сообщество оценивает результаты исследователя.
Будущего ИИ-учёного Хьюз видит не как изолированную сверхразумную систему, а как часть общей среды. В ней множество людей и агентов обмениваются контекстом, проверяют результаты и вместе выбирают следующие направления. Интеллект помогает искать ответы, но научное открытие начинается с умения заметить пробел в знаниях, сформулировать содержательный вопрос и поставить эксперимент, который действительно способен приблизить к ответу.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.


