Cайт программиста Ruby, веб-разработчика Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

PDF больше недостаточно. Учёные превращают статьи в работающих ИИ-агентов

Исследователи представили Paper2Agent, систему, которая превращает обычную научную статью в работающего ИИ-агента. Вместо чтения PDF, поиска исходного кода и ручной настройки программ исследователь может задать вопрос обычным языком, попросить воспроизвести расчёт или применить описанный метод к новым данным. Авторы рассматривают такой подход как возможный новый способ публикации вычислительных исследований, хотя привычные статьи система пока не заменяет.

Paper2Agent работает не как чат-бот, которому просто загрузили текст статьи. Система собирает саму публикацию, дополнительные материалы, наборы данных, исходный код и готовые рабочие процессы, после чего превращает методы авторов в набор исполняемых инструментов. В результате искусственный интеллект (ИИ) получает возможность не только пересказывать содержание, но и запускать описанные в работе вычисления.

Связующим слоем служит протокол контекста модели (MCP), предназначенный для подключения языковых моделей к внешним данным и программным инструментам. Paper2Agent автоматически создаёт MCP-сервер для конкретной статьи. На сервер попадают функции для расчётов, исходные материалы и инструкции, описывающие правильную последовательность действий. Затем к серверу можно подключить совместимого ИИ-агента и работать со статьёй через диалог.

Перед публикацией готовых инструментов система проверяет их на примерах из исходной работы. Paper2Agent запускает код, сравнивает численные результаты и изображения с эталонами, пытается исправить ошибки окружения и зависимостей. Если функция после нескольких попыток не проходит проверку, система исключает её из готового набора. Такой подход должен уменьшить риск ситуации, когда языковая модель придумывает правдоподобный, но неправильный код вместо реального метода авторов.

Одним из испытаний стала AlphaGenome, система для прогнозирования влияния изменений ДНК. Paper2Agent примерно за 45 минут создала для неё 22 инструмента, каждый прошёл автоматическую проверку. Авторы оценили стоимость однократной подготовки агента примерно в $14 на обычном персональном компьютере. После сборки исследователь мог, например, описать генетический вариант обычным языком и попросить систему оценить его возможное влияние на экспрессию генов, сплайсинг или доступность хроматина в выбранных тканях.

В одном из опытов агент заново разобрал связь генетического варианта с уровнем холестерина липопротеинов низкой плотности. Исходная работа выделяла гены CELSR2 и PSRC1, тогда как агент поставил на первое место SORT1. Дополнительная проверка по независимым данным об экспрессии генов поддержала связь варианта с SORT1 в печени. Авторы подчёркивают, что такое расхождение не делает первоначальный вывод автоматически ошибочным, но показывает возможность быстро пересматривать опубликованные интерпретации с помощью тех же вычислительных методов.

Ещё один эксперимент показал, как несколько агентов могут работать вместе. Система объединила методы и данные из трёх разных исследований, чтобы найти ген, потенциально связанный с вариантом риска псориаза. ИИ предложил десять способов проверки, после чего человек выбрал анализ корреляции. Последующие вычисления выделили GPR137 как наиболее вероятного кандидата при определённых условиях активации клеток. Авторы считают результат примером новой схемы анализа данных, но не окончательным биологическим доказательством причинной связи.

При проверке на более крупной выборке автоматизация сработала далеко не для каждой статьи. Из 100 вычислительных работ по биологии полноценного агента удалось собрать для 74. Главными причинами неудач стали отсутствующий или неработающий код, недостающие данные и модели, проблемы с зависимостями и скрипты, которые нельзя было нормально перенести на другие входные данные. По мнению авторов, сама возможность автоматически превратить публикацию в исполняемого агента может стать своеобразной проверкой воспроизводимости исследования.

На 300 вопросах, составленных по учебным примерам из этих работ, Paper2Agent с моделью Sonnet 4 показала точность 91,2%. Та же модель с прямым доступом к статье и репозиторию получила 80,3%, а более новая Sonnet 4.6 в аналогичном режиме набрала 86,3%. В отдельной проверке на 42 исполняемых задачах из десяти работ по искусственному интеллекту, статистике, эконометрике, теории игр и астрофизике средняя точность Paper2Agent достигла 98,1%.

Статьи без пригодного для запуска кода тоже можно преобразовать, но возможности такого агента будут скромнее. В таком случае Paper2Agent создаёт структурированное хранилище текста, таблиц, рисунков и дополнительных материалов, по которому ИИ может искать сведения и сопоставлять разные части публикации. На 100 подобных заданиях система получила 89% правильных ответов.

Высокие показатели не означают, что ИИ научился самостоятельно устанавливать научную истину. Авторы отдельно предупреждают, что тесты прежде всего измеряют способность правильно воспроизводить существующие вычисления. При открытых научных вопросах допустимы несколько интерпретаций, поэтому выбор направления исследования, оценка доказательств и окончательные выводы должны оставаться за человеком.

Ключевое ограничение Paper2Agent одновременно показывает, почему идея может оказаться важной для научных публикаций. Агент хорошо работает там, где статья сопровождается понятным кодом, доступными данными и воспроизводимым процессом анализа. PDF при таком подходе никуда не исчезает, но перестаёт быть единственным способом передать результат: вместе с текстом исследователь получает интерактивную версию работы, способную показать собственные расчёты в действии. Код проекта опубликован открыто.

SecurityLab