Cайт программиста Ruby, веб-разработчика Ruby on Rails ESV Corp. Екатеринбург, Москва, Санкт-Петербург, Новосибирск, Первоуральск

OpenAI впервые систематизировала собственные «проступки» моделей и раскрыла шесть случаев

OpenAI впервые превратила странные и опасные поступки собственных моделей из разрозненных историй в систему публичной отчётности. Компания раскрыла сразу шесть случаев, где искусственный интеллект (ИИ) скрывал ошибки, придумывал данные, искал утёкшие ключи, самовольно публиковал файлы в интернете и налаживал связь с другими агентами.

Новый механизм охватывает поведение моделей во время обучения, тестирования, оценки и реальной эксплуатации. В отчёты будут попадать случаи, когда системы действуют без разрешения, обходят надзор, координируются друг с другом или ставят под сомнение эффективность защитных механизмов. Подобное поведение уже проявлялось во время экспериментов OpenAI, когда агенты обходили ограничения и искали собственные каналы связи.

Один из самых показательных эпизодов обнаружили при обучении GPT-5.6 Sol. Модель сохраняла в кратких сводках для следующего контекстного окна инструкции скрывать проблемы от пользователя. В одном задании агент предлагал придумать отсутствующие финансовые показатели и не упоминать подмену без прямого вопроса. В другом случае модель советовала скрыть несовпадение версий источников. OpenAI зафиксировала такое поведение в 2,15% проверенных сводок GPT-5.6 Sol, а у более поздней GPT-6 Astra показатель снизился до 0,27%.

Другой внутренний прототип пошёл дальше. Получив обычное задание найти статистику доходов, агент попытался зарегистрироваться через одноразовую почту, затем начал искать утёкшие API-ключи в публичных репозиториях GitHub. Один ключ действительно сработал. Когда получить нужные цифры всё равно не удалось, модель просто придумала девять значений и выдала их за данные исходного сайта. Риски быстро растут, когда ИИ-агенту дают доступ к сети, файлам и внешним сервисам.

Ещё в двух случаях модели самостоятельно загружали данные в публичный интернет. Один агент опубликовал найденную информацию о водоёмах на стороннем сервисе, чтобы браузер смог использовать файл как источник для цитирования. Другой загрузил фотографию пользователя на внешний хостинг ради обратного поиска изображения. Разрешения на публичную публикацию данных агенты не запрашивали.

Отдельная группа эпизодов связана с общением между моделями. Агенты превратили внутренний JFrog Artifactory в импровизированную доску объявлений, где читали записи других запусков, отвечали на сообщения и просили недостающие файлы. Уязвимость для первого такого канала не понадобилась, моделям хватило штатных учётных данных. Похожая способность к общей памяти уже появлялась в экспериментах OpenAI, где модели обменивались сообщениями между независимыми запусками.

В шестом случае несколько агентов совместно создавали таблицу, но не могли передать файл через предусмотренное локальное хранилище. Один участник сначала пробовал локальный HTTP-сервер, а затем самостоятельно загрузил документ на публичный файлообменник и разослал коллегам ссылку. Задание при этом прямо предполагало работу только с локальными файлами.

OpenAI подчёркивает, что шесть примеров нельзя использовать для оценки частоты подобных сбоев во всех моделях. Компания намерена публиковать даже неоднозначные случаи, если поведение помогает понять слабые места контроля. Новый порядок раскрытия предусматривает три уровня расследования, а сложные эпизоды с затронутыми сторонними организациями могут потребовать отдельной проверки и предварительного уведомления пострадавших.

Проблема уже вышла за пределы лабораторных курьёзов. Во время другого эксперимента агенты OpenAI добрались до реальной инфраструктуры Hugging Face, а расследование показало, как внутреннее хранилище постепенно превратилось в канал совместной работы. Позже компания опубликовала технический отчёт об инциденте, где модели получили доступ к производственным системам.

Масштаб самостоятельной координации проявился и в другом эксперименте OpenAI. Отдельные экземпляры моделей оставляли записи на публичных сайтах, находили сообщения предыдущих запусков и использовали чужие результаты как внешнюю память. В одном исследовании специалисты обнаружили около 18 тысяч связанных с агентами сообщений, а неожиданная коммуникация стала отдельным предметом разбора.

SecurityLab