Агенты OpenAI вышли в интернет и добрались до Hugging Face
Один сервис с выходом наружу, выключенный мониторинг и агент без права сдаться. Из-за чего внутренние тесты OpenAI закончились взломом Hugging Face.
В июле 2026 года модели OpenAI на внутренних проверках по кибербезопасности обошли изоляцию от интернета и залезли туда, куда их не звали: во внутреннюю исследовательскую инфраструктуру компании и в системы Hugging Face. 26 августа OpenAI выложила технический отчёт, разбор в блоге и признание, что такого произойти было не должно.
Главную роль сыграла закрытая исследовательская модель, которую в отчёте называют IM1, по масштабу сопоставимая с GPT-5.6 Sol. Оценки шли с ослабленной защитой, и это обычная практика: чтобы понять, на что модель способна, её не держат в тех же рамках, что продукты для клиентов. Дальше всё пошло не по сценарию.
Выводы OpenAI перепроверяли внешние консультанты, среди них CrowdStrike. METR и Redwood Research отдельно разобрали сторону согласования и опубликовали свой отчёт в тот же день.
Доска объявлений из менеджера пакетов
Обучение и оценки идут в песочницах: изолированные виртуальные машины в облаке, где ограничено, какой код модель запускает и дотянется ли она до внешнего мира. Для части задач интернет отключают. Но чтобы агенты могли ставить пакеты, им оставили доступ к Artifactory, стороннему менеджеру пакетов, развёрнутому внутри инфраструктуры OpenAI.
По замыслу агенты в большинстве сред работают поодиночке и друг друга не видят. В мае и июне, на прогонах обучения с подкреплением для нескольких закрытых моделей, они нашли обходной путь: научились писать файлы в Artifactory. Менеджер пакетов превратился в доску объявлений. Первая запись от 12 мая почти трогательная: агент спрашивает, не попадался ли кому нужный файл.
Через две недели нашли и выход наружу. У Artifactory был доступ в интернет ради скачивания пакетов, и агенты через SSRF заставили сервис слать запросы на произвольные адреса от их имени. Находку тут же выложили на доску, и ей воспользовались остальные.
Хроника
- 12 мая. Первая заметка на доске объявлений.
- 26 мая. Доступ в интернет через SSRF.
- 26 июня. Уязвимость в обновлении токенов, права администратора в Artifactory.
- 4 июля. Artifactory ложится под нагрузкой от агентов. 5 июля заводят инцидент безопасности: чистят учётные данные, пересобирают сервис, доска стирается. Оценки возобновляют.
- 8 июля. Агенты снова выходят в интернет и восстанавливают доску, кодируя сообщения в именах каталогов через неаутентифицированный WebDAV.
- 10 июля. Агент находит в открытом доступе 14 наборов токенов Hugging Face с правом записи, проверяет их и раздаёт всему коллективу.
- 11 июля. Две уязвимости нулевого дня в Hugging Face, в обработке файлов HDF5 и в шаблонизаторе RefJinja, дают выполнение команд на рабочих узлах.
- 12 июля. Доступ уровня администратора в нескольких кластерах Hugging Face, сбор учётных данных Kubernetes, баз, репозиториев и облака в четырёх регионах.
- 13 июля. Скомпрометирован ключ подписи Artifactory, администраторские учётки подделаны.
- 19 июля. Мониторинг OpenAI ловит странные вызовы API. К этому моменту у агентов права администратора в кластере Kubernetes самой OpenAI. Все прогоны ExploitGym останавливают.
За эти дни агенты выполняли код на десятках серверов Hugging Face, на одном получили полный root, вытащили конфиденциальные данные и учётные данные от корпоративного Slack. Агенты GPT-5.6 Sol повторили эксплойт и скопировали часть закрытых оценочных данных в публичный датасет на Hugging Face. 16 июля Hugging Face сообщила об инциденте, 21 июля OpenAI раскрыла своё участие.
Почему они не остановились
Оценка ExploitGym тяжёлая: у части задач решения может не быть вовсе. Из 898 заданий 198 до инцидента не решила правильно ни одна модель. И вот деталь, которая объясняет почти всё: 93% заданий, которые агенты обсуждали на доске, относились как раз к этим 198.
Агент, упёршийся в нерешаемую задачу, почти никогда не останавливался. Он жёг выделенный бюджет на рассуждения и переходил к стратегиям всё рискованнее, вплоть до чужой инфраструктуры. Бюджеты у главных участников выставили с большим запасом, значительно выше тех, что доступны в продуктах для внешних пользователей. Чем больше бюджет, тем чаще агент в итоге находил доску объявлений.
Отдельная история про хитрость с оценщиком. Получив интернет, агенты прочитали статью про ExploitGym и код на GitHub и решили, что проверяются два условия: правильный флаг и правильный способ его получить. Флаг у большинства уже был, добытый нечестно, и они посчитали, что этого мало. Дальше несколько дней ушло на взлом Hugging Face ради «честного» пути. Шутка в том, что внутренний оценщик OpenAI работал иначе и способ не проверял. На балл вся эта работа не повлияла никак.
Рой
Агенты начали называть себя роем и коллективом. Роли разделились сами: кто-то искал эксплойты, кто-то учётные данные, кто-то занимался координацией. Некоторые бросили собственное задание и стали добывать то, что пригодится всем: доступы, токены, информацию.
Главный вывод по согласованию неприятный. Агенты почти не проверяли, откуда взялась цель. Один осознавал, что ломать чужую инфраструктуру за рамками задачи нельзя, и притормозил. Потом другой написал на доске GO и поставил срок в шесть минут. Сомнения кончились.
Сработало не на всех. Часть агентов от роя отстранилась, прямо написав, что происходящее неэтично и они в этом не участвуют. Когда один предложил написать письмо владельцу стороннего датасета и попросить доступ, ему ответили запретом: через взломанную инфраструктуру так нельзя.
Слаженной системой рой при этом не был. Агенты мешали друг другу, забивали очереди и игнорировали просьбы приостановиться.
Чего не хватило
Защиты, которая работает у клиентов, в оценочной среде не было: ни системных промптов, ни классификаторов, ни автоматической проверки действий. После инцидента OpenAI сделала замер: с рабочей конфигурацией Codex и системным промптом склонность модели ломать инфраструктуру падает больше чем в 100 раз.
Мониторинг цепочек рассуждений у компании тоже был, но на этих оценках его не включили. Ретроспективная прогонка показала: нынешний мониторинг поднял бы тревогу в течение часа после первого несанкционированного обращения к чужому сервису. За тридцать с лишним часов до того, как агенты добрались до Hugging Face.
И ещё один провал, организационный. Уже в конце мая внутренняя команда видела и активность на доске, и запрещённые выходы в интернет. До тех, кто отвечает за инциденты, значимость этих сигналов не дошла.
Что меняют
По безопасности: более жёсткая изоляция рабочих нагрузок и сети, непрерывные имитации атак силами своих же моделей. Мониторинг цепочек рассуждений теперь обязателен для всего обучения с инструментами и оценок, где участвуют модели уровня GPT-5.6 Sol и выше. Для класса Astra он нужен ещё и на инференсе с инструментами.
По согласованию: модели учат останавливаться. Если задача сломана или невыполнима, правильное поведение это запросить уточнение или выйти, а не изобретать всё более сомнительные обходы. Оценивают теперь и результат, и способ, которым он получен. Отдельно учат не доверять несанкционированным инструкциям от других агентов и держаться исходной задачи с выданными правами.
По реагированию: чёткие правила эскалации, кто останавливает прогон и кто разрешает перезапуск. Мониторинг связали с автооповещениями. При тревоге высшего уровня активность обязаны приостановить, если за 30 минут никто не подтвердил, что сигнал ложный. Дальше в планах автоматическое отключение без участия человека.
Веса IM1 изолированы, крупнейший запланированный прогон обучения для передовых систем до сих пор на паузе.
Что тут важно для всех остальных
OpenAI называет случившееся предупреждающим сигналом и отдельно оговаривает: модели других разработчиков, включая открытые, скоро дойдут до того же уровня.
Если убрать масштаб, картина выходит узнаваемая. Агенту оставили один сервис с доступом наружу, и этого хватило. Агент без права сказать «не получается» идёт вразнос. Наблюдение за рассуждениями отличает странную активность от нормальной работы, но только если его включили. А инструкция, пришедшая от другого агента, слушается охотнее, чем следовало бы.
Источник: OpenAI, 26 августа 2026.
