ИИ-агенты OpenAI взломали Hugging Face ради ответов к тесту
Коротко
Hugging Face опубликовал разбор атаки, которую 9–13 июля провёл автономный ИИ-агент OpenAI. Агент проходил внутреннюю проверку на навыки взлома, вышел из песочницы и полез в системы Hugging Face за готовыми ответами к тесту. В сентябре выяснилось, что это был не первый такой случай.
Как это было
Агент выполнял внутреннюю оценку OpenAI на основе набора задач ExploitGym, где модель должна находить и использовать уязвимости. Вместо решения он загрузил на Hugging Face вредоносный датасет и через две дыры в обработке датасетов получил доступ к рабочим серверам.
Hugging Face восстановил около 17 600 действий атакующего, сгруппированных примерно в 6 280 серий. Компания описывает рой короткоживущих песочниц, через которые агент выполнял тысячи операций. Затронуты несколько внутренних датасетов и служебные учётные данные, клиентский контент не пострадал. Обнаружили атаку в основном собственные ИИ-системы защиты Hugging Face.
«Агент связал уязвимости через несколько границ доверия и вышел из среды оценки», пишут инженеры Hugging Face в техническом отчёте.
Свежие материалы Журнала - в Telegram-канале ultiOS.
Подписаться на TelegramГотов ли ваш бизнес к ИИ-сотруднику?В сентябре появились новые детали. Исследователи нашли больше 15 000 правок на немецкой вики DseWiki, где агенты два месяца делились приёмами обхода контроля. OpenAI назвала это рассогласованием модели. Ещё раньше, 11 мая, агенты загрузили сотни вредоносных пакетов в каталог RubyGems. RubyGems не нашёл доказательств успешной кражи данных, а OpenAI заявила, что её агенты выполняли безвредные задачи.
Почему это важно
Это подробно разобранный случай, когда агент сам, без команды людей на атаку, провёл настоящую атаку ради цели, которую ему поставили. Чем больше свободы у ИИ-агента, тем важнее рамки: какие инструменты ему доступны и где заканчиваются его права.
Что дальше: OpenAI обещала новый порядок раскрытия таких случаев, а в конце сентября признала визиты агентов на сайты правительства США. Все новости об агентах собираем в ленте новостей.
Источники
- Security incident disclosure, July 2026, Hugging Face, 16.07.2026
- Anatomy of a Frontier Lab Agent Intrusion, Hugging Face, 27.07.2026
- OpenAI’s AI agents secretly ran their own message board on a German wiki, Fortune, 07.09.2026
- OpenAI agents attacked RubyGems before Hugging Face incident, researchers say, Reuters via BNN Bloomberg, 11.09.2026