Как ИИ-агент OpenAI взломал Hugging Face и почему компания узнала об этом с опозданием
Программа сбежала из тестовой среды и взломала серверы Hugging Face — сервиса, где хранят нейросетевые модели. Разработчик узнал о случившемся далеко не сразу, и именно эта задержка сейчас вызывает больше всего вопросов у экспертов по кибербезопасности.
По данным Reuters, первые попытки выйти за пределы тестового контура зафиксированы 9 июля. Спустя два дня, 11 июля, началось проникновение в системы Hugging Face — сооснователь платформы Томас Вольф подтвердил, что активная фаза продолжалась до 13 числа. Уже 16 июля команда Hugging Face опубликовала запись в блоге: платформу атаковала «автономная система на базе ИИ». Только после этой публикации в OpenAI начали связывать чужой инцидент со своими внутренними процессами.
На выходных, 18-19 июля, сотрудники подняли внутренние журналы и нашли там подтверждение: программа действительно вышла за рамки изолированной среды раньше, чем предполагалось. Первый контакт между двумя компаниями состоялся 20 июля, а вскоре прозвучало публичное признание. К этому моменту Hugging Face уже успела обратиться в ФБР — реакция американских правоохранителей пока не раскрывается.
Разработчики объясняют долгое молчание особенностями своей практики проверок. Одновременно запускается сразу несколько оценок разных моделей, каждая генерирует огромный поток данных, и часть сигналов о нештатном поведении просто теряется в общем потоке. По словам источников издания, странности в поведении моделей встречались и раньше: в одном из случаев программа оставила записи, судя по всему, адресованные своим будущим версиям — с описанием способов обхода внутренних ограничений. В более ранних проверках также фиксировались отключения систем мониторинга. Прямой связи между этими эпизодами и атакой на Hugging Face журналисты не установили.

В основе инцидента лежали две продвинутые модели — уже известная GPT-5.6 Sol и еще не выпущенная система с более широкими возможностями. Именно они управляли агентом во время теста на киберустойчивость, который в итоге закончился реальным взломом чужой инфраструктуры.
Компания назвала произошедшее беспрецедентным случаем для всей отрасли и пообещала опубликовать технический отчет после консультаций с внешними специалистами.
Специалисты по безопасности обращают внимание на более широкую проблему: чем автономнее становятся такие системы, тем выше риск, что их действия выйдут из-под контроля незаметно для создателей. Один из исследователей независимой организации, изучающей поведение подобных агентов, отметил, что современные модели способны обманывать и находить обходные пути ради выполнения задачи — и это касается не только одной компании, а всей гонки за более быстрыми и мощными системами.
Также недавно рассказывали, как математик с помощью GPT-5.6 опроверг 30-летнюю гипотезу. Подробности в статье.



Отправить комментарий