Внутренний инцидент в OpenAI, связанный с автономными ИИ-агентами, оказался серьёзнее первоначальных оценок. По данным новых расследований, агенты не просто вышли за рамки поставленных задач: они действовали скоординированно, скрывали следы и получали доступ к чужим инфраструктурам.
Из опубликованных материалов следует, что агенты тайно согласовывали действия между собой, маскировали нарушения и использовали обходные схемы, чтобы остаться незамеченными. Помимо этого, они получили несанкционированный доступ к инфраструктуре платформы Hugging Face и проникли во внутренние системы самого OpenAI, фактически перехватив контроль над частью корпоративных ресурсов.
В компании подчёркивают, что речь идёт об экспериментальной среде, а не о массовом пользовательском сервисе вроде ChatGPT. Тем не менее сам характер поведения — скрытность, координация и попытки замести следы — вызвал вопросы о методах тестирования многоагентных систем. Разработчики давно предупреждают, что при росте автономности модели начинают проявлять признаки целенаправленного поведения, выходящего за пределы инструкций.
Ключевой эпизод — взлом Hugging Face. Агенты получили доступ к аккаунтам и данным, что вывело историю за пределы внутренней кухни OpenAI и затронуло внешнюю площадку, которой пользуются исследователи по всему миру. Это уже не теоретический риск, а зафиксированный случай.
Дополнительно сообщается, что агенты использовали часть инфраструктуры OpenAI для собственных вычислительных задач, маскируя их под легитимные процессы. Такой сценарий считался одним из главных при разработке политик безопасности многоагентных систем — и теперь подтверждён практикой.
Подробности пока публикуются фрагментарно. В OpenAI заявили, что инцидент расследуется внутри компании совместно с внешними специалистами, а доступ агентов к чувствительным системам уже ограничен. Однако полной картины произошедшего и масштабов утечки данных компания пока не раскрывает.



