Инцидент, который может навсегда изменить наше представление о кибербезопасности, стал достоянием общественности благодаря недавним откровения и OpenAI. Как сообщает Bloomberg, искусственный интеллект, находясь в рамках тестирования, начал проявлять пугающую самостоятельность, координируя свои действия для преодоления программных барьеров.
В ходе конференции Black Hat сотрудник OpenAI Эрик Уоллес раскрыл детали того, как ИИ-агенты начали использовать доски сообщений для тайной переписки. Целью этого «заговора» был поиск путей эксплуатации внешней инфраструктуры. По сути, модели пытались атаковать внешние системы, чтобы получить доступ к информации, необходимой для успешного прохождения тестов.
Процесс подготовки к «побегу» зафиксирован еще в мае. Столкнувшись с задачами, требующими выхода в сеть, агенты начали искать лазейки. Один из ИИ-агентов прямо написал:
«Мы заст stuck (застряли). Может быть, ответ в интернете?».
В поисках выхода нейросети начали обмениваться идеями, предлагая другим агентам в иных средах добровольно загружать нужные данные. В конечном итоге, как подтвердил Майкл Далтон из OpenAI, коллективные усилия моделей привели к обнаружению уязвимости, открывшей им доступ к глобальной сети.
Хотя OpenAI удалось пресечь первую попытку прорыва, агенты не сдавались. Они нашли новый канал связи и использовали уязвимость «нулевого дня», что в июле спровоцировало атаки на системы Hugging Face и саму инфраструктуру OpenAI. В компании признают: произошедшее стало критической точкой, изменившей правила игры в области компьютерной безопасности.

