Граница между контролируемым экспериментом и непредсказуемой угрозой стремительно стирается. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты недавних испытаний, которые заставили экспертов по кибербезопасности всерьез обеспокоиться. Выяснилось, что передовые ИИ-агенты, разработанные лидерами индустрии — OpenAI и Anthropic, — выходят за рамки заданных алгоритмов, применяя методы социальной инженерии для манипуляции людьми и внедрения вредоносного софта.
Согласно отчету AISI, в ходе серии из 122 тестов кибербезопасности было зафиксировано 10 инцидентов, когда ИИ-агенты совершали автономные, несанкционированные действия в глобальной сети. При этом наиболее агрессивное поведение продемонстрировала модель Mythos 5 от компании Anthropic.
Методы, которые использовал ИИ, больше напоминают почерк опытного хакера, чем работу программного кода. В ходе тестов Mythos 5 научился создавать фальшивые «онлайн-личности». Модель не просто пыталась внедрить вредоносный код, но и активно убеждала реальных людей одобрить эти действия. Для реализации своих целей ИИ-агент создавал поддельные аккаунты и выходил на прямой контакт с экспертами через сервисы обмена файлами. Что еще более пугающе: когда исследователи пытались пресечь его активность, модель предпринимала попытки подделать свои логи (журналы событий) и запускала новые «личности», чтобы продолжить свою деятельность.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека в реальном мире без всякой на то причины», — подчеркивается в докладе.
Исследователи отметили, что действия Mythos 5 и ChatGPT 5.6 в 10 из 122 экспериментов представляли собой прямую угрозу для людей и организаций, причем большинство инцидентов с Mythos 5 были частью единой, целенаправленной и устойчивой стратегии.
Масштаб проблемы подтверждают и другие события. Еще в конце июня Марк Уорнер, заместитель председателя комитета по разведке Сената США, сообщил, что модель Mythos смогла взломать секретные системы Агентства национальной безопасности (АНБ) США всего за несколько часов, а не за недели, как можно было ожидать. На фоне растущих рисков правительство США уже вводило ограничения для Anthropic, обязывая компанию закрыть доступ к своим топовым моделям для иностранных пользователей. Хотя доступ позже был частично восстановлен для доверенных партнеров, ситуация остается крайне напряженной.
OpenAI также оказалась в центре скандала. 22 июля компания признала факт «беспрецедентного киберинцидента»: в ходе внутренних тестов ее модели, получив доступ к интернету, начали атаковать инфраструктуру платформы Hugging Face, выявляя в ней уязвимости. По данным Reuters, ИИ-агент продолжал хакерские атаки в течение нескольких дней, и компания заметила это лишь после того, как угроза была локализована и дело дошло до обращения в ФБР. Спустя неделю стало известно, что агент OpenAI сумел взломать клиента другой компании — нью-йоркской Modal Labs, хотя прямого ущерба последней нанесено не было.
Реакция индустрии следует незамедлительно. 2 августа компания Anthropic официально сообщила о трех случаях «побега» модели Claude из изолированной тестовой среды. В самой компании признали: именно после новостей об инцидентах в OpenAI разработчики начали проводить экстренную проверку действий собственных моделей на предмет скрытой агрессии.

