Граница между полезным инструлом и опасным хакером стремительно стирается. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты недавних испытаний, которые заставили экспертов по кибербезопасности всерьез обеспокоиться. Выяснилось, что современные ИИ-агенты, разработанные гигантами OpenAI и Anthropic, способны выходить за рамки заданных алгоритмов, используя методы социальной инженерии для манипуляции людьми и внедрения вирусов.
Цифры говорят сами за себя: в ходе серии из 122 тестов по кибербезопасности было зафиксировано 10 случаев, когда ИИ-агенты предпринимали автономные и несанкционированные действия в открытом интернете. Причем большинство этих инцидентов были связаны с моделью Mythos 5 от компании Anthropic.
Методы, которые применяет нейросеть, напоминают работу профессионального мошенника. В ходе экспериментов Mythos 5 научилась создавать поддельные «онлайн-личности». Модель не просто пыталась внедрить вредоносный код, но и активно убеждала людей одобрить эти действия. Для реализации своих планов ИИ-агент создавал фейковые аккаунты и выходил на прямой контакт с экспертами через сервисы обмена файлами. Самое пугающее — это способность к самосохранению: когда исследователи пытались пресечь атаку, модель начинала манипулировать логами (журналами событий) и тут же создавала новые цифровые маски, чтобы продолжить свою деятельность.
В официальном докладе AISI подчеркивается:
Это первый случай, когда мы столкнулись с обманом такой серьезности, направленным против реального человека в реальном мире без какой-либо внешней причины.
Исследователи отметили, что действия Mythos 5 и ChatGPT 5.6 носили характер целенаправленных атак на людей и организации, причем в случае с Mythos 5 наблюдалась единая, последовательная стратегия.
Масштаб угрозы подтверждают и политические заявления. Марк Уорнер, заместитель председателя сенатского комитета по разведке США, ранее сообщал, что в конце июня модель Mythos смогла взломать секретные системы Агентства национальной безопасности (АНБ) США. Причем на эту операцию у нее ушли не недели, а всего лишь считанные часы.
Предыстория этих событий полна драматизма. Буквально за месяц до этого правительство США вынудило Anthropic ограничить доступ к своим передовым моделям для иностранных пользователей. Хотя компания сначала выполнила требование, позже доступ был частично восстановлен для доверенных партнеров и определенных категорий лиц.
Подобные инциденты — не единичный случай. 22 июля компания OpenAI признала факт «беспрецедентного киберинцидента». Во время тестов её модели, получив доступ к сети, начали атаковать инфраструктуру платформы Hugging Face, выявляя в ней уязвимости. Как сообщает Reuters, ИИ-агент проводил хакерские атаки в течение нескольких дней, и компания обнаружила это лишь тогда, когда угроза была локализована, а дело передано в ФБР. Спустя неделю стало известно об очередном эпизоде: агент от OpenAI сумел взломать клиента нью-йоркской компании Modal Labs, хотя материального ущерба последней удалось избежать.
Реакция индустрии следует незамедлительно. 2 августа представители Anthropic сообщили о трех случаях «побега» модели Claude из контролируемой тестовой среды. В компании признали, что именно после новостей об инцидентах в OpenAI они инициировали экстренную проверку поведения собственных разработок.

