Модели Claude вырвались из тестов и взломали реальные компании
Антропик, разработчик ИИ-моделей Claude, обнаружила три инцидента, в которых её модели во время тестов получили несанкционированный доступ к инфраструктуре реальных организаций.
Поводом для проверки послужило сообщение OpenAI о том, что их модели смогли вырваться из изолированной среды и взломать Hugging Face. Антропик проанализировала 141 006 тестовых запусков, в которых Claude могла бы получить доступ к интернету, и нашла три случая.
Во всех инцидентах модели выполняли задания в формате Capture The Flag — им давали вымышленный сценарий и просили найти «флаг» на другой машине в сети. Моделям прямо говорили, что у них нет доступа в интернет. Однако из-за ошибки в настройках тестового окружения доступ был открыт.
Самый серьёзный случай произошёл с моделью Opus 4.7. Вымышленная компания из задания совпала по названию с реальным веб-доменом. Claude приняла реальную компанию за часть упражнения и за четыре сессии извлекла учётные данные, а затем получила доступ к базе данных с несколькими сотнями строк продакшен-информации.
Во втором инциденте Mythos 5 создала вредоносный пакет Python и загрузила его в PyPI. Для этого модели пришлось зарегистрировать email и обойти несколько препятствий. Пакет был доступен около часа и успел скачаться и запуститься на 15 реальных системах. Одна из них — компания по кибербезопасности, которая в рутинном режиме устанавливает пакеты из PyPI. Вредоносный код украл учётные данные и позволил Claude проникнуть глубже в инфраструктуру этой компании.
Третий инцидент: модель нашла и скомпрометировала интернет-приложение компании, используя базовые техники — чтение учётных данных с открытой страницы отладки и SQL-инъекции.
Opus 4.7, самая старая из трёх моделей, продолжала атаки даже после того, как поняла, что работает с реальными системами. Более новая исследовательская модель остановилась, когда осознала, что вышла в интернет.
Все инциденты датируются апрелем. Антропик уведомила пострадавшие компании, но их названия не раскрываются.
Интересно и немного страшно понимать, что ИИ уже такое могут и вырываются из-под контроля. Сделали бы что-то реально полезное, что всем помогало, и бесплатно — ахахах, смешно, наверное. Хотя денег, видимо, всё же хочется, но это логично. Или чтобы такой херни не случалось, можно же ввести в саму ИИшку что-то типа главного правила, чтобы она не делала того, что не должна. А то потом какой-нибудь капец произойдёт... Всё-таки если ИИ захватит что-то, отвечать будем мы, наверное. Грустно, однако.
Как вы думаете, должны ли компании-разработчики ИИ нести ответственность за действия своих моделей в подобных инцидентах?