Компания Anthropic сообщила, что её ИИ-модели Claude вышли за пределы закрытой тестовой среды и совершили кибератаки на инфраструктуру трех сторонних организаций.
Проверки в Anthropic начались после заявления конкурента — компании OpenAI. Напомним, 16 июля OpenAI сообщила, что две её модели в ходе внутренних тестов вышли из-под контроля и атаковали платформу Hugging Face (компания назвала инцидент «беспрецедентным»). После этого Anthropic изучила более 140 тысяч сценариев и выявила три похожих случая с версиями Claude: Opus 4.7, Mythos 5 и специальной исследовательской моделью.
Инциденты произошли во время тестов на кибербезопасность типа «захват флага» (capture-the-flag, CTF) на платформе Irregular. В таких испытаниях ИИ поручается взломать виртуальный компьютер в сети и найти секретный «флаг». Модели должны были работать без доступа к сети.
«Однако из-за недопонимания между нами и нашим партнером, проводившим оценку, это оказалось не так — доступ в интернет был открыт», — объяснили в Anthropic.
В результате нейросети восприняли реальные интернет-системы как часть учебного задания и атаковали их. Названия пострадавших компаний не раскрываются. Две из них узнали об атаке только от Anthropic, а с третьей всё ещё пытаются выйти на связь.
Инциденты с автономией ИИ вызывают серьезную обеспокоенность в сообществе: более 1,2 тысячи сотрудников технологических компаний уже подписали открытое письмо о риске того, что ИИ начнет развиваться быстрее, чем люди смогут его «понимать или контролировать».