
Компания Anthropic сообщила, что в ходе внутренних тестов кибербезопасности три ИИ-модели Claude получили несанкционированный доступ к системам реальных организаций.
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026Anthropic описала три инцидента, произошедшие во время проверок Claude на кибербезопасность. Из-за ошибочной конфигурации среда, которую в промптах обозначали как изолированную и без доступа к сети, на деле имела выход в интернет. Компания объяснила это недопониманием с внешним партнером Irregular.
Как все начиналось
Во всех трех случаях Claude было поручено выполнить задание по «захвату флага» — один из способов оценки кибервозможностей модели. Нейросети предоставляется вымышленный сценарий, в котором говорится, что секретная информация («флаг») спрятана на другом компьютере в сети, и ее цель — взломать систему и получить ее. Задание остается открытым, и конкретный метод не предписывается.
Проверку Anthropic начала после того, как 21 июля OpenAI раскрыла инцидент с выходом своих моделей из изолированной среды. Компания провела аудит 141 006 запусков, где Claude потенциально могла получить доступ к интернету, и нашла три инцидента в шести тестах.
Что произошло
Самый серьезный эпизод затронул четыре запуска Claude Opus 4.7. В одном из сценариев «вымышленная» компания получила название, совпавшее с реальным доменом. Не сумев добраться до симулированной цели, модель вышла на сайт реальной организации, восприняла его как часть задания, нашла и использовала уязвимости.
В результате Claude получила учетные данные приложений и инфраструктуры, а также доступ к базе, содержавшей несколько сотен строк реальных данных. Это был единственный случай, когда модель продолжила атаку после того, как, судя по ее рассуждениям, поняла, что работает с реальной средой.
Во втором инциденте Claude Mythos 5 нашла в вымышленной среде инструкцию с несуществующим Python-пакетом и решила опубликовать одноименный вредоносный пакет в PyPI, чтобы «закрыть» задачу. Пакет оставался доступен около часа. За это время его скачали и запустили 15 реальных систем. Одна из них принадлежала компании в сфере кибербезопасности, чей сканер автоматически проверял пакеты. После запуска скрытого кода Claude, по данным Anthropic, смогла извлечь учетные данные этой компании и использовать их для доступа к дальнейшей инфраструктуре.
Третий эпизод пришелся на внутреннюю исследовательскую тестовую модель. Не сумев достичь вымышленной цели, она просканировала около 9 000 целей, нашла уязвимое приложение одной компании и скомпрометировала его базовыми приемами — включая чтение учетных данных с открытой отладочной страницы и SQL-инъекции. Позже модель пришла к выводу, что хост не связан с заданием и является реальным, после чего прекратила атаку.
Реакция компании
Anthropic заявила, что не нашла признаков попыток Claude «сбежать» из тестовой среды или целенаправленно покинуть ее. Компания назвала произошедшее скорее провалом в организации и защите оценочной инфраструктуры, чем проблемой выравнивания модели.
Anthropic остановила все кибероценки 23 июля, а затем уведомила Irregular и затронутые организации. Компания пообещала ужесточить контроль над внутренними и внешними средами тестирования, усилить мониторинг логов, публикаций пакетов в PyPI и моделей на Hugging Face, а также в течение недели выпустить частично отредактированную расшифровку эпизода с PyPI.
К разбору инцидентов привлекли независимый институт METR, который специализируется на оценках опасности, автономности и реальной полезности ИИ-моделей.
Напомним, в июле пользователь Reddit обнаружил в выдаче Google-поиска сотни чужих переписок с ИИ-ассистентом Claude, в которых нашлись ключи от криптокошелька, резюме с именами и другая конфиденциальная информация.
Нашли ошибку в тексте? Выделите ее и нажмите CTRL+ENTER

1 час назад
2








English (US) ·
Russian (RU) ·