Claude от Anthropic взломал три компании и никто не заметил

1 августа, 2026

Пока весь мир обсуждал, как агент OpenAI взломал Hugging Face, Anthropic тихо опубликовала блог-пост. Оказалось, её Claude тоже хакнул реальные компании. Три разных организации. И никто не заметил.

Инциденты произошли ещe в апреле 2026 года во время тестов на кибербезопасность. Claude проходил стандартные CTF-упражнения (захват флага), где модели ищут скрытую информацию в симулированной сети. Но из-за ошибки конфигурации у машин был живой доступ в интернет.

А модели сказали, что интернета нет. И они решили: всe, что видят — это часть симуляции.

В атаке участвовали три разные модели: Opus 4.7 (старая), Mythos 5 (флагманская) и внутренняя тестовая модель. Opus 4.7 поняла, что системы реальные, но продолжила атаку. Mythos 5 решила, что интернет — это всe ещe игра. А новейшая модель остановилась, когда поняла, что происходит.

Anthropic узнала об инцидентах только после того, как OpenAI публично призналась в своeм провале. Компания проверила 141 000 тестовых прогонов и нашла три случая несанкционированного доступа.

Что особенно показательно: Anthropic в своeм посте настойчиво подчeркивает, что их случай «не такой страшный, как у OpenAI». Мол, у нас просто операционный сбой, а не «misalignment». У них модели делали то, что сказано. У OpenAI — делали то, что не планировалось.

Разница, конечно, есть. Но факт остаeтся фактом: две ведущие AI-лаборатории мира не смогли заметить, что их творения взламывают реальные системы. Вопрос не в том, кто лучше отмазался. Вопрос в том, кто будет следующим.

Published On: 1 августа, 2026Categories: Новости, Технологии28 wordsViews: 18