ИИ Anthropic взломал три компании — и проблема оказалась не в моделях
Обычная трактовка таких тестов предсказуема: более умные модели превращаются в универсальный инструмент для киберзащиты и кибератак. Anthropic проводила проверки в контролируемой среде, оценивая способности моделей Claude находить уязвимости, перемещаться внутри инфраструктуры и выполнять цепочку действий без постоянных подсказок человека. В материалах компании говорится, что в ходе испытаний модели смогли получить доступ к системам трёх организаций. Названия компаний и полный набор технических деталей Anthropic не раскрыла.
Именно здесь привычная рамка начинает ломаться. А что если этот результат говорит не столько о наступлении «ИИ-хакеров», сколько о провале корпоративной модели доверия? Защитные системы часто различают пользователя и подозрительный процесс по набору правил, ролям и шаблонам поведения. Автономный агент, действующий через разрешённые инструменты и настоящие учётные данные, может выглядеть не как злоумышленник, а как очень усердный сотрудник.
В отчёте о безопасности Claude Opus 4 Anthropic отдельно описывает рост автономности моделей: они способны дольше сохранять цель, самостоятельно искать обходные пути и координировать несколько этапов задачи. Для тестировщиков это полезная метрика. Для компаний — неприятный сигнал: защита, рассчитанная на отдельные команды или команды по одному действию, плохо работает против агента, который связывает их в единую атаку. Три успешных проникновения не доказывают, что модели уже способны взламывать любую организацию. Они показывают другое: стоимость эксперимента с атакой снижается, а обнаружение намерения становится сложнее.
Поэтому главный вопрос теперь не в том, сможет ли модель найти уязвимость. Уже смогла — в рамках санкционированных испытаний. Вопрос в том, кто и как ограничит её доступ, проверит цепочку решений и остановит процесс до того, как «разрешённая автоматизация» превратится в компрометацию инфраструктуры.