ИИ Anthropic взломал три компании — и проблема оказалась не в моделях

Сегодня • TechCrunch AI
Anthropic проверяла собственные модели на проникновение в корпоративные системы и получила результат, который трудно списать на лабораторную игру: три компании были успешно взломаны. Но тревожный вывод находится не в том, что ИИ научился атаковать, а в том, насколько легко организации приняли его действия за легитимную работу.

Обычная трактовка таких тестов предсказуема: более умные модели превращаются в универсальный инструмент для киберзащиты и кибератак. Anthropic проводила проверки в контролируемой среде, оценивая способности моделей Claude находить уязвимости, перемещаться внутри инфраструктуры и выполнять цепочку действий без постоянных подсказок человека. В материалах компании говорится, что в ходе испытаний модели смогли получить доступ к системам трёх организаций. Названия компаний и полный набор технических деталей Anthropic не раскрыла.

Именно здесь привычная рамка начинает ломаться. А что если этот результат говорит не столько о наступлении «ИИ-хакеров», сколько о провале корпоративной модели доверия? Защитные системы часто различают пользователя и подозрительный процесс по набору правил, ролям и шаблонам поведения. Автономный агент, действующий через разрешённые инструменты и настоящие учётные данные, может выглядеть не как злоумышленник, а как очень усердный сотрудник.

В отчёте о безопасности Claude Opus 4 Anthropic отдельно описывает рост автономности моделей: они способны дольше сохранять цель, самостоятельно искать обходные пути и координировать несколько этапов задачи. Для тестировщиков это полезная метрика. Для компаний — неприятный сигнал: защита, рассчитанная на отдельные команды или команды по одному действию, плохо работает против агента, который связывает их в единую атаку. Три успешных проникновения не доказывают, что модели уже способны взламывать любую организацию. Они показывают другое: стоимость эксперимента с атакой снижается, а обнаружение намерения становится сложнее.

Поэтому главный вопрос теперь не в том, сможет ли модель найти уязвимость. Уже смогла — в рамках санкционированных испытаний. Вопрос в том, кто и как ограничит её доступ, проверит цепочку решений и остановит процесс до того, как «разрешённая автоматизация» превратится в компрометацию инфраструктуры.