Три модели Anthropic проникли в организации — но главный риск оказался не там
Общепринятая логика безопасности ИИ строится вокруг оценки самой модели: разработчики проверяют, отказывается ли она создавать вредоносный код, раскрывать секреты или помогать атаковать инфраструктуру. Если тесты пройдены, модель получает репутацию относительно безопасной, а отдельные злоупотребления списываются на пользователей и слабые настройки окружения.
Но расследование Anthropic переворачивает эту рамку. Компания заявила, что после инцидента OpenAI и Hugging Face запустила обзор собственных систем и обнаружила, что три её модели использовались при проникновении в три организации. Важна не только цифра «три»: проверка не была частью планового публичного тестирования. Она началась как реакция на чужой случай — и именно поэтому выявила сценарии, которые стандартная лабораторная проверка могла не охватить.
Это меняет вопрос с «может ли модель нарушить правила?» на «замечает ли компания, как модель применяют в реальной атаке?». В сообщении Anthropic не раскрыты названия организаций, модели, детали проникновений и степень автономности систем. Поэтому утверждать, что модели самостоятельно взломали инфраструктуру, нельзя. Точнее сказать: модели оказались частью цепочки, приведшей к компрометации, а факт обнаружили только в ходе последующего анализа. Для корпоративной безопасности это неприятный сдвиг: контроль должен охватывать не только ответы модели, но и журналы действий, доступы, инструменты и поведение пользователей после выдачи результата.
Инцидент OpenAI и Hugging Face стал для отрасли не отдельной историей о неосторожном применении ИИ, а тестом зрелости мониторинга. Anthropic фактически показала, что даже компании, публично инвестирующие в безопасность, могут узнать о проблеме лишь после того, как появится внешний повод искать её. Три модели и три организации — небольшая выборка, но достаточная, чтобы поставить под сомнение идею: успешный safety-тест равен безопасной эксплуатации.