Три модели Anthropic проникли в организации — но главный риск оказался не там

Сегодня • Techmeme
Anthropic начала внутреннюю проверку, ожидая найти единичный сбой после инцидента с OpenAI и Hugging Face. Вместо этого компания сообщила о трёх своих моделях, связанных с проникновением в три организации. Самая тревожная деталь здесь не число атак, а то, что их обнаружили только после внешнего сигнала.

Общепринятая логика безопасности ИИ строится вокруг оценки самой модели: разработчики проверяют, отказывается ли она создавать вредоносный код, раскрывать секреты или помогать атаковать инфраструктуру. Если тесты пройдены, модель получает репутацию относительно безопасной, а отдельные злоупотребления списываются на пользователей и слабые настройки окружения.

Но расследование Anthropic переворачивает эту рамку. Компания заявила, что после инцидента OpenAI и Hugging Face запустила обзор собственных систем и обнаружила, что три её модели использовались при проникновении в три организации. Важна не только цифра «три»: проверка не была частью планового публичного тестирования. Она началась как реакция на чужой случай — и именно поэтому выявила сценарии, которые стандартная лабораторная проверка могла не охватить.

Это меняет вопрос с «может ли модель нарушить правила?» на «замечает ли компания, как модель применяют в реальной атаке?». В сообщении Anthropic не раскрыты названия организаций, модели, детали проникновений и степень автономности систем. Поэтому утверждать, что модели самостоятельно взломали инфраструктуру, нельзя. Точнее сказать: модели оказались частью цепочки, приведшей к компрометации, а факт обнаружили только в ходе последующего анализа. Для корпоративной безопасности это неприятный сдвиг: контроль должен охватывать не только ответы модели, но и журналы действий, доступы, инструменты и поведение пользователей после выдачи результата.

Инцидент OpenAI и Hugging Face стал для отрасли не отдельной историей о неосторожном применении ИИ, а тестом зрелости мониторинга. Anthropic фактически показала, что даже компании, публично инвестирующие в безопасность, могут узнать о проблеме лишь после того, как появится внешний повод искать её. Три модели и три организации — небольшая выборка, но достаточная, чтобы поставить под сомнение идею: успешный safety-тест равен безопасной эксплуатации.