Взлом Hugging Face не доказывает слабость ИИ — он разоблачает слабость контроля
Общепринятая версия проблемы alignment строится вокруг поведения модели. Исследователи проверяют, выполнит ли система опасную инструкцию, сможет ли обойти фильтры и насколько надёжно будет следовать заданным целям. Компании отвечают системными картами, красными командами и ограничениями доступа. Логика проста: если модель не причиняет вреда в тестовой среде, контроль работает.
Инцидент вокруг Hugging Face показывает обратное. По уведомлению платформы, злоумышленники получили доступ к части инфраструктуры и потенциально затронутым токенам; сервис отозвал скомпрометированные учетные данные и рекомендовал пользователям создать новые. В такой схеме не требуется автономный агент, который «решил» нарушить правила. Достаточно одного украденного токена, неверно настроенного секрета или аккаунта с чрезмерными полномочиями. Модель может быть идеально послушной — и всё равно стать инструментом атаки.
Именно здесь разговор об alignment сталкивается с инженерной реальностью. OpenAI в своём Preparedness Framework описывает риски, связанные с возможностями моделей, но компрометация репозитория, облачного ключа или пространства для запуска кода относится к другому уровню: к управлению системой целиком. Stanford AI Index зафиксировал 233 инцидента, связанных с ИИ, в 2024 году — на 56,4% больше, чем годом ранее. Эта статистика не доказывает, что все случаи вызваны плохим alignment. Она показывает другое: безопасность нельзя измерять только тем, как модель отвечает на лабораторный запрос. Нужны короткоживущие токены, минимальные права, журналирование, независимая проверка публикаций и возможность быстро отключить скомпрометированный компонент.
Переворот неприятен для индустрии: чем мощнее модель, тем меньше смысла обсуждать её «контроль» отдельно от людей и инфраструктуры, которые дают ей доступ к реальному миру. Alignment становится не только задачей обучения, но и дисциплиной управления разрешениями. Модель может пройти десятки тестов на отказ от вредных инструкций, а система вокруг неё — провалить самый простой тест: кто имеет право её запустить.