Чем увереннее отвечает ИИ, тем опаснее его логическая ошибка

Сегодня • arXiv cs.AI
Фронтирные языковые модели научились звучать так, будто сомнений не существует. Но именно эта уверенность становится слабым местом, когда системе приходится применять цепочку правил с исключениями. Она не просто ошибается: модель последовательно и убедительно защищает вывод, который уже на первом шаге противоречит условию.

Общепринятая картина прогресса выглядит привычно: больше параметров, длиннее контекст, лучше рассуждение. Если модель способна решить задачу с несколькими ограничениями, значит, следующий уровень сложности должен покориться ей после дополнительного обучения. В большинстве стандартных тестов это предположение подтверждается: ответы становятся точнее, объяснения — длиннее, а уверенный тон воспринимается как побочный признак компетентности.

Тест «Уверенно ошибаясь: коллапс цепочки исключений при оценке правил фронтирными языковыми моделями» переворачивает эту логику. Его объект — не отдельная ошибка, а цепочка условных правил, где каждое следующее исключение меняет действие предыдущего. Когда в задаче появляется второе или третье исключение, модель начинает «схлопывать» структуру: сохраняет общее правило, но теряет приоритет конкретного ограничения. В результате она выдаёт ответ, будто исключений не было вовсе, а затем строит под него связное объяснение.

Ключевой вывод не в том, что модели плохо считают. Они плохо отслеживают происхождение собственного вывода. В сценарии из 12 правил система может правильно пересказать все условия по отдельности, но ошибиться при их совместном применении; при этом повторная проверка часто усиливает первоначальную ошибку вместо исправления. Авторы называют это «уверенной неправильностью»: чем яснее сформулирован запрос и чем убедительнее ожидаемый шаблон ответа, тем легче модель пропускает исключение. Обычный показатель точности здесь скрывает проблему, потому что оценивает финальный ответ, а не сохранность логической цепочки.

Это меняет практический смысл масштабирования. Дополнительные параметры улучшают распознавание закономерностей, но не гарантируют дисциплину приоритетов: правило, исключение, исключение из исключения. Для юридических политик, финансовых лимитов и систем доступа такая ошибка опаснее очевидного «не знаю». Нужны журналы промежуточных решений, машинная проверка правил и тесты, специально построенные на конфликтующих условиях, а не только более длинные рассуждения.