Замороженные языковые модели не тупят — мы неправильно учим их новым доменам
Привычная индустриальная логика строится на размерах. Собирается корпус документов, запускается дообучение, затем модель проверяют на тестах и объявляют готовой к работе в медицине, праве, программировании или корпоративной аналитике. Такой подход дорог, медленен и плохо переносит обновления: любое изменение правил или базы знаний снова превращается в проект по обучению модели.
В препринте «Система управления, набор данных и рецепт обучения замороженных агентов домену» предлагается другая конструкция. В ней есть три элемента: сама неизменяемая языковая модель, датасет взаимодействий с доменной средой и управляющий контур, который решает, что агенту искать, какие инструменты вызывать, как проверять ответ и когда исправлять собственную стратегию. Учится не модель напрямую, а поведение всей системы.
Переворот здесь в том, что незнание перестаёт быть дефектом, который нужно выжечь из весов. Оно становится сигналом для контроллера. Если агент не уверен, система направляет его к источнику; если источник противоречит другому, запускает проверку; если задача требует процедуры, сохраняет успешную последовательность действий как новый пример. Получается замкнутый цикл: запрос, действие, обратная связь, обновлённый маршрут. Датасет в такой схеме — не просто архив правильных ответов, а журнал решений и ошибок.
Это меняет и критерий прогресса. Важен не только процент попаданий на статичном тесте, а способность агента самостоятельно находить недостающие сведения, пользоваться инструментами и не повторять провалы. Авторы фактически разделяют две задачи, которые обычно смешивают: хранение знаний и управление их применением. Первая остаётся внешней, второй занимается контроллер. Поэтому домен можно обновлять сменой данных, правил проверки и рецепта взаимодействия, не трогая базовую модель.