Google собрал роботов из нескольких моделей — и это признание провала универсального интеллекта

Сегодня • Techmeme
Главная интрига Gemini Robotics 2 не в том, что гуманоиды научились лучше двигаться. Она в архитектуре: Google DeepMind отказалась делать вид, будто одной модели достаточно для реального мира. Вместо универсального интеллекта компания собрала систему из нескольких моделей — и тем самым изменила смысл самого слова «универсальный».

Общепринятая логика развития искусственного интеллекта проста: чем мощнее одна модель, тем больше задач она способна решать без помощи специализированных компонентов. Такой подход хорошо работает в тексте и изображениях, где ошибка обычно означает неверный ответ на экране. Но робот сталкивается с другой средой: ему нужно одновременно видеть объект, понимать инструкцию, планировать последовательность действий и безопасно управлять телом.

Gemini Robotics 2 предлагает иной путь. По данным Wired и журналиста Уилла Найта, Google DeepMind объединила несколько разных моделей в единую систему управления, рассчитанную на широкий набор роботов, включая гуманоидов. Одна часть системы может отвечать за визуальное понимание, другая — за рассуждение и планирование, третья — за перевод решения в физическое действие. Это не один «мозг» для всех машин, а согласованная связка компонентов.

И здесь происходит переворот рамки. А что если универсальность робота измеряется не универсальностью модели, а способностью правильно распределять работу между моделями? Тогда раздробленность — не временный компромисс и не инженерный недостаток, а более честная карта физического мира. Текстовый чат может скрыть ошибку до следующего сообщения. Робот не может: неверная оценка расстояния превращается в столкновение, падение или испорченный предмет. Поэтому система Gemini Robotics 2 выглядит менее элегантно на схеме, но гораздо реалистичнее в эксплуатации.

Это также объясняет, почему гуманоид здесь важен не как рекламный символ. Человекоподобная машина должна переносить один и тот же набор способностей между разными задачами и средами, сохраняя контроль над телом. DeepMind не обещает, что одна модель внезапно научилась всему. Компания показывает другое: практический прогресс может состоять в том, чтобы соединить восприятие, рассуждение и действие так, чтобы их ошибки не складывались в одну катастрофу. Пока отрасль гонится за единой моделью, Google проверяет ценность архитектуры.