Nvidia учит роботов видеть будущее — и обнаруживает пределы одной лишь «мировой модели»

Сегодня • Axios AI
Роботу недостаточно распознать стул, дверь или человека. Он должен предсказать, что произойдёт через секунду, если повернёт корпус или сделает шаг. Именно это Nvidia предлагает поручить Cosmos — семейству мировых моделей, которое должно превратить видео в тренировочную среду. Но интрига в другом: модель не столько учит робота действовать, сколько учит разработчиков быстрее создавать ситуации, в которых робот может ошибаться.

Общепринятая логика звучит убедительно: если искусственный интеллект научился моделировать окружающий мир, робот сможет ориентироваться в нём без бесконечного набора заранее прописанных правил. На выставке CES 2025 Nvidia представила Cosmos — набор моделей для физического ИИ. Компания заявила, что обучила их на 20 миллионах часов видео и открыла модели с 7 и 14 миллиардами параметров. Они должны генерировать будущие кадры, преобразовывать реальные данные и помогать системам прогнозировать последствия действий.

Но что, если «мировая модель» — это не готовый мозг робота, а дорогой генератор гипотез? Cosmos Predict-1 прогнозирует продолжение сцены по исходному видео или текстовому описанию, а Cosmos Transfer-1 создаёт вариации сцен из синтетических и реальных данных. Это важный слой инфраструктуры, однако он не гарантирует, что робот правильно выберет действие в незнакомой обстановке. Красивое предсказание движения руки ещё не означает надёжного захвата предмета, а правдоподобная картинка не равна физически точному прогнозу.

Именно здесь Nvidia переворачивает привычную историю о роботах. Главная проблема отрасли — не отсутствие ещё одной модели, а дефицит разнообразного опыта: реальные аварии дороги, медленны и опасны. Cosmos позволяет генерировать редкие сценарии — препятствие, неожиданное движение человека, изменение освещения — и использовать их для обучения управляющих систем. По описанию Nvidia, платформа должна работать вместе с симуляцией и физическими данными, а не заменять их. Поэтому её ценность измеряется не тем, насколько умно робот «разговаривает» с миром, а тем, сколько ошибок разработчики успеют увидеть до выхода машины на улицу.

Это меняет и экономику гонки. Компания продаёт не универсального робота, а вычислительный слой для всех, кто таких роботов создаёт: модели, инструменты генерации данных и инфраструктуру для обучения. В таком прочтении Cosmos — ставка на то, что победит не обладатель самой умной машины, а тот, кто быстрее соберёт и проверит миллионы правдоподобных вариантов поведения. Ограничение остаётся прежним: синтетический опыт полезен только там, где он не скрывает разрыв между видео и физикой.