Optimus после перезапуска: Tesla перерисовала гуманоида и поставила на обучение по видео

Программа человекоподобного робота Tesla пережила непростой год: смена руководителя, сорванные планы по производству, дефицит магнитов и — самое интересное — полная смена методики обучения. Вместо того чтобы «водить робота за руку» с помощью операторов в VR-костюмах, Tesla решила учить Optimus по видеозаписям людей. Разбираемся, почему это рискованная, но потенциально революционная ставка — и почему красивые демо пока не означают рабочий продукт.

Что случилось с программой Optimus

Человекоподобный робот Optimus (ранее его называли Tesla Bot) был анонсирован Илоном Маском в 2021 году как проект, который «со временем станет важнее автомобильного бизнеса». С тех пор Tesla регулярно показывала видео: робот ходит, складывает рубашки, сортирует детали на заводе. Планы были амбициозными — тысячи единиц в 2025 году для внутреннего использования на собственных заводах.

Реальность оказалась жёстче. В июне 2025 года программу покинул её руководитель Милан Ковач, отвечавший за Optimus с ранних этапов. Ответственность перешла к команде автопилота и AI — той самой, что занимается системой FSD (Full Self-Driving) в автомобилях Tesla. Это не просто кадровая перестановка, а сигнал о смене философии: Optimus окончательно перестал быть «инженерным проектом про механику» и стал «проектом про нейросети».

Параллельно выяснилось, что производственные планы сорваны. Маск публично признавал проблемы, включая неожиданную: дефицит постоянных магнитов для электродвигателей актуаторов из-за экспортных ограничений Китая на редкоземельные материалы. Одновременно Tesla подтвердила, что перерабатывает сам дизайн робота — третья крупная итерация с новыми кистями рук, у которых больше степеней свободы, и переработанной механикой. Точный состав изменений компания раскрывает выборочно.

От телеуправления — к YouTube-подходу

Главное изменение касается не железа, а данных. Чтобы понять его суть, нужно разобраться, как вообще учат роботов делать что-то полезное.

Классический подход последних лет — обучение через демонстрацию с телеуправлением. Оператор надевает VR-шлем и сенсорный костюм (или использует специальные контроллеры), и робот в реальном времени повторяет его движения. Система записывает всё: что «видел» робот камерами, какие сигналы шли на моторы, какой результат получился. Из тысяч таких записей нейросеть учится: «когда я вижу стакан на столе, вот такая последовательность движений приводит к тому, что стакан оказывается в посудомойке».

Метод работает, но у него есть фундаментальный предел: он дорогой и медленный. Каждый час данных — это час работы оператора плюс износ робота, поломки, перенастройка. Хорошие телеуправляемые демонстрации стоят десятки долларов за минуту. А для универсального робота данных нужно астрономически много.

Tesla делает ставку на альтернативу: обучение по видео обычных людей. Снимайте человека, который моет посуду, складывает бельё или собирает деталь на конвейере — с камеры на груди или голове (вид от первого лица) и со стороны — и пусть нейросеть извлекает из этих записей, что именно делается и как. Таких видео можно собирать массово и дёшево: нанять сотни людей с экшн-камерами несравнимо проще, чем держать парк телеуправляемых роботов.

Логика понятна и знакома: именно так Tesla масштабировала данные для автопилота. Миллионы автомобилей клиентов ездят по миру и присылают видео — никакой конкурент с парком тестовых машин не соберёт столько разнообразных ситуаций. Идея «перенести этот трюк на роботов» выглядит естественным продолжением корпоративной ДНК.

Проблема, о которой не говорят в презентациях

Но между автомобилем и гуманоидом есть принципиальная разница. Автомобиль Tesla, приславший видео, — это та же машина, что учится на этих данных. Камеры, геометрия, физика совпадают. С роботом всё сложнее.

Инженеры называют это embodiment gap — «разрыв воплощения». Человек и Optimus — разные тела. У человека другие пропорции конечностей, иная масса и центровка, другие суставы, гибкая кисть с 27 костями против механической руки с ограниченным числом степеней свободы. Человек чувствует давление кожей, слышит, как скрипит дверца, инстинктивно компенсирует вес сумки. Видео не передаёт ни усилий, ни тактильных ощущений — только картинку.

Поэтому задача «посмотрел видео человека — повторил роботом» распадается на две трудные части. Первая — понять смысл действия из видео (взял чашку, перенёс, поставил). Современные нейросети делают это всё лучше. Вторая — перевести это понимание в выполнимые команды для конкретного механического тела: какие углы в суставах, с какой силой, в какой последовательности. И вот здесь публичных данных о том, как именно Tesla решает задачу, практически нет. Вероятно, используется комбинация: видео даёт «план» и понимание сцены, а отработка конкретных движений добирается через симуляцию и ограниченное количество данных с самих роботов. Но это реконструкция, а не задокументированный факт — технические детали компания не публикует.

Честно будет сказать: независимых подтверждений эффективности видео-обучения Optimus не существует. Все демонстрации исходят от самой Tesla, сняты самой Tesla и могут быть отобраны из множества дублей. Доля автономности в них тоже неясна — насколько робот действует сам, а насколько им дистанционно подстраховывают. Это стандартная ситуация для индустрии (так поступают почти все), но держать её в уме стоит.

Что делают конкуренты

Показательно, что остальные игроки пока двигаются иначе. Компания Figure со своей системой Helix пошла по пути единой нейросети, обученной именно на данных телеуправления — то есть на «дорогих» данных, зато собранных непосредственно с тела робота, где проблема переноса движений отсутствует по определению. Figure уже демонстрирует применение в логистике: роботы сортируют посылки на реальных объектах партнёров. Boston Dynamics десятилетиями полирует моторику и динамику — её Atlas показывает движения, недоступные никому. Китайская Unitree гнет линию на дешевизну и доступность железа.

Из этого следует важный факт: единого «правильного» пути индустрия пока не нашла. Ставка Tesla — это пари на масштабируемость дешёвых данных против качества дорогих. В автономном вождении аналогичное пари Tesla пока не привело к обещанному полному автопилоту, хотя и дало рабочий продукт. С гуманоидами задача объективно сложнее: машине на дороге достаточно не во что не врезаться, а роботу нужно физически взаимодействовать с миром.

И главный контекст: рынка массовых человекоподобных роботов не существует нигде. Ни у Tesla, ни у конкурентов. Есть пилотные проекты, демонстрации и обещания. Это не значит, что рынок не появится — но сегодня любые прогнозы о «роботе в каждом доме» остаются маркетингом.

Почему перезапуск — это не провал, а норма

Смена руководителя, переработка дизайна и срыв сроков выглядят драматично, но для аппаратно-софтверных проектов такого масштаба это скорее норма, чем катастрофа. Более того, передача программы команде AI вместе со сменой методики обучения выглядит внутренне последовательной: Tesla делает вывод, что узкое место — не моторы и не редукторы, а интеллект и данные.

Новые кисти рук вписываются в ту же логику. Именно манипуляция — хватание, удержание, тонкие действия — главный барьер между «роботом, который ходит» и «роботом, который работает». Колесо и ходьба в целом решены индустрией; универсальная рука — нет. Если третья итерация Optimus действительно получила кисть, близкую по возможностям к человеческой, это важнее любых демо с танцами.

Что смотреть дальше

Для читателя, который хочет отличать прогресс от шоу, есть несколько трезвых маркеров. Первый — независимые тесты: появится ли возможность сторонним командам поработать с Optimus на реальных задачах без контроля Tesla. Второй — производственные цифры: не «планируем тысячи», а фактически произведённые и работающие единицы, желательно у внешних заказчиков, а не на собственных заводах в тепличных условиях. Третий — экономика: себестоимость робота, стоимость обслуживания, реальная скорость выполнения задачи против человека. Робот, который сортирует детали в пять раз медленнее работника, — это исследовательский прототип, а не продукт, как бы эффектно он ни выглядел.

Четвёртый маркер касается именно методологии: если ставка на видео сработает, это станет видно по скорости освоения новых задач. Телеуправляемый подход даёт линейный рост: новая задача — новые недели записи демонстраций. Видео-подход обещает нелинейный: показал ролик — робот понял. Если Optimus начнёт быстро осваивать разнородные действия без анонсов «мы записали тысячи часов телеопераций», это будет сильным аргументом в пользу выбранного пути.

Итог без иллюзий

Перезапуск Optimus — это признание простой вещи: железо гуманоида уже достаточно хорошо, а «мозг» — пока нет. Tesla отвечает на это свойственным ей способом: масштабированием данных и нейросетей вместо ручной инженерии. Ставка логичная, масштабная и недоказанная. Разрыв воплощения между человеком на видео и механическим телом — реальная научная проблема, а не бюрократическая мелочь, и никто в мире пока не показал, что она решается «просто большим количеством видео».

При этом недооценивать подход тоже не стоит: именно сочетание дешёвых данных, собственного производства и вертикальной интеграции позволило Tesla изменить авторынок. Удастся ли повторить это с роботами — покажут не презентации, а фабрики, независимые тесты и прайс-листы. До их появления Optimus остаётся самым интересным экспериментом индустрии — но именно экспериментом.