Waymo: семь уроков перехода от демо к физическому AI (Рубрика #Robotics)
Посмотрел выступление Дмитрия Долгова на Y Combinator Startup School 2026, где разбиралась разница между эффектной демонстрацией AI и системой, которой можно доверять в физическом мире. Долгов - один из основателей Google Self-Driving Car Project, начавшегося в 2009 году и ставшего Waymo в 2016-м, а сейчас co-CEO компании. До Google он занимался автономным вождением в Toyota и работал в Stanford Racing Team над машиной Junior для DARPA Urban Challenge 2007. Он окончил МФТИ и получил PhD по компьютерным наукам в Мичиганском университете. Почти два десятилетия он прошёл с технологией путь от алгоритмов планирования до роботакси.
Главная рамка доклада: для physical AI лозунг «move fast and break things» не годится - у ошибки нет кнопки undo, а цена измеряется не токенами. Ещё три отличия от digital AI:
1. Решения нужны за миллисекунды
2. Готового «интернета физического мира» с размеченными данными нет
3. Безопасность необходимо доказать до массового запуска
Долгов называет следующие пункты семью уроками. По сути, они складываются в инженерную последовательность.
1️⃣ Демо - это максимум 1% работы
В 2009–2010 годах команда примерно из двенадцати инженеров проехала 100 тысяч автономных миль и десять маршрутов по 100 миль без вмешательства человека. Демо заняло 18 месяцев, путь до 500 тысяч поездок в неделю — около 15 лет. Каждый следующий порядок надёжности потребовал новых архитектурных решений, резервирования и проверки длинного хвоста редких событий.
2️⃣ Выбирать нужно не самый быстрый старт, а технологическую кривую, которая дотянется до нужной надёжности
Waymo объединяет камеры, LiDAR и radar: в докладе LiDAR раньше камеры замечает пешехода в пыльной буре и детей в темноте, а резервирование позволяет машине вернуться в депо, когда ветка закрывает часть сенсоров. И не стоит привязывать архитектуру к сегодняшней цене железа: Waymo уже на шестом поколении системы.
3️⃣ Нужно уметь оседлать не одну волну AI, а несколько подряд
Waymo перестраивала Driver вокруг CNN (сврточных сетей), затем трансформеров, теперь VLM и world models. Сложность не в исследовательской демке, а в переносе технологии в прод, критичный к безопасности, без регрессий и с одновременным упрощением стека. По описанию компании, Waymo Foundation Model объединяет восприятие, понимание сцены, прогноз и планирование.
4️⃣ "Bitter Lesson" от Ричарда Саттона работает, но структура не обязательно ему противоречит
Waymo использует structure-augmented end-to-end: learned representations дополняются явными объектами, семантическими признаками и дорожным графом. Структура не диктует машине ответ, зато помогает проверять безопасность в реальном времени и даёт сильные сигналы для reinforcement learning и evals. Чем-то это напоминает истории с детерминированными проверками типа Sonar и онтологиями
5️⃣ Симулятор для physical AI - не вспомогательный инструмент, а второй большой AI-продукт
Открытый цикл (open-loop) тест спрашивает «что бы ты сделал?», закрытый цикл (closed-loop) показывает, как действие меняет мир. Waymo World Model моделирует и участников движения, и показания сенсоров. Так можно проверять синтетические редкости: остановившуюся на шоссе машину, самолёт на дороге, снег на Golden Gate Bridge или слона на перекрёстке.
6️⃣ Вокруг модели нужен маховик из трёх AI-систем: Driver действует, Simulator воспроизводит мир, Critic оценивает результат
Реальные поездки делают симуляцию точнее, она генерирует трудные edge cases, критик выставляет оценку, Driver учится и возвращается на дорогу. Данные становятся преимуществом не как склад записей, а как замкнутый производственный контур.
7️⃣ Главный moat - не модель, а evals и метрики
Если команда не может количественно определить good enough, она продолжает улучшать демо. Для робота проверки должны охватывать модель, сенсоры, вычислительную платформу, поведение, внешние сервисы и операции. В Waymo эту роль играет Safety and Readiness Framework. По статистике компании на 220 млн полностью автономных миль до конца марта 2026 года, Waymo Driver участвовал в авариях с тяжёлыми или смертельными травмами на 94% реже, чем ожидалось бы у людей-водителей в тех же районах. Это данные Waymo, но принцип важен: доверие строится на проверяемой эксплуатации, а не на архитектуре со слайда.
Тезисы, что я забрал для себя из истории
- Лучший момент physical AI часто выглядит так, будто ничего не произошло: система отработала опасную ситуацию, и пассажиры её не заметили.
- Требуемое число «девяток» - продуктовый выбор: оно заранее определяет сенсоры, резервирование, симуляцию, бюджет и скорость выхода на рынок.
- Спор «end-to-end или модульная система» слишком грубый. Практический ответ Waymo - обучаемая общая модель плюс ровно столько структуры, сколько нужно для масштабирования и проверки.
- Safety и evals - часть продукта и накопительный актив. Модель можно повторить быстрее, чем пятнадцать лет данных, операций и доказательств надёжности.
- Маховик без метрик может вращаться куда угодно. Данные дают преимущество, только когда критик отличает прогресс от красивого движения на месте.
#Robotics #AI #Engineering #Architecture #Product #Bigtech