robot_world_models_post
🌍 World Models для роботов: думай перед тем, как делать | #серия22 #embodiedai
Model-free RL — это чистый эмпиризм: пробуй, получай награду, корректируй политику. Никакого понимания мира, только статистика. Чтобы научить робота ходить, алгоритм типа PPO буквально падает миллионы раз. Это работает, но медленно и требует огромного числа взаимодействий со средой. Можно ли дать роботу способность “думать”?
DreamerV3 (Hafner et al., Google DeepMind, 2023) строит компактную модель мира в латентном пространстве через RSSM — Recurrent State Space Model. RSSM имеет два компонента: детерминированное скрытое состояние h_t (память через рекуррентность) и стохастическое z_t (неопределённость через вариационный вывод). Переход: h_{t+1} = f(h_t, z_t, a_t). Из этого латентного состояния decoder восстанавливает наблюдения, а отдельные головы предсказывают награду и флаг завершения эпизода.
Ключевой трюк: actor-critic обучается целиком внутри воображаемых роллаутов в латентном пространстве, без взаимодействия с реальной средой. Модель “фантазирует” последовательности из 15 шагов, оценивает их ценность и обновляет политику — всё это быстро и без физики. Sample efficiency вырастает в 10x по сравнению с model-free методами. Одна версия DreamerV3 без изменений гиперпараметров решает 15 разных доменов: Atari, DeepMind Control Suite, Minecraft и задачи роботики.
Это прямое пересечение с Серией 7 (MCTS как планирование в дереве возможных состояний) и Серией 16 (диффузия как итеративное уточнение — аналог imagination rollouts). World model для робота — это не программированная физика, а нейросетевое “чутьё” о том, как мир реагирует на действия.
Завтра завершаем серию: гуманоиды — что происходит, когда всё это соединяется в человекоподобном теле?
#machinelearning #robotics #worldmodels