Behavioral cloning on successes gives you a policy with no notion of what a bad grasp looks like and how to avoid it, and nothing to learn from once it drifts off-distribution. To learn those, you need failure and suboptimal data. (3/13)
Публикация
Обсуждение
0 прямых ответов
Показаны не все ответы
Публичный счётчик показывает 1, а источник передал 0. Остальные ответы могли быть удалены, скрыты или не выданы публично.
Ответов пока нет
Обсуждение ещё не началось.