Anything that reasons about the quality of behavior — RL, reward modeling, failure detection, world models — benefits from seeing behavior that isn't optimal. However, there is no good existing mixed-quality real-world dataset for researchers to use. (4/13)
Публикация
Обсуждение
0 прямых ответов
Показаны не все ответы
Публичный счётчик показывает 1, а источник передал 0. Остальные ответы могли быть удалены, скрыты или не выданы публично.
Ответов пока нет
Обсуждение ещё не началось.