언어 바꾸기English
이전 목록

표본 효율적인 연속 제어를 위한 편향 보정 모델 기반 표현

Debiased Model-based Representations for Sample-efficient Continuous Control

TL;DR AI

핵심 요약

1분
  1. 연구진은 샘플 효율적인 연속 제어를 위한 편향 보정형 모델 기반 표현 학습 기법 DR.Q를 제안했다.

  2. DR.Q는 상태-행동 표현과 다음 상태 표현의 상호정보량을 최대화하고, faded prioritized experience replay를 활용한다.

  3. 이 방법은 표현 편향과 과적합을 줄여 오프폴리시 Q-learning의 안정성을 높이도록 설계됐다.

  4. 연속 제어 벤치마크에서 DR.Q는 강력한 기준 기법들과 비슷하거나 더 높은 성능을 보였다.

원문 보기