언어 바꾸기English
이전 목록

언어 에이전트를 위한 정책 및 세계 모델 공동 학습

Policy and World Modeling Co-Training for Language Agents

TL;DR AI

핵심 요약

1분
  1. 연구진은 언어 에이전트의 정책 학습에 세계모델 슈퍼비전을 함께 더하는 공동학습 프레임워크 PaW를 제안했다.

  2. PaW는 온폴리시 강화학습 롤아웃을 재활용해, 추가 시뮬레이터나 추론 비용 없이 학습을 확장한다.

  3. 이 방법은 행동 엔트로피 기반 데이터 선택, 잡음에 강한 손실 함수, 보상 적응형 손실 균형을 결합한다.

  4. 세 가지 에이전트 벤치마크에서 PaW는 여러 모델과 알고리즘 전반에 걸쳐 강한 RL 기준선을 앞섰다.

원문 보기