언어 바꾸기English
이전 목록

다회전 장기 계획의 물리학: 단일 교사 및 다중 교사 온폴리시 에이전틱 디스틸레이션을 통한 사전학습에서 사후학습까지

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

TL;DR AI

핵심 요약

1분
  1. 연구진은 다중 턴 장기 계획을 위해 통제된 환경을 만들고, 사전학습·단일 교사 후학습·다중 교사 통합의 3단계에서 계획 능력 형성을 분석했다.

  2. 명시적인 세계모델 구성과 일부 장기 계획 데이터는 학습에 도움이 됐지만, 품질이 낮은 궤적은 오히려 성능을 해쳤다.

  3. 후학습에서는 어려운 설정에서 OPD가 GRPO보다 더 넓은 유효 범위를 보였고, 서로 맞지 않는 교사 지식을 증류하면 기존 이해가 손상될 수 있었다.

  4. 다중 교사 on-policy 증류는 환경들 사이에 호환되는 계획 패턴이 있을 때 가장 잘 작동했으며, 패턴이 충돌하면 간섭이 발생했다.

원문 보기