연산 자원의 일부만으로 맞춤형 추론 에이전트를 구축하는 방법
How to build custom reasoning agents with a fraction of the compute

TL;DR AI
1분핵심 요약
JD.com과 학계 파트너 연구진이 추론형 AI 모델을 위한 새로운 학습 방식 RLSD를 제안했다.
RLSD는 검증 가능한 보상 기반 강화학습과 자기 증류를 결합해 기존 강화학습, 온폴리시 증류, 자기 증류의 한계를 보완한다.
실험에서 RLSD는 전통적 증류와 강화학습보다 더 좋은 성능을 보이면서도 학습 비용과 복잡성을 낮췄다.
이 방식은 별도 교사 모델이나 대규모 GPU 예산 없이도 기업이 도메인 특화 추론 모델을 더 저렴하고 쉽게 학습하도록 도울 수 있다.
