정확한 LLM 질문 응답을 위해 관련 장기 기억을 검색하는 법을 학습하는 강화학습 기반 에이전트 구축
Build a Reinforcement Learning Powered Agent that Learns to Retrieve Relevant Long-Term Memories for Accurate LLM Question Answering

TL;DR AI
1분핵심 요약
이 튜토리얼은 LLM 질의응답을 위해 PPO 기반 장기 기억 검색 에이전트를 학습하는 방법을 보여준다.
OpenAI 임베딩으로 기억과 질문을 인코딩한 뒤, 커스텀 Gymnasium 환경에서 최적의 기억을 선택하도록 학습한다.
유사도 검색 기반과 비교 평가하며, 관련 사실이 메모리에 있을 때 답변 정확도를 높이는 것을 목표로 한다.
stable-baselines3, 합성 메모리 데이터셋, text-embedding-3-small과 gpt-4o-mini 같은 모델을 사용한다.
