대규모 언어 모델 사전 학습에서 데이터 시간성이 미치는 영향 이해하기
Understanding Data Temporality Impact on Large Language Models Pre-training

TL;DR AI
1분핵심 요약
새 연구는 LLM의 사전학습 데이터 순서가 중요할 수 있음을 보여줍니다.
연구진은 7,000개 이상의 시간 기반 질문 벤치마크를 만들고, 60억 파라미터 모델을 순서대로 정렬한 데이터와 섞은 웹 데이터로 각각 학습했습니다.
순차적으로 학습한 모델은 시간적 정확도와 사실의 최신성에서 더 나았고, 일반 언어 성능은 유지했습니다.
이번 결과는 데이터 순서가 더 시의적이고 시간 정보를 잘 반영하는 언어 모델을 만드는 데 도움이 될 수 있음을 시사합니다.
