언어 바꾸기English
이전 목록

Nous Research, 2.7억~100억 파라미터 모델의 LLM 사전학습 속도를 최대 2.5배 높이는 토큰 슈퍼포지션 트레이닝 공개

Nous Research Releases Token Superposition Training to Speed Up LLM Pre-Training by Up to 2.5x Across 270M to 10B Parameter Models

TL;DR AI

핵심 요약

1분
  1. Nous Research가 초기 학습 단계에서 토큰을 묶음으로 처리한 뒤, 이후 표준 next-token 학습으로 전환하는 2단계 사전학습 기법 Token Superposition Training(TST)을 공개했다.

  2. 270M~10B 파라미터 모델 전반에서 TST는 동일한 컴퓨트 기준의 베이스라인과 같거나 더 나은 성능을 보이며 총 학습 시간을 줄였다.

  3. 가장 큰 개선폭은 10B-A1B mixture-of-experts 실험에서 약 2.5배의 학습 속도 향상으로 보고됐다.

  4. 이 결과가 더 넓게 재현된다면, 모델의 최종 동작을 바꾸지 않으면서 LLM 학습 비용과 시간을 크게 낮출 수 있다.

원문 보기