OpenMythos로 MLA, GQA, Sparse MoE, 루프 스케일링 추론을 위한 반복-심도 트랜스포머 구축
Build Recurrent-Depth Transformers with OpenMythos for MLA, GQA, Sparse MoE, and Loop-Scaled Reasoning

TL;DR AI
1분핵심 요약
이 튜토리얼은 Google Colab에서 OpenMythos를 사용해 MLA와 GQA 어텐션을 갖춘 recurrent-depth Transformer 변형을 구축합니다.
모델을 비교하고 recurrent injection matrix를 살펴보며, spectral radius를 통해 안정성을 점검합니다.
모델은 합을 모듈로 계산하는 합성 digit-chain 과제로 학습돼 loop-based reasoning과 모듈러 산술을 연구합니다.
하나의 Transformer 파라미터를 더 깊은 계산에 재사용하고, 소형 모델의 추론 특성을 평가하는 방법을 보여줍니다.
