언어 바꾸기English
이전 목록

크로스링구얼 토크나이저 수술과 오프라인 증류를 통한 다국어 임베딩 모델의 튀르키예어 적응

Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation

TL;DR AI

핵심 요약

1분
  1. 연구진이 다국어 교사 모델을 터키어에 맞게 개조한 2억 파라미터 터키어 문장 임베딩 모델 embeddingmagibu-200m을 공개했다.

  2. 터키어 최적화 13.1만 토크나이저와 사전 계산 임베딩 기반 오프라인 증류를 적용해 학습 비용을 낮췄다.

  3. 이 모델은 STSbTR에서 Pearson 77.55, Spearman 77.45를 기록했고, TR-MTEB 평균 63.9%로 교사 모델과 같거나 더 나은 성능을 보였다.

  4. 모델, 토크나이저, 데이터셋, 도구까지 함께 공개돼 저비용 터키어 NLP와 RAG 구축에 활용하기 쉬워졌다.

원문 보기