다국어 파운데이션 모델을 활용한 지속 학습
Continual Learning with Multilingual Foundation Model

TL;DR AI
1분핵심 요약
이 다국어 NLP 연구는 영어·스페인어·이탈리아어 소셜미디어에서 재전유된 LGBTQ+ 비속어를 탐지하는 재현 가능한 프레임워크를 제안한다.
여러 임베딩 모델을 비교한 뒤 XLM-RoBERTa를 선택하고, 역번역 증강·언더샘플링·마스크드 언어 모델링·언어별 임계값을 결합했다.
이 방법은 재전유적 사용과 비재전유적 사용을 더 잘 구분하면서 데이터 부족과 클래스 불균형 문제를 완화한다.
재학습 없이 F1 점수를 높여, 저자원 다국어 콘텐츠 모더레이션에 유용함을 보여준다.
