언어 바꾸기English
이전 목록

겉으로는 공손하지만 실제로는 잘못된: 다국어 벵골어 생성에서 존칭 오류를 수정하기 위한 큐레이션 데이터셋

Polite on the Surface, Wrong in Practice: A Curated Dataset for Fixing Honorific Failures in Multilingual Bangla Generation

TL;DR AI

핵심 요약

1분
  1. 연구진은 Bangla용 4,196쌍 규모의 정제 데이터셋이자 벤치마크인 BLADE를 공개했다.

  2. 이 데이터셋은 Bangla 텍스트 생성에서 발생하는 존칭, 화용론, 구조적 오류를 바로잡는 데 초점을 맞췄다.

  3. DeepSeek-8B와 LLaMA-3.2-3B 같은 오픈웨이트 모델을 미세조정한 결과, 존칭 일치와 출력 충실도가 개선됐다.

  4. 이번 연구는 저자원 언어에서 특히 심한, 유창하지만 사회·문화적으로 부적절한 생성 문제를 겨냥한다.

원문 보기