덴마크 망명 결정에서 신뢰성 평가의 주석자로서의 LLM: 집계 지표를 넘어 분류 성능과 오류 평가
LLMs as Annotators of Credibility Assessment in Danish Asylum Decisions: Evaluating Classification Performance and Errors Beyond Aggregated Metrics

TL;DR AI
1분핵심 요약
연구진은 덴마크 망명 판결에서 신빙성 판단을 주석하기 위한 새 데이터셋 RAB-Cred를 공개했다.
21개의 오픈웨이트 LLM을 30가지 프롬프트 조합으로 평가해, 신빙성 판단의 존재 여부와 그 긍·부정을 분류하게 했다.
모델들은 전반적으로 유용했지만, 성능은 모델과 프롬프트에 따라 크게 달랐고 혼동 패턴과 오류의 일관성도 문제로 나타났다.
오류는 주석자의 확신도와 사건 난이도와도 연관됐으며, 저자들은 저자원 법률 NLP의 비용을 줄일 잠재력은 있지만 배포 전 면밀한 검증이 필요하다고 강조했다.
