언어 바꾸기English
이전 목록

충실도 지표는 충실도를 측정하지 않는다: 정답을 활용한 메타 평가

Faithfulness Metrics Don't Measure Faithfulness: A Meta-Evaluation with Ground Truth

TL;DR AI

핵심 요약

1분
  1. 연구진은 13개 과제와 10개 모델에서 수집한 3,066개의 라벨된 chain-of-thought 예시로 벤치마크 BonaFide를 만들었다.

  2. 주요 faithfulness 지표들을 정답 라벨과 비교해 평가한 결과, 대부분이 거의 무작위 수준의 성능을 보였고 편향도 확인됐다.

  3. 특히 긴 추론 흔적에서는 성능이 더 떨어졌고, 다른 설정으로의 전이성도 낮았으며 계산 비용은 높았다.

  4. 이번 연구는 널리 쓰이는 faithfulness 점수가 LLM의 추론이 실제로 충실한지 믿을 만하게 측정하지 못할 수 있음을 보여준다.

원문 보기