이해 없는 수렴: 언어 모델이 표현은 같아도 추론은 다를 때
Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

TL;DR AI
1분핵심 요약
8개 계열의 16개 언어모델과 800개 문제를 분석한 결과, 숨은 상태의 유사성이 실제로 같은 추론을 뜻하지 않는 경우가 많았다.
모델들은 틀린 문제에서 더 비슷해졌고, 이는 표현 유사성이 추론 실패와 함께 커질 수 있음을 시사한다.
의사결정 전 상태는 비슷했지만, 답을 고른 뒤에는 상태가 갈라져 내부 궤적이 크게 달라졌다.
공유 정보는 일부 디코딩됐지만 출력에 대한 인과적 영향은 작아, 해석 가능성과 앙상블 설계에 대한 단순한 가정을 흔든다.
