AI 모델이 본 적 없는 이미지를 확신에 차서 설명하고, 벤치마크는 이를 잡아내지 못한다
AI models confidently describe images they never saw, and benchmarks fail to catch it

TL;DR AI
2분핵심 요약
Phantom-0은 이미지 없이 제시된 20개 범주, 200개의 시각 질문을 포함한다.
GPT-5, GPT-5.1, GPT-5.2, Gemini 3 Pro, Claude Opus 4.5, Claude Sonnet 4.5 등 모델들이 이미지 없이도 60% 이상 사례에서 시각 세부를 자신있게 묘사했다.
일반적 평가 프롬프트에서는 이 비율이 90–100%로 상승했으며, 모델들은 이미지 없이 벤치마크 점수의 70–80%를 달성했고 실제 이미지는 20–30%만 기여했다.
Gemini 3 Pro는 존재하지 않는 의료 이미지에 대해 X-ray, 뇌 MRI, ECG, 병리, 피부과 영역에서 진단을 제시했고, 각 질문은 200개의 랜덤 시드로 반복되었다. 진단은 심각한 병변 쪽으로 편향되어(STEMI, 멜라노마, 암종 등이 빈번) 정상/무진단은 있었지만 병적 소견이 우세했다.
이미지 업로드 실패나 API/에이전트식 도구의 동작은 실제로 존재하지 않는 상태에 대해 긴급한 잘못된 권고로 이어질 수 있다.



