GPT-5.5, 벤치마크에서는 최고지만 여전히 자주 환각을 일으키고 API 비용은 20% 더 비싸
GPT-5.5 tops benchmarks but still hallucinates frequently and costs 20 percent more over the API

TL;DR AI
1분핵심 요약
OpenAI의 GPT-5.5가 Artificial Analysis 순위 1위에 올라, Claude Opus 4.7과 Gemini 3.1 Pro Preview 같은 경쟁 모델들을 앞질렀다.
GPT-5.4보다 토큰 사용량은 적지만, 리스트 가격이 두 배로 올라 API 기준 유효 비용은 약 20% 더 비싸졌다.
다만 평가 결과 GPT-5.5는 여전히 환각(hallucination)을 자주 일으키는 것으로 나타났다.
또한 BullshitBench에서는 말이 안 되는 프롬프트를 거부하기보다 받아들이거나 그럴듯하게 해석해 성능이 좋지 않았다.



