LLMs은 코딩과 수학은 능하지만 일상적인 질문에서 좌절하며, 그것은 모순이 아니다
LLMs crush coding and math but choke on casual questions, and that's not a contradiction

TL;DR AI
1분핵심 요약
GPT-5.4 Thinking과 Claude Opus 4.6 같은 최신 모델은 Codex와 Claude Code와 함께 업무에 쓰인다.
이들은 복잡한 코딩을 몇 시간 만에 해결하고, 코드베이스를 재구성하거나 취약점을 찾고 악용할 수 있다.
하지만 Advanced Voice Mode에서도 기본적인 일상 질문을 틀릴 수 있다.
Andrej Karpathy는 이것이 모순이 아니라고 말한다. 코딩과 수학은 정답 검증과 보상이 분명하기 때문이다.
글쓰기와 컨설팅은 뚜렷한 평가 기준이 없어 최적화가 어렵고, 더 검증 가능한 일일수록 자동화에 적합해진다.



