AI의 토큰 가격을 10분의 1로 낮출 수 있는 ‘프롬프트 캐시’의 구조란?
What Is the Mechanism of "Prompt Caching" That Can Cut AI Token Prices to One-Tenth?

TL;DR AI
1분핵심 요약
ngrok는 OpenAI와 Anthropic의 LLM에서 프롬프트 캐시가 어떻게 작동하는지 설명하며, 반복되는 입력 구간을 다시 계산하지 않고 재사용하는 방식을 소개했다.
이 방법은 반복되거나 긴 프롬프트가 많은 경우 토큰 비용을 약 10분의 1 수준까지 줄일 수 있다.
중복 계산을 줄이기 때문에 LLM 응답 속도도 함께 개선할 수 있다.
OpenAI와 Anthropic은 운영 방식은 다르지만, 둘 다 KV 캐시 재사용을 통해 비용과 지연 시간을 낮추는 것을 목표로 한다.
