출처

개요

AI 에이전트는 시스템 프롬프트, 도구 정의, JSON 스키마처럼 여러 턴에서 반복되는 입력을 프롬프트 캐싱으로 재사용할 수 있습니다. 캐시 읽기 비용은 일반 입력보다 저렴하지만, 캐시 생성 비용은 더 높을 수 있어 재사용 횟수가 충분해야 이득이 됩니다. 또한 후속 요청이 캐시를 저장한 동일한 공급자 서버로 전달되어야 캐시가 실제로 활용됩니다. OpenRouter처럼 여러 공급자에게 요청을 분산하는 환경에서는 세션 고정이나 대화 식별자가 없을 경우 캐시 적중이 실패할 수 있습니다. 따라서 캐싱 활성화 여부보다 실제 캐시 읽기 토큰 수와 비용 절감 효과를 사용량 정보에서 확인해야 합니다.

핵심 포인트

  • 반복되는 시스템 프롬프트, 도구 정의, 스키마, 가드레일, 참고 문서는 에이전트 프롬프트에서 큰 비중을 차지하므로 캐싱 효과가 클 수 있습니다.
  • 캐시 읽기 비용은 저렴하지만 캐시 쓰기 비용은 일반 입력보다 높을 수 있습니다. 원문은 Claude Sonnet 4.6 기준으로 캐시 읽기가 100만 토큰당 0.3달러, 일반 입력이 3달러이며, 캐시 생성은 5분 유지 기준 1.25배, 1시간 유지 기준 2배라고 설명합니다.
  • 캐시를 한 번 만들고 재사용하지 못하면 캐싱하지 않은 경우보다 비용이 커질 수 있으므로, 여러 턴에서 반복 사용되는 세션에 적합합니다.
  • 캐시가 저장된 서버와 다른 공급자로 후속 요청이 전달되면 캐시를 읽지 못하고 일반 입력 비용을 지불하게 됩니다.
  • 대화의 첫 메시지나 앞부분이 요약, 도구 결과 순서 변경, 메타데이터 추가 등으로 계속 달라지면 시스템이 다른 대화로 인식해 캐시 적중이 깨질 수 있습니다.
  • 세션 고정과 고유한 대화 식별자는 후속 요청을 동일한 공급자 서버로 보내는 데 도움이 되지만, 프롬프트 앞부분이 계속 변경되는 문제까지 완전히 해결하지는 못합니다.
  • API 사용량 정보에서 캐시 읽기 토큰이 0에 가깝다면 프롬프트가 짧거나, 캐시가 만료됐거나, 앞부분이 변경됐거나, 다른 공급자로 라우팅된 상황일 수 있습니다.

왜 중요한가

프롬프트 캐싱은 자동으로 비용을 절감하는 기능이 아니라, 캐시 생성 비용을 반복 사용으로 회수할 때 효과가 발생하는 최적화 방식입니다. 특히 API 기반 에이전트는 여러 턴에 걸쳐 동일한 시스템 지침과 도구 정의를 전송하므로, 캐시 적중률과 공급자 라우팅이 실제 비용에 직접 영향을 줍니다. 청구서나 API 응답의 캐시 읽기 토큰 수를 확인하면 캐싱이 실제로 작동하고 있는지 검증할 수 있습니다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 2026-07-25-aisparkup-post-14700-6-aisource_url 및 HTML 원문과 함께 저장되어 있습니다.