원문: Rahul(@sairahul1) — Never Hit Your Claude Usage Limits Ever Again · 수집일: 2026-08-23

핵심 요지

Claude Code를 하루 1,000 이상) 쓰던 저자가 7가지 구조적 낭비를 제거해 $13/일, 65% 절감으로 내렸다고 주장한다. 핵심은 “지능 부족이 아니라 소음(noise)에 과금”되고 있다는 진단이다. 가장 큰 레버는 모델 라우팅(Haiku/Sonnet/Opus 3단 계층) 단일 항목으로 전체 절감의 40% 이상을 차지하며, 나머지는 코드 탐색·CLI 출력·세션 기억·URL 압축·중복 읽기·출력 장황함을 각각 차단한다. 글은 Sonar Vortex 스폰서 섹션과 10개 오픈소스 레포 큐레이션으로 마감하며, /context로 빈 세션에서도 컨텍스트 오염을 점검하라고 제안한다.

수집 범위

  • 범위: 입력 URL의 X Article 1건과 동일 작성자 연속 게시물 전체. JS·스냅샷 기반 탐색 결과 동일 작성자 스레드 연속 게시물은 해당 Article 본문 1건만으로 확인됨 — 별도 답글 스레드 없음.
  • 검증 방법: ego-browser 스냅샷 전체 로드 → 하단까지 스크롤 2회 + querySelectorAll('article')로 post ID 수집, 2연속 주기 신규 ID 0건·확장 UI 없음으로 종료 판정.
  • 포함: Article 제목·작성자·게시시각(2026-08-21 18:36)·본문 7개 장·코드 블록 5개·Sponsor 링크(fandf.co/4hKO1Fe→Sonar Vortex)·10개 GitHub 링크·지표(22 replies/25 reposts/177 likes/417 bookmarks/391.6K views).
  • 제외: 타인 댓글 트리 22개는 개수만 기록, 전문 크롤링 안 함(규모 제한 미합의). 인라인 X 자동 한국어 번역은 X UI가 제공한 것 — 요약은 영어 원문을 정본으로 삼고 일부만 대조 인용.

스레드 전개

서두 — $37/일 청구서는 왜 나왔나

  • “지능에 지불하는 줄 알았는데 소음에 지불 중”이라는 프레임. 2~3배 토큰 과소모가 보편적이며 품질 저하 없이 13으로 줄인 경험을 7가지로 분해.

1. 에이전트가 파일 하나 찾으려 코드베이스 전체를 읽는다

  • fix the auth bug 같은 요청에 auth 모듈 위치를 몰라 payments 전체·인접 파일·드리프트 재읽기까지 수행, 300토큰 수정에 40,000토큰 소모 사례 제시.
  • 처방: 맹목 탐색 대신 구조화된 컨텍스트 선제공. 로컬 벡터 검색(semble)은 완화책, 더 깊은 이해는 Sonar Vortex의 AST 정적 분석·그래프 네비게이션(호출 스택·클래스 계층 매핑)으로 아키텍처 컨텍스트를 주입.

2. Haiku가 200ms에 처리할 일을 Opus로 처리한다

  • 기본값이 최상위 모델이라 what does this function do 같은 탐색성 질문까지 Opus가 처리하는 비용 구조 지적.
  • 처방: CLAUDE.md에 하드 라우팅 규칙 — Haiku 4.5 → locate/grep/understand/diff review / Sonnet 4.6 → iterative 기본값 / Opus 4.7 → 아키텍처 결정 전용, NEVER use Opus for 3항목 명문화. 저자는 이 한 줄로 전체 절감의 40%+ 를 달성했다고 주장.

3. CLI 출력이 컨텍스트를 소음으로 채운다

  • npm install·git status·kubectl describe pod처럼 3,000줄 YAML이 필터 없이 컨텍스트로 유입되는 문제.
  • 처방: verbose 명령을 컨텍스트 진입 전에 차단하는 pre-tool hook 예시(pytest|EXPLAIN ANALYZEctx_batch_execute, kubectl logs|describe|gcloud|gh api → sandbox 리다이렉트) — bash 출력 60–90% 절감, 동작 변경 없음.

4. 새 세션이 매번 0에서 시작한다

  • 지난주에 끝낸 기능을 새 세션에서 다시 설명하는 5–10분 비용(무엇을 만들고·무엇을 시도했고·왜 실패했는지).
  • 처방: 세션 간 의미 기억(mempalace) — mempalace mine ~/.claude/projects/ --mode convos로 과거 대화를 인덱싱하면 last week's auth work 같은 문맥이 자동 표면화.

5. URL 하나를 fetch하면 60KB HTML이 그대로 들어간다

  • GitHub 이슈 한 줄 확인에 내비·헤더·쿠키 배너까지 포함한 원시 HTML이 유입.
  • 처방: CLAUDE.md 규칙 Public URLs → ctx_fetch_and_index(url), then ctx_search / Never WebFetch inline / Notion은 세션당 1회 fetch — Context-mode로 94–100% 압축, 60KB 이슈 → 400토큰 핵심만.

6. 같은 파일을 세션당 세 번씩 다시 읽는다

  • 파일 A를 읽고도 관련 질문마다 재읽기 — 캐시 없음, 풀 토큰 재과금.
  • 처방: NEVER re-read a file you already read this session 한 줄 규칙으로 멀티스텝 세션의 은밀한 세금 제거.

7. 에이전트 자신의 출력이 필요 이상으로 길다

  • 단계별 장황한 설명·풀 코드·서두가 출력 토큰 비용을 키움.
  • 처방: Caveman Mode로 출력 압축 — ~/.config/caveman/config.jsondefaultMode: full(off/lite/full/ultra) 설정, 출력 토큰 약 65% 절감 주장, 정보량은 유지.

성과와 패턴

  • Before: 13/일·5% Opus·95% Sonnet·7레이어 가동, 품질 저하 0.
  • 상위 3개 승자: ① 모델 라우팅 ② 구조화된 코드 네비게이션 ③ CLI 노이즈 필터링.
  • 저자의 통찰: 7개 모두 “에이전트가 필요한 걸 모른다 → 전부 읽고·처리하고·길게 생성한다”의 변주. “쓰기 전 컨텍스트 개선”이 항상 해법이며, 검증 루프가 재작업을 줄여 세션 효율을 높인다. Sonar Vortex가 이 “시작 전 컨텍스트 간극”을 메우는 상용 예시로 제시됨.

더 깊게 가려면 — 10개 GitHub 레포 큐레이션

  • RTK(rtk-ai/rtk) — 터미널 출력 프록시, 60–90% 절감
  • Context Mode(mksglu/context-mode) — SQLite 샌드박스, Playwright/GitHub/로그 98% 절감
  • code-review-graph(tirth8205/code-review-graph) — Tree-sitter 지식 그래프, 모노레포 49배 절감
  • Token Savior(Mibayy/token-savior) — 심볼 단위 MCP 탐색, 97% 절감
  • Caveman Claude(JuliusBrussee/caveman) — 출력 65–75% 절감
  • claude-token-efficient(drona23/claude-token-efficient) — CLAUDE.md 한 파일로 terse 응답
  • token-optimizer-mcp(ooples/token-optimizer-mcp) — 캐시·압축·스마트 툴, 95%+ 절감
  • claude-token-optimizer(nadimtuhin/claude-token-optimizer) — 문서 토큰 11K→1.3K
  • token-optimizer(alexgreensh/token-optimizer) — 고스트 토큰 탐지·compaction 내성
  • claude-context (Zilliz)(zilliztech/claude-context) — BM25+dense 하이브리드 검색, ~40% 절감
  • 선택 가이드: heavy terminal → RTK / big codebase → code-review-graph+Token Savior / MCP 많음 → Context Mode / quick win → Caveman+claude-token-efficient. 빈 세션에서 /context로 오염부터 확인할 것.

해석과 적용 메모

  • 가장 먼저 할 일 2개만 골라도 이득: 저자도 “전부 안 해도 된다, #2 모델 라우팅 + #1 구조화된 코드 컨텍스트 2개만으로 상당 부분 절감”이라고 명시. 우리 볼트의 CLAUDE.md 운영과 직결 — 라우팅 규칙은 오늘 바로 추가 가능하고, 구조화 컨텍스트는 semble/Sonar Vortex/code-review-graph 중 택일이 현실적.
  • 토큰 효율 = 컨텍스트 설계 문제: 7개 항목은 모두 “쓰기 전 정보 구조화 → 탐색·재시도 최소화”로 수렴한다. 이는 code-native-memory가 지적한 “프롬프트에 모든 걸 넣으면 Context Rot 발생”이나 loop-engineering의 “루프 전후 컨텍스트 주입” 주장과 같은 방향이다. 출력 압축(Caveman)까지 포함하면 입력·처리·출력 3면을 모두 다룬 End-to-End 최적화다.
  • 프록시 vs 샌드박스 선택 축: CLI 노이즈는 RTK(프록시, 점진 도입)와 Context Mode(SQLite 샌드박스, MCP 많은 환경) 중 하나를 고르면 된다. 우리처럼 Claude Code·Codex·MCP를 혼용하는 환경이면 Context Mode가 유리하고, 터미널만 무거우면 RTK가 가볍다.
  • 스폰서십 해석: 1의 Sonar Vortex는 AST·그래프 기반이라는 기술 차별점이 있지만, 해당 섹션의 비교 대상(semble은 벡터 유사도)과의 대조는 스폰서가 제공한 프레임일 수 있다. 독립 벤치마크 없이 “비용 65% 절감”을 일반화하지 말고, 자신의 코드베이스에서 /context와 일일 비용 로그로 before/after를 재측정하는 것이 안전하다.
  • 검증되지 않은 수치 경계: 13, 40%·60–90%·94–100%·49x·97% 등 수치는 저자 경험치와 각 레포 README 주장이며, 이 노트에서 재검증하지 않았다. 재현할 때는 동일 모델·동일 작업 세트로 Opus 비율·입력/출력 토큰을 분리 측정해야 한다.
  • 메모리 도구 선택: mempalace는 로컬 ~/.claude/projects/를 마이닝하는 제3자 도구로 보인다. 민감한 대화가 포함될 수 있어 로컬 인덱싱 범위·보존 정책을 먼저 확인해야 한다.

누락·접근 제한

  • 공개 X Article로 로그인 이후 접근 — CAPTCHA·유료벽 없음. @jeongsk7 인증 세션으로 캡처, 차단 없음.
  • 스레드 완전성: 동일 작성자 연속 게시물은 본 Article 1건으로 확인 완료. 글 하단 “Want to cut even further? 10 GitHub repos” 이후 추가 같은-작성자 답글 스레드는 없음. 저자가 추후 답글로 연장하면 새 post ID로 별도 수집 필요.
  • 댓글 트리 미수집: 22개 타인 답글은 규모 제한 미합의로 전문 수집 안 함 — 논지 이해에 필요하면 제한적 인용만 가능. 사용자 요청 시 개수/날짜 제한 합의 후 별도 수집.
  • 이미지 미러링 안 함: 4개 X CDN 이미지는 외부 URL로만 기록, raw/assets/로 복사하지 않음. 시각 정보가 필요하면 원문 Article에서 확인.
  • 수치 검증 안 함: 일일 비용·퍼센티지·배수는 저자/각 레포 주장이며, 결제 내역·토큰 카운트 로그로 재검증하지 않음. Sonar 스폰서 관계는 글에 명시됨.

관련 노트