원문: Rahul(@sairahul1) — Never Hit Your Claude Usage Limits Ever Again · 수집일: 2026-08-23
핵심 요지
Claude Code를 하루 1,000 이상) 쓰던 저자가 7가지 구조적 낭비를 제거해 $13/일, 65% 절감으로 내렸다고 주장한다. 핵심은 “지능 부족이 아니라 소음(noise)에 과금”되고 있다는 진단이다. 가장 큰 레버는 모델 라우팅(Haiku/Sonnet/Opus 3단 계층) 단일 항목으로 전체 절감의 40% 이상을 차지하며, 나머지는 코드 탐색·CLI 출력·세션 기억·URL 압축·중복 읽기·출력 장황함을 각각 차단한다. 글은 Sonar Vortex 스폰서 섹션과 10개 오픈소스 레포 큐레이션으로 마감하며, /context로 빈 세션에서도 컨텍스트 오염을 점검하라고 제안한다.
수집 범위
- 범위: 입력 URL의 X Article 1건과 동일 작성자 연속 게시물 전체. JS·스냅샷 기반 탐색 결과 동일 작성자 스레드 연속 게시물은 해당 Article 본문 1건만으로 확인됨 — 별도 답글 스레드 없음.
- 검증 방법:
ego-browser스냅샷 전체 로드 → 하단까지 스크롤 2회 +querySelectorAll('article')로 post ID 수집, 2연속 주기 신규 ID 0건·확장 UI 없음으로 종료 판정. - 포함: Article 제목·작성자·게시시각(2026-08-21 18:36)·본문 7개 장·코드 블록 5개·Sponsor 링크(
fandf.co/4hKO1Fe→Sonar Vortex)·10개 GitHub 링크·지표(22 replies/25 reposts/177 likes/417 bookmarks/391.6K views). - 제외: 타인 댓글 트리 22개는 개수만 기록, 전문 크롤링 안 함(규모 제한 미합의). 인라인 X 자동 한국어 번역은 X UI가 제공한 것 — 요약은 영어 원문을 정본으로 삼고 일부만 대조 인용.
스레드 전개
서두 — $37/일 청구서는 왜 나왔나
- “지능에 지불하는 줄 알았는데 소음에 지불 중”이라는 프레임. 2~3배 토큰 과소모가 보편적이며 품질 저하 없이 13으로 줄인 경험을 7가지로 분해.
1. 에이전트가 파일 하나 찾으려 코드베이스 전체를 읽는다
fix the auth bug같은 요청에 auth 모듈 위치를 몰라 payments 전체·인접 파일·드리프트 재읽기까지 수행, 300토큰 수정에 40,000토큰 소모 사례 제시.- 처방: 맹목 탐색 대신 구조화된 컨텍스트 선제공. 로컬 벡터 검색(
semble)은 완화책, 더 깊은 이해는 Sonar Vortex의 AST 정적 분석·그래프 네비게이션(호출 스택·클래스 계층 매핑)으로 아키텍처 컨텍스트를 주입.
2. Haiku가 200ms에 처리할 일을 Opus로 처리한다
- 기본값이 최상위 모델이라
what does this function do같은 탐색성 질문까지 Opus가 처리하는 비용 구조 지적. - 처방:
CLAUDE.md에 하드 라우팅 규칙 —Haiku 4.5 → locate/grep/understand/diff review / Sonnet 4.6 → iterative 기본값 / Opus 4.7 → 아키텍처 결정 전용,NEVER use Opus for3항목 명문화. 저자는 이 한 줄로 전체 절감의 40%+ 를 달성했다고 주장.
3. CLI 출력이 컨텍스트를 소음으로 채운다
npm install·git status·kubectl describe pod처럼 3,000줄 YAML이 필터 없이 컨텍스트로 유입되는 문제.- 처방: verbose 명령을 컨텍스트 진입 전에 차단하는 pre-tool hook 예시(
pytest|EXPLAIN ANALYZE→ctx_batch_execute,kubectl logs|describe|gcloud|gh api→ sandbox 리다이렉트) — bash 출력 60–90% 절감, 동작 변경 없음.
4. 새 세션이 매번 0에서 시작한다
- 지난주에 끝낸 기능을 새 세션에서 다시 설명하는 5–10분 비용(무엇을 만들고·무엇을 시도했고·왜 실패했는지).
- 처방: 세션 간 의미 기억(mempalace) —
mempalace mine ~/.claude/projects/ --mode convos로 과거 대화를 인덱싱하면last week's auth work같은 문맥이 자동 표면화.
5. URL 하나를 fetch하면 60KB HTML이 그대로 들어간다
- GitHub 이슈 한 줄 확인에 내비·헤더·쿠키 배너까지 포함한 원시 HTML이 유입.
- 처방:
CLAUDE.md규칙Public URLs → ctx_fetch_and_index(url), then ctx_search / Never WebFetch inline / Notion은 세션당 1회 fetch— Context-mode로 94–100% 압축, 60KB 이슈 → 400토큰 핵심만.
6. 같은 파일을 세션당 세 번씩 다시 읽는다
- 파일 A를 읽고도 관련 질문마다 재읽기 — 캐시 없음, 풀 토큰 재과금.
- 처방:
NEVER re-read a file you already read this session한 줄 규칙으로 멀티스텝 세션의 은밀한 세금 제거.
7. 에이전트 자신의 출력이 필요 이상으로 길다
- 단계별 장황한 설명·풀 코드·서두가 출력 토큰 비용을 키움.
- 처방: Caveman Mode로 출력 압축 —
~/.config/caveman/config.json의defaultMode: full(off/lite/full/ultra) 설정, 출력 토큰 약 65% 절감 주장, 정보량은 유지.
성과와 패턴
- Before: 13/일·5% Opus·95% Sonnet·7레이어 가동, 품질 저하 0.
- 상위 3개 승자: ① 모델 라우팅 ② 구조화된 코드 네비게이션 ③ CLI 노이즈 필터링.
- 저자의 통찰: 7개 모두 “에이전트가 필요한 걸 모른다 → 전부 읽고·처리하고·길게 생성한다”의 변주. “쓰기 전 컨텍스트 개선”이 항상 해법이며, 검증 루프가 재작업을 줄여 세션 효율을 높인다. Sonar Vortex가 이 “시작 전 컨텍스트 간극”을 메우는 상용 예시로 제시됨.
더 깊게 가려면 — 10개 GitHub 레포 큐레이션
- RTK(
rtk-ai/rtk) — 터미널 출력 프록시, 60–90% 절감 - Context Mode(
mksglu/context-mode) — SQLite 샌드박스, Playwright/GitHub/로그 98% 절감 - code-review-graph(
tirth8205/code-review-graph) — Tree-sitter 지식 그래프, 모노레포 49배 절감 - Token Savior(
Mibayy/token-savior) — 심볼 단위 MCP 탐색, 97% 절감 - Caveman Claude(
JuliusBrussee/caveman) — 출력 65–75% 절감 - claude-token-efficient(
drona23/claude-token-efficient) —CLAUDE.md한 파일로 terse 응답 - token-optimizer-mcp(
ooples/token-optimizer-mcp) — 캐시·압축·스마트 툴, 95%+ 절감 - claude-token-optimizer(
nadimtuhin/claude-token-optimizer) — 문서 토큰 11K→1.3K - token-optimizer(
alexgreensh/token-optimizer) — 고스트 토큰 탐지·compaction 내성 - claude-context (Zilliz)(
zilliztech/claude-context) — BM25+dense 하이브리드 검색, ~40% 절감 - 선택 가이드: heavy terminal → RTK / big codebase → code-review-graph+Token Savior / MCP 많음 → Context Mode / quick win → Caveman+claude-token-efficient. 빈 세션에서
/context로 오염부터 확인할 것.
해석과 적용 메모
- 가장 먼저 할 일 2개만 골라도 이득: 저자도 “전부 안 해도 된다, #2 모델 라우팅 + #1 구조화된 코드 컨텍스트 2개만으로 상당 부분 절감”이라고 명시. 우리 볼트의
CLAUDE.md운영과 직결 — 라우팅 규칙은 오늘 바로 추가 가능하고, 구조화 컨텍스트는semble/Sonar Vortex/code-review-graph중 택일이 현실적. - 토큰 효율 = 컨텍스트 설계 문제: 7개 항목은 모두 “쓰기 전 정보 구조화 → 탐색·재시도 최소화”로 수렴한다. 이는 code-native-memory가 지적한 “프롬프트에 모든 걸 넣으면 Context Rot 발생”이나 loop-engineering의 “루프 전후 컨텍스트 주입” 주장과 같은 방향이다. 출력 압축(Caveman)까지 포함하면 입력·처리·출력 3면을 모두 다룬 End-to-End 최적화다.
- 프록시 vs 샌드박스 선택 축: CLI 노이즈는 RTK(프록시, 점진 도입)와 Context Mode(SQLite 샌드박스, MCP 많은 환경) 중 하나를 고르면 된다. 우리처럼 Claude Code·Codex·MCP를 혼용하는 환경이면 Context Mode가 유리하고, 터미널만 무거우면 RTK가 가볍다.
- 스폰서십 해석: 1의 Sonar Vortex는 AST·그래프 기반이라는 기술 차별점이 있지만, 해당 섹션의 비교 대상(
semble은 벡터 유사도)과의 대조는 스폰서가 제공한 프레임일 수 있다. 독립 벤치마크 없이 “비용 65% 절감”을 일반화하지 말고, 자신의 코드베이스에서/context와 일일 비용 로그로 before/after를 재측정하는 것이 안전하다. - 검증되지 않은 수치 경계: 13, 40%·60–90%·94–100%·49x·97% 등 수치는 저자 경험치와 각 레포 README 주장이며, 이 노트에서 재검증하지 않았다. 재현할 때는 동일 모델·동일 작업 세트로 Opus 비율·입력/출력 토큰을 분리 측정해야 한다.
- 메모리 도구 선택:
mempalace는 로컬~/.claude/projects/를 마이닝하는 제3자 도구로 보인다. 민감한 대화가 포함될 수 있어 로컬 인덱싱 범위·보존 정책을 먼저 확인해야 한다.
누락·접근 제한
- 공개 X Article로 로그인 이후 접근 — CAPTCHA·유료벽 없음.
@jeongsk7인증 세션으로 캡처, 차단 없음. - 스레드 완전성: 동일 작성자 연속 게시물은 본 Article 1건으로 확인 완료. 글 하단 “Want to cut even further? 10 GitHub repos” 이후 추가 같은-작성자 답글 스레드는 없음. 저자가 추후 답글로 연장하면 새 post ID로 별도 수집 필요.
- 댓글 트리 미수집: 22개 타인 답글은 규모 제한 미합의로 전문 수집 안 함 — 논지 이해에 필요하면 제한적 인용만 가능. 사용자 요청 시 개수/날짜 제한 합의 후 별도 수집.
- 이미지 미러링 안 함: 4개 X CDN 이미지는 외부 URL로만 기록,
raw/assets/로 복사하지 않음. 시각 정보가 필요하면 원문 Article에서 확인. - 수치 검증 안 함: 일일 비용·퍼센티지·배수는 저자/각 레포 주장이며, 결제 내역·토큰 카운트 로그로 재검증하지 않음. Sonar 스폰서 관계는 글에 명시됨.
관련 노트
- 2026-03-25-claude-code-computer-use — Claude Code의 computer-use·장기 실행 하네스 맥락
- code-native-memory — 프롬프트 과적재 시 Context Rot과 code-native memory 대안
- loop-engineering — 루프 전후 컨텍스트 주입으로 효율을 높이는 하네스 패턴
- moc-ai-coding — AI 코딩 운영·토큰 최적화 MOC 허브
- moc-ai-agents — 에이전트 라우팅·메모리·샌드박스 개념 지도
- 2026-08-15-x-deepseek-harness-developer-preview — 에이전트 하네스에서 컨텍스트·세션 로그를 다루는 비교 사례