출처
- source_url: https://aisparkup.com/posts/14632
- author: Spark
- published: Wed, 22 Jul 2026 04:22:17 +0000
- raw: 2026-07-22-aisparkup-post-14632-post
설계는 비싼 모델, 실행은 저렴한 모델, 이 조합이 통하지 않는 이유
개요
비싼 모델이 코드를 탐색하고 계획만 세운 뒤 저렴한 모델이 실행하는 방식은 직관과 달리 비용을 줄이지 못할 수 있다. Stencil의 측정에서는 계획·실행 분업 방식이 단일 프론티어 모델 사용보다 오히려 14% 비쌌다. 에이전트 비용의 대부분은 코드 수정이 아니라 파일·테스트·관련 코드를 다시 읽는 과정에서 발생하기 때문이다. Stencil은 계획 문서 대신 탐색 과정의 맥락을 유지한 채 첫 편집 이후 저렴한 모델로 전환하는 prewalk 방식을 제안했다.
핵심 포인트
- 코딩 에이전트가 사용한 토큰 중 실제 편집·작성은 약 9%이고, 나머지 약 91%는 코드와 테스트를 읽는 데 사용됐다.
- 비싼 모델의 깊은 이해는 대규모 실행 맥락에 담기지만, 계획 문서는 이를 약 2천 토큰 수준으로 압축한 요약본에 불과하다.
- 저렴한 실행 모델은 계획만으로 부족한 맥락을 확보하기 위해 동일한 파일과 테스트를 다시 읽으므로, 읽기 비용이 중복된다.
prewalk는 프론티어 모델이 탐색·계획을 진행하고 첫 번째 편집을 완료한 시점에 저렴한 모델로 전환하며, 원래의 계획 지시는 맥락에서 제거한다.- Stencil이 제시한 결과에서
prewalk는 프론티어 모델 성능의 97%를 유지하면서 비용 41% 절감, 완료 속도 1.9배 향상을 기록했다. - Stencil은 비용 최적화의 기준을 “어떤 모델이 어떤 작업을 맡는가”보다 “어떤 모델이 무엇을 다시 읽는가”로 보아야 한다고 설명한다.
- 해당 결과는 Stencil의 자체 벤치마크와 실험에 근거한 것이므로, 다른 에이전트·모델·작업에서도 동일한 수치가 재현된다고 단정할 수는 없다.
왜 중요한가
모델 간 역할 분담을 설계할 때 출력 작업의 단가만 비교하면 실제 비용 구조를 놓칠 수 있다. 계획을 별도 문서로 전달하는 방식은 모델 간 이해를 효율적으로 공유하는 것처럼 보이지만, 실행 모델이 맥락을 다시 읽어야 한다면 비용 절감 효과가 사라질 수 있다. 따라서 에이전트 하네스에서는 계획 문서의 품질뿐 아니라 컨텍스트 보존, 모델 전환 시점, 중복 탐색 여부를 함께 측정할 필요가 있다.
참고 링크
- 원문: https://aisparkup.com/posts/14632
- Stencil 원출처: https://stencil.so/blog/prewalk
관련 위키
원문 보존 위치
원문 전체는 2026-07-22-aisparkup-post-14632-post에 source_url 및 HTML 원문과 함께 저장되어 있습니다.