출처
- source_url: https://aisparkup.com/posts/15001
- author: Spark
- published: Tue, 04 Aug 2026 23:23:14 +0000
- raw: raw source:
2026-08-05-aisparkup-post-15001-1-8-104-105
개요
AI Sparkup은 Product Compass의 Bug Hunt Bench v7 결과를 바탕으로 코딩 모델 10종의 버그 수정 성능과 비용을 비교했다. 두 개의 실제 저장소에 포함된 버그 105개 중 GPT-5.6 Luna max는 33개를 1.80달러에, Fable 5 max는 29개를 104.49달러에 수정했다. GPT-5.6 Sol max는 42개를 수정했지만 비용은 69.61달러였다. 결과는 모델 자체보다 추론 강도, 세션 상태, 가격 구조가 비용과 성능에 큰 영향을 줄 수 있음을 보여준다. 다만 한 사람이 설계·실행했고 정답지가 공개되지 않아 제3자가 완전히 재현하기 어렵다는 한계가 있다.
핵심 포인트
- Bug Hunt Bench v7은 실제 저장소 2곳의 버그 105개를 프론티어 모델 10종에 적용한 실험이다.
- GPT-5.6 Sol max는 42개를 69.61달러에, GPT-5.6 Luna max는 33개를 1.80달러에, Fable 5 max는 29개를 104.49달러에 수정했다.
- 같은 GPT-5.6 Luna라도 추론 강도에 따라 결과가 크게 달라졌다. max는 33개를 수정했지만 high는 13개에 그쳤다.
- Opus 5와 Luna의 토큰 가격은 입력·캐시 입력·출력 모두 약 20
25배 차이가 났으며, 실제 측정 비용 격차는 설정과 세션 길이에 따라 2090배까지 벌어졌다. - 대화 세션이 진행되면 반복적인 지시사항 입력이 줄어 비용이 감소했지만, Luna max는 Opus 5 high보다 느렸다. 콜드 스타트 기준 응답 시간은 각각 22.6초와 8.1초였다.
- 105개 버그 중 53개는 어떤 모델도 어떤 실행에서도 수정하지 못했다. fast mode는 Luna에서 측정 가능한 성능 차이를 만들지 못했다.
- 저자는 Luna max를 대규모 구현이나 비동기 작업처럼 기다릴 수 있는 용도에, Luna high를 일상적인 버그 수정·요약에 활용하는 방식을 제안했다.
왜 중요한가
이 실험은 코딩 모델을 비교할 때 단순한 모델 순위보다 추론 강도와 세션 조건을 함께 기록해야 한다는 점을 보여준다. 같은 모델도 설정 하나에 따라 수정 성능과 비용이 크게 달라질 수 있으므로, 실제 운영에서는 작업의 난이도·허용 가능한 지연 시간·예산을 기준으로 실행 설정을 선택해야 한다. 또한 저비용 모델이 특정 벤치마크에서 유리하더라도 전체 버그의 절반 이상을 해결하지 못했으므로, 비용 절감 결과를 일반적인 코딩 품질이나 모든 개발 작업의 우수성으로 확대해석해서는 안 된다.
참고 링크
- 원문: https://aisparkup.com/posts/15001
- 원문이 인용한 Product Compass 글: https://www.productcompass.pm/p/ai-coding-bill-20-a-month
- Bug Hunt Bench 실행 기록과 방법: https://github.com/phuryn/experiments/tree/main/bug-hunt-bench
- OpenAI 가격 인하 관련 참고 기사: https://www.techspot.com/news/113329-openai-reaches-one-billion-active-users-cuts-gpt.html
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-05-aisparkup-post-15001-1-8-104-105에 source_url 및 HTML 원문과 함께 저장되어 있습니다.