X 사용자 阿良(@RealYDT) 이 DeepSWE 코딩 에이전트 벤치마크 결과를 근거로 GPT-5.6 Sol 계열의 사용 등급(gear) 선택 가이드를 제시한 스레드다. 요지는 “일상은 Sol Medium, 고난도만 Sol Extra High”라는 가성비 중심 등급 분리다.
핵심 주장
- GPT-5.6 Sol Medium = 일상용 최적 등급. DeepSWE 점수 61점, 비용 $1.86. 작업 완료에 필요한 단계 수가 대부분의 모델보다 적어(차트에서 끝에서 두 번째) 효율이 높다.
- 더 강한 추론·계획·멀티 에이전트 조율이 필요할 때만 Sol Extra High. DeepSWE 71점, 비용 $4.70.
- 비용 대비 비교: Fable 5 Extra High는 70점으로 Sol Extra High(71점)와 비슷하지만, 비용이 거의 3배($13.41).
| 등급/모델 | DeepSWE 점수 | 비용 | 용도 |
|---|---|---|---|
| GPT-5.6 Sol Medium | 61 | $1.86 | 일상 개발·코드 수정·표준 에이전트 작업 (가성비 최고) |
| GPT-5.6 Sol Extra High | 71 | $4.70 | 복잡한 문제·아키텍처 설계·멀티 에이전트 조율 |
| [[claude-fable-5 | Fable 5]] Extra High | 70 | $13.41 |
스레드 반응
- 작성자 보충: Sol Medium은 일상 개발·코드 수정·표준 에이전트 작업에서 가성비 최고, Sol Extra High는 아키텍처 설계 등 복잡한 문제 해결용 중장비라는 포지셔닝.
- 한 사용자는 luna max와 sol medium을 병행 테스트 중이라며, Pro 5x 크레딧 소모가 이상적이라고 평가. 목표가 명확한 작업엔 luna max, 평소엔 sol을 쓰고 사고 후 실행하는 식으로 전환한다고.
- 다른 사용자는 서브 에이전트를 끄고 max를 선택하겠다는 반응.
맥락과 한계
- 근거 벤치마크는 Artificial Analysis가 SWE-Bench Pro를 대체한 DeepSWE다. 종합 지능 지표는 2026-07-12-artificial-analysis-intelligence-index를, 공식 사용법은 OpenAI GPT-5.6 공식 활용 가이드를 참고.
- 개인 사용자의 경험적 등급 가이드로, 점수·비용 수치는 스레드에 제시된 값이며 독립 검증되지 않았다(
confidence: low).