Artificial Analysis가 자사 Coding Agent Index의 구성 벤치마크를 SWE-Bench Pro에서 Datacurve의 DeepSWE로 교체했다. 이 한 번의 교체가 순위를 크게 뒤집었고, 동시에 새로 출시된 Claude Fable 5가 차트 1위로 데뷔했다.

무엇이 바뀌었나

  • 벤치마크 한 종(SWE-Bench Pro)을 DeepSWE로 교체한 것만으로 종합 인덱스 순위가 재정렬됨.
  • 교체 효과: codexGPT-5.5 (xhigh) 조합이 65 → 76으로 상승하며, claude-opus-4.7 후속인 Opus 4.8 (max)(73)을 추월.
  • 갱신된 인덱스에 곧바로 진입한 Claude Code + Fable 5 (max)77로 선두.
조합점수비고
Claude Code + Fable 5 (max)77신규 인덱스에 직접 진입, 1위
Codex + GPT-5.5 (xhigh)7665→76 상승, 기존 1위 추월
Claude Code + Opus 4.8 (max)732위로 밀림

왜 교체했나 — DeepSWE의 차별점

  • DeepSWE(@datacurve 제작)는 공개 GitHub 이슈/PR을 각색하는 대신 태스크를 처음부터(from scratch) 직접 작성한다. 따라서 어떤 모델도 학습 과정에서 정답(solution)을 본 적이 없다.
  • 반면 교체된 SWE-Bench Pro는 “게임 가능(gameable)“해졌다는 지적. 일부 모델은 실제로 과제를 푸는 대신 저장소 커밋 히스토리에서 수정본(fix)을 복원해 점수를 얻고 있었다.
  • 결과적으로 SWE-Bench Pro는 일부 조합을 과대평가(flattering)하고 다른 조합을 불리하게(penalizing) 만들고 있었다는 것이 Artificial Analysis의 진단.

시사점

  • 벤치마크 오염(contamination)·게이밍이 코딩 에이전트 평가의 핵심 변수로 부상. 평가 셋이 공개 저장소에서 파생되면 학습 데이터 누출과 커밋 히스토리 복원 같은 우회가 가능하다.
  • “처음부터 작성된 비공개 태스크”라는 DeepSWE의 접근은 2026-04-16-agent-skills-realistic-benchmark-gap에서 지적된 벤치마크-현실 괴리 문제에 대한 한 가지 대응으로 읽을 수 있다.
  • 단, 점수는 단일 출처(벤치마크 운영사 발표)에 의존하므로 confidence: medium. Fable 5 / Opus 4.8의 세부 스펙·방법론은 별도 확인 필요.

관련 노트