개요

Jooeon Kim은 노션 대체 서비스를 만드는 과정에서 수행한 실제 개발 태스크를 모델별로 비교한 Opus 5 추가 분석 결과를 공유했다. 게시물의 핵심 주장은 모델을 일괄 선택하기보다 태스크의 개방성·검증 필요성·비용에 따라 leaf 에이전트 모델을 라우팅해야 한다는 것이다.

핵심 내용

  • 적대 리뷰 게이트: 계획·설계·구현의 오류를 찾아내는 반복 리뷰에서는 Opus 5가 Fable보다 더 섬세한 취약점을 찾았고, 게시물은 약 2.5배 높은 성능을 주장한다.
  • 창발 구현: 핵심 기능의 설계를 스스로 도출하는 과제에서 Opus 5는 Fable과 비슷한 수준까지 올라왔지만, Fable이 반복 실행 안정성은 더 높다고 설명한다. 대신 Opus 5를 두 번 실행해 더 나은 결과를 고르는 방식이 비용 면에서 유리하다고 제안한다.
  • 닫힌 문제: 관점이 정해진 리뷰와 원인·해결책이 정해진 수리 구현에서는 Sonnet 5가 Opus 5와 비슷한 성능을 내면서 각각 약 2배, 2.5배 저렴하다고 주장한다.
  • 실행 지침: Claude Code에서 model-routing@agent-harness 플러그인을 설치하고 /model-routing:apply를 실행해 라우팅을 적용할 수 있다고 안내한다.

실무적 해석

이 글은 상위 모델 하나를 모든 leaf 작업에 쓰는 방식보다, 열린 탐색·설계·적대적 검증에는 Opus 계열을, 완료 조건과 방법이 고정된 작업에는 Sonnet을 배치하는 구성을 지지한다. 특히 구현 결과를 바로 채택하지 않고 독립적인 적대 리뷰 게이트를 두는 것이 모델 선택보다 중요한 안전장치라는 점이 핵심이다. 다만 수치와 비교 결과는 작성자가 수행한 제한된 실험의 보고이며, 게시물 자체도 실제 작업·실행 조건·심사 방법의 상세는 별도 보고서로 보낸다.

연결 자료

출처 및 검증

  • 원문: LinkedIn 게시물 — 작성자 Jooeon Kim, 공개 페이지 기준 1d Edited, 41 reactions, 7 comments.
  • 원문 캡처는 로그인 없이 공개 렌더링된 Jina AI 변환 결과를 보존했으며, 게시물 본문·댓글·링크를 포함한다.
  • 보고서의 상세 수치는 게시물에서 링크한 별도 보고서와 작성자의 주장이다. 독립 재현한 결과가 아니다.
  • Raw SHA-256: fe6357c0ab9a9e6acd41c6b128ea8d2e2224d58e4c65ecf1d498400a6cecd560 (frontmatter 아래 정확한 캡처 본문 기준)