고정 커밋 8db8a114…(main HEAD 일치) 기준 정적 검사 요약. 벤치마크 재현(유료 API)은 실행하지 않았고 성능 수치는 README 서술이다.[unverified]

개요

LLM-as-a-Verifier추가 학습 없이 어떤 에이전트에든 세분화된(fine-grained) 피드백을 제공하는 범용 검증 프레임워크다(stars 2,842, MIT, 논문 arXiv:2607.05391). LLM-as-a-Judge가 점수 분포를 단일 이산 값으로 줄이는 것과 달리, ①세분화된 채점 granularity ②점수 토큰의 전체 logprob 분포에 대한 기댓값 ③반복 평가·기준 분해 스케일링으로 보상 R(x,τ)을 추정한다. 이 피드백은 test-time scaling, 진행 추적, 강화학습에 재사용된다.[1]

Terminal-Bench·SWE-Bench Verified·MedAgentBench·RoboRewardBench 등에서 SOTA를 주장하며, 궤적 데이터와 재현 스크립트를 저장소에 함께 배포한다.[1]

공개 API (pip install llm-verifier)

API용도
selectBest-of-N 후보 중 최선 선택(내부적으로 PPT 토너먼트)
compare쌍별 세분화 보상 [0,1]
track완료된 궤적의 단계별 진행 곡선
ProgressTracker실행 중 온라인 진행 점수(미래 엿보기 불가 → hopeless 롤아웃 조기 포기 임계 예 0.05)
token_usage토큰 회계 (0.2.0 신규)

검증기 백엔드는 logprob 반환 API 필요: DeepSeek v4-flash(0.2.0 기본), Gemini 2.5 Flash, 또는 vLLM 등 OpenAI 호환 서버(Qwen3.5-9B 등 로컬).[1]

핵심 알고리즘

  • Fine-grained Reward: R(x,τ) = C(기준)×K(반복)×G(점수 토큰)에 걸친 p_θ(v_g|x,c,τ)·φ(v_g)의 기댓값. 구현 fine_grained_reward.py.[1]
  • Probabilistic Pivot Tournament(PPT): O(N²) 라운드로빈 대신 O(Nk) — 무작위 해밀턴 순환 링 패스로 A/B 위치 편향 상쇄 → 상위 k 피벗 선정 → 피벗 관련 쌍만 σ(R_a−R_b) 채점으로 예산을 불확실한 상위 후보에 집중 → 정규화 승질량 w_i/c_i로 선택.[1]

벤치마크 결과 (README 표, 미재현)

벤치마크구성Pass@1+VerifierOracle
Terminal-Bench V2GPT-5.5 Bo583.1%86.5%92.1%
SWE-Bench VerifiedOpus/Gemini Bo376.1%78.2%84.4%
MedAgentBenchClaude Bo570.2%73.3%75.0%

주목할 만한 자기검증 결과: Terminal-Bench 2.1에서 생성과 검증에 같은 deepseek-v4-flash를 썼음에도 Bo5가 Pass@1 78.7%→88.0%±0.6%.[1]

생태계

  • TurboAgent(별도 저장소): Claude Code용 드롭인 LLM API 프록시 — ANTHROPIC_BASE_URL=http://localhost:8888 claude로 연결, 병렬 후보 생성+PPT 선택, /visualizer DAG 뷰 내장.[1]
  • 멀티모달: 모든 진입점이 images 인자 수용, 단계별 카메라 프레임은 궤적에 누적되어 로봇 롤아웃 등의 전체 시각 이력 참조 가능(RoboRewardBench).[1]
  • 에이전트 주도 확장: add_new_benchmark.md를 Claude Code/Codex에 붙여넣으면 기준 생성→런너 작성→Best-of-N까지 자동 수행하는 워크플로 제공.[1]
  • 0.2.0 최적화: prefix-cache(캐시 적중 5.2%→78.4%, 입력 ~3.4× 절감), deepseek 백엔드(DEEPSEEK_EFFORT/MAX_TOKENS).[2]

버전·라이선스·출처

  • 라이선스: MIT (LICENSE). GitHub 태그 미사용 — release-v0.2.0 브랜치 + CHANGELOG 0.2.0(2026-08-14). 체크아웃 pyproject 0.2.0과 일치.[3]
  • 수집 시점 관측값: stars 2,842 · forks 222 · Python · created 2026-04-09 · pushed 당월(2026-08-20) · 문서 https://llm-as-a-verifier.com/docs/ .[4]

정적 검사 한계

  • 재현 스크립트 실행(유료 API)을 하지 않았다. 성능 수치·SOTA 주장은 README 서술이며 confidence: medium. Oracle과의 격차(예: TB-V2 86.5 vs 92.1)도 함께 읽어야 한다.

관련 위키

Sources

[1] https://github.com/llm-as-a-verifier/llm-as-a-verifier — README (고정 커밋 8db8a114…, 원본 캡처: raw/articles/2026-08-25-github-llm-as-a-verifier.md) [2] https://github.com/llm-as-a-verifier/llm-as-a-verifier — CHANGELOG.md 0.2.0, pyproject.toml (동일 커밋) [3] https://github.com/llm-as-a-verifier/llm-as-a-verifier/tree/release-v0.2.0 — 릴리스 브랜치 [4] https://api.github.com/repos/llm-as-a-verifier/llm-as-a-verifier — GitHub REST API (stars/forks/license/created/pushed, 2026-08-25 수집)