고정 커밋
8db8a114…(main HEAD 일치) 기준 정적 검사 요약. 벤치마크 재현(유료 API)은 실행하지 않았고 성능 수치는 README 서술이다.[unverified]
개요
LLM-as-a-Verifier는 추가 학습 없이 어떤 에이전트에든 세분화된(fine-grained) 피드백을 제공하는 범용 검증 프레임워크다(stars 2,842, MIT, 논문 arXiv:2607.05391). LLM-as-a-Judge가 점수 분포를 단일 이산 값으로 줄이는 것과 달리, ①세분화된 채점 granularity ②점수 토큰의 전체 logprob 분포에 대한 기댓값 ③반복 평가·기준 분해 스케일링으로 보상 R(x,τ)을 추정한다. 이 피드백은 test-time scaling, 진행 추적, 강화학습에 재사용된다.[1]
Terminal-Bench·SWE-Bench Verified·MedAgentBench·RoboRewardBench 등에서 SOTA를 주장하며, 궤적 데이터와 재현 스크립트를 저장소에 함께 배포한다.[1]
공개 API (pip install llm-verifier)
| API | 용도 |
|---|---|
select | Best-of-N 후보 중 최선 선택(내부적으로 PPT 토너먼트) |
compare | 쌍별 세분화 보상 [0,1] |
track | 완료된 궤적의 단계별 진행 곡선 |
ProgressTracker | 실행 중 온라인 진행 점수(미래 엿보기 불가 → hopeless 롤아웃 조기 포기 임계 예 0.05) |
token_usage | 토큰 회계 (0.2.0 신규) |
검증기 백엔드는 logprob 반환 API 필요: DeepSeek v4-flash(0.2.0 기본), Gemini 2.5 Flash, 또는 vLLM 등 OpenAI 호환 서버(Qwen3.5-9B 등 로컬).[1]
핵심 알고리즘
- Fine-grained Reward: R(x,τ) = C(기준)×K(반복)×G(점수 토큰)에 걸친 p_θ(v_g|x,c,τ)·φ(v_g)의 기댓값. 구현
fine_grained_reward.py.[1] - Probabilistic Pivot Tournament(PPT): O(N²) 라운드로빈 대신 O(Nk) — 무작위 해밀턴 순환 링 패스로 A/B 위치 편향 상쇄 → 상위 k 피벗 선정 → 피벗 관련 쌍만 σ(R_a−R_b) 채점으로 예산을 불확실한 상위 후보에 집중 → 정규화 승질량 w_i/c_i로 선택.[1]
벤치마크 결과 (README 표, 미재현)
| 벤치마크 | 구성 | Pass@1 | +Verifier | Oracle |
|---|---|---|---|---|
| Terminal-Bench V2 | GPT-5.5 Bo5 | 83.1% | 86.5% | 92.1% |
| SWE-Bench Verified | Opus/Gemini Bo3 | 76.1% | 78.2% | 84.4% |
| MedAgentBench | Claude Bo5 | 70.2% | 73.3% | 75.0% |
주목할 만한 자기검증 결과: Terminal-Bench 2.1에서 생성과 검증에 같은 deepseek-v4-flash를 썼음에도 Bo5가 Pass@1 78.7%→88.0%±0.6%.[1]
생태계
- TurboAgent(별도 저장소): Claude Code용 드롭인 LLM API 프록시 —
ANTHROPIC_BASE_URL=http://localhost:8888 claude로 연결, 병렬 후보 생성+PPT 선택, /visualizer DAG 뷰 내장.[1] - 멀티모달: 모든 진입점이 images 인자 수용, 단계별 카메라 프레임은 궤적에 누적되어 로봇 롤아웃 등의 전체 시각 이력 참조 가능(RoboRewardBench).[1]
- 에이전트 주도 확장:
add_new_benchmark.md를 Claude Code/Codex에 붙여넣으면 기준 생성→런너 작성→Best-of-N까지 자동 수행하는 워크플로 제공.[1] - 0.2.0 최적화: prefix-cache(캐시 적중 5.2%→78.4%, 입력 ~3.4× 절감), deepseek 백엔드(DEEPSEEK_EFFORT/MAX_TOKENS).[2]
버전·라이선스·출처
- 라이선스: MIT (
LICENSE). GitHub 태그 미사용 —release-v0.2.0브랜치 + CHANGELOG 0.2.0(2026-08-14). 체크아웃 pyproject0.2.0과 일치.[3] - 수집 시점 관측값: stars 2,842 · forks 222 · Python · created 2026-04-09 · pushed 당월(2026-08-20) · 문서 https://llm-as-a-verifier.com/docs/ .[4]
정적 검사 한계
- 재현 스크립트 실행(유료 API)을 하지 않았다. 성능 수치·SOTA 주장은 README 서술이며
confidence: medium. Oracle과의 격차(예: TB-V2 86.5 vs 92.1)도 함께 읽어야 한다.
관련 위키
- moc-ai-agents-harness — 에이전트 하네스 MOC (test-time scaling·조기 포기 설계)
- loop-engineering — 실행 결과 기반 자기교정 루프
- 2026-06-07-cognition-ai-productivity — Devin 세션 계측(진행 추적 대비)
- 2026-08-25-github-htdt-godogen — proof-over-claims 자율 런(같은 ‘증명 우선’ 철학)
- moc-claude-code — TurboAgent 프록시의 대상 하네스
Sources
[1] https://github.com/llm-as-a-verifier/llm-as-a-verifier — README (고정 커밋 8db8a114…, 원본 캡처: raw/articles/2026-08-25-github-llm-as-a-verifier.md)
[2] https://github.com/llm-as-a-verifier/llm-as-a-verifier — CHANGELOG.md 0.2.0, pyproject.toml (동일 커밋)
[3] https://github.com/llm-as-a-verifier/llm-as-a-verifier/tree/release-v0.2.0 — 릴리스 브랜치
[4] https://api.github.com/repos/llm-as-a-verifier/llm-as-a-verifier — GitHub REST API (stars/forks/license/created/pushed, 2026-08-25 수집)