원문: Sujin Kang Ph.D. — LLM as a judge 자기 편향 · 수집일: 2026-08-23

핵심 요지

LLM 평가 연구자 Sujin Kang이 겪은 현상 — 같은 judge 모델이 타사 모델 답변은 감점 사유를 성실하게 찾지만, 자기 답변에는 같은 문제를 잘 짚지 못하고 훨씬 후한 점수를 준다. 이는 개인적 우연이 아니라 self-enhancement / self-preference bias라는 이름으로 2023년부터 축적된 연구 주제다. 저자의 결론: 평가는 파이프라인의 마지막 단계가 아니라 그 위의 모든 판단이 올라서는 시작점이므로, judge 편향을 통제하지 않으면 모델 비교가 아니라 judge 비교가 된다.

수집 범위

단일 게시물 + 작성자 본인 댓글(논문 링크 5편). 게스트 뷰에서 로그인 없이 전문 수집. 타인 댓글 2건(Changwon Jeon의 RAG 평가 적용 반응, Geon Woo Byun의 콜드검증 스킬 경험담)은 참고만 기록. 나머지 댓글 5건은 로그인 필요로 미수집.

주요 내용

연구 계보 (작성자 댓글의 논문 링크 포함)

연구핵심 주장
Zheng et al. (2023), MT-BenchLLM-as-a-Judge 패러다임 제안과 동시에 self-enhancement bias를 한계로 명시
Panickssery et al. (2024)self-recognition(“내가 쓴 문장임을 알아보기”) 능력이 자기 편애 강도와 연결됨
Wataoka et al. (2024)perplexity가 낮은(자기에게 익숙한) 문장에 후한 점수 — 자기 출력이 우연히 가장 익숙할 뿐
Huang et al. (2024)외부 피드백 없는 self-correction은 추론 성능을 개선 못 하고 오히려 악화; 병목은 수정 능력이 아니라 자기 오류 인지
Tyen et al. (2024)오류 위치를 알려주면 잘 고치지만, 위치를 스스로 찾지 못함

두 가지 미해결 긴장

  • 라벨 실험: 모델명을 숨기고 self/other 표식만 붙여도 점수가 움직인다 — 내용이 아니라 “누구 것”이라는 라벨이 점수를 흔든다.
  • 반대 증거: 출력 품질과 judge별 엄격도를 통제하면 self-preference가 상당 부분 사라진다는 연구도 있다. 자기 편애처럼 보인 것의 일부는 실제 품질 우위일 수 있어, 논쟁은 정리 중이다.

저자의 실무 대응 4가지

  1. 평가 대상에 judge 자신이 포함되면 그 점수는 최종 표에서 제외.
  2. 저자 정보 삭제만으로 부족 — 문체 자체가 서명이다. cross-model judging 또는 judge 앙상블이 현실적 대안.
  3. judge마다 기본 너그러움 수준이 다르므로 공통 앵커 샘플로 보정하지 않으면 모델 비교가 아니라 judge 비교가 된다.
  4. self-refine 루프에는 외부 시그널(테스트 결과·타 모델·사람)을 붙인다. 자기에게만 되묻는 루프는 정확도보다 확신이 먼저 오른다.

특히 위험한 조합은 자기 생성 → 자기 채점 → 그 점수로 재학습 파이프라인. 편향이 걸러지지 않고 한 바퀴마다 짙어진다.

해석과 적용 메모

  • 볼트의 2026-07-17-aisparkup-post-14500-g-eval이 G-Eval 구조를 다룰 때 judge 편향을 다루지 않았던 점을 이 포스트가 보완한다 — 에이전틱 grader(2026-07-07-langchain-loop-engineering-4-loops의 검증 루프)를 설계할 때 judge에 자기 출력 채점을 맡기지 말아야 한다.
  • Huang/Tyen의 “오류 위치를 몰라서 못 고친다”는 2026-04-16-claude-opus-4-7-self-verification의 self-verification 논의와 정확히 같은 병목 진단이다. 외부 시그널(테스트, 타 모델) 주입이 공통 처방.
  • 2026-08-23-ai-era-code-review-guide의 “세션 결정 캡처 → 자동 검증 루프” 단계에도 그대로 적용되는 원리: AI 코드 리뷰에서 생성 에이전트와 리뷰 에이전트를 같은 모델로 돌리면 이 편향이 코드 품질 판정에 스며든다.
  • 내 적용 체크리스트: (1) eval 표에서 judge=self 행 제거, (2) judge 프롬프트에 출처 라벨 노출 여부 점검, (3) judge 간 엄격도 앵커 보정, (4) self-refine엔 반드시 실행 가능한 외부 검증 붙이기.

비유: “엄마는 내 물건을 더 잘 찾는다”

이 편향은 일상의 “내 물건은 남이 더 잘 찾는다” 현상과 구조가 같다.

  • 닮은 지점 — 익숙함이 탐지를 망친다. 물건을 못 찾는 건 정보 부족이 아니라 과신(대충 훑음)과 inattentional blindness(익숙한 물건은 눈에 안 들어옴) 때문이다. 엄마가 잘 찾는 건 더 똑똑해서가 아니라 내 방에 대한 선입견이 없어 체계적으로 쓸기 때문. Wataoka et al.의 perplexity 설명과 정확히 포개진다 — LLM도 자기 출력이 익숙해서(perplexity 낮아서) 그럴듯하게 느끼고 점수를 후하게 준다. 판단 근거가 내용이 아니라 익숙함이라는 병목이 동일하다. Tyen et al.도 같은 그림 — “서랍 두 번째 칸 봐바” 하면 금방 찾듯, 오류 위치만 알려주면 모델은 잘 고친다.
  • 차이 — 엄마는 점수를 후주지 않는다. 엄마 현상은 순수한 탐지 성능 문제지만, LLM judge는 탐지 실패에 점수 인플레이션까지 겹친다. Panickssery의 라벨 실험(“이건 네 거야”라는 표식만으로 점수 이동)은 정체성 개입의 층위로, 엄마 비유로는 재현되지 않는다.
  • 반대 증거도 비유에 들어맞는다. 가끔은 진짜 내 기억이 맞고 엄마가 틀린 것처럼, 출력 품질을 통제하면 self-preference가 상당 부분 사라진다는 연구가 있다.
  • 처방도 동일 — 새로운 눈 빌리기. cross-model judging·judge 앙상블·외부 시그널 주입은 “엄마 부르기”다. 포스트 댓글의 “새 세션·다른 모델로 콜드검증” 스킬 경험담이 정확히 이에 해당한다.

누락·접근 제한

  • 댓글 7건 중 5건은 로그인 필요 — 미수집. 미디어 없음(텍스트 게시물).
  • 인용된 논문 5편은 원문을 읽지 않았고 게시물·작성자 댓글의 서술을 그대로 옮김 — 개별 검증 시 confidence 상향 여지.

관련 노트