개요

G-Eval은 정답이 하나로 정해지지 않는 AI 생성 텍스트를 LLM으로 평가해 사람 평가에 가까운 점수를 얻으려는 방법입니다. AI 기능의 품질을 감이 아니라 구조화된 기준과 수치로 설명하려는 문제의식에서 출발합니다. 구체적인 평가 기준, 모델이 먼저 작성하는 평가 절차, 토큰 확률을 활용한 점수 환산이 핵심 구성입니다. 다만 위치·자기 선호·장황함 편향 등 LLM-as-a-judge의 한계도 함께 고려해야 합니다.

핵심 포인트

  • BLEU·ROUGE처럼 정답 예시와 단어 유사도를 비교하는 지표는, 좋은 답변이 여러 형태로 가능한 요약·챗봇·고객 응대 출력에 적용하기 어렵습니다.
  • G-Eval은 평가 기준을 구체적으로 정의한 프롬프트를 사용해 모델이 무엇을 확인해야 하는지 명시합니다.
  • 모델은 실제 결과물을 채점하기 전에 주어진 과제와 기준에 맞춰 단계별 평가 절차를 먼저 작성합니다.
  • 실제 입력·출력과 프롬프트·평가 절차를 함께 모델에 넣고, 숫자 토큰 자체가 아니라 토큰 확률 분포를 활용해 점수를 환산합니다.
  • 원문이 소개한 논문 결과에 따르면 GPT-4 기반 G-Eval은 텍스트 요약에서 사람 평가와 0.514의 스피어만 상관계수를 기록했습니다. 이 수치는 논문 보고값이며, 이 노트에서 재현한 결과는 아닙니다.
  • LLM 심판은 결과물의 제시 순서, 자기 출력에 대한 선호, 실질적으로 같은 내용에서 더 긴 답변을 선호하는 장황함 편향을 보일 수 있습니다.

왜 중요한지

AI 요약·챗봇·글쓰기 기능은 유일한 정답이 없어 품질을 자동으로 측정하기 어렵습니다. G-Eval은 평가 기준과 절차를 명시해 이런 주관적 판단을 반복 가능한 평가 흐름으로 바꾸는 한 가지 방법을 제시합니다. 동시에 심판 모델도 편향될 수 있으므로, G-Eval 점수를 품질의 절대적 진실이 아니라 기준·절차·편향을 함께 점검하는 평가 신호로 다루는 것이 원문에 부합합니다. 관련 맥락은 2026-03-29-agent-eval-checklistetclovg-v-verification에서 확인할 수 있습니다.

참고 링크