출처

개요

ko-embedding-leaderboard는 한국어 검색 환경에서 오픈소스 임베딩 모델을 비교·평가하기 위한 공개 리더보드입니다. MTEB를 한국어 환경에 맞게 수정하고, 7개 한국어 정보 검색(IR) 데이터셋에서 모델을 평가합니다. Version 2부터는 클러스터링과 NLI 과제를 제외하고 IR만 평가하며, NDCG@5와 NDCG@10의 평균으로 순위를 산정합니다. Dense 임베딩과 Sparse 임베딩을 구분해 순위를 제공하며, 새 모델이 추가되면 결과가 갱신됩니다.

핵심 포인트

  • 평가 대상은 한국어 검색 데이터셋 7종입니다: Ko-StrategyQA, AutoRAGRetrieval, PublicHealthQA, LawIRKo, WebFAQRetrieval, SQuADKorV1Retrieval, MIRACLRetrievalHardNegative.
  • 순위 점수는 각 데이터셋의 NDCG@5와 NDCG@10 평균을 다시 평균한 검색 평균입니다.
  • 모델 로딩은 Hugging Face 설정을 따르며, SentenceTransformer 방식을 Transformers보다 우선하고 명시된 Query fix를 적용합니다.
  • 중복 문장 쌍을 제거하며, LLM 기반 임베딩 모델은 fp16 또는 bf16으로 평가합니다.
  • Dense 임베딩 상위 모델은 perplexity-ai/pplx-embed-v1-4b(82.79), dragonkue/snowflake-arctic-embed-l-v2.0-ko(82.14), telepix/PIXIE-Rune-v1.0(81.57) 순입니다.
  • Sparse 임베딩에서는 telepix/PIXIE-Splade-v1.5(78.19), yjoonjang/splade-ko-v1(77.00), yjoonjang/inference-free-splade-ko-v1(76.75)가 상위권입니다.
  • 한국어 특화 모델뿐 아니라 Qwen3-Embedding, BGE-M3, EmbeddingGemma 같은 다국어·범용 모델도 Dense 순위 상위권에 포함됩니다.

왜 중요한가

한국어 RAG나 검색 시스템에서는 영어 벤치마크 성능만으로 실제 한국어 검색 품질을 판단하기 어렵습니다. 이 리더보드는 동일한 평가 규칙과 한국어 IR 데이터셋을 사용해 모델 선택을 비교할 수 있는 기준을 제공한다는 점에서 의미가 있습니다. 다만 리더보드 점수는 특정 데이터셋과 평가 설정에 따른 결과이므로, 실제 서비스에서는 대상 도메인 데이터로 별도 검증해야 합니다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-26-pytorchkr-topic-11416-ko-embedding-leaderboardsource_url 및 HTML 원문과 함께 저장되어 있습니다.