출처

개요

Mistral AI가 30억 개 매개변수 규모의 정책 적응형 멀티모달 안전성 분류 모델 Shieldstral-1.0-3B를 공개했습니다. 이 모델은 안전성 기준을 모델 가중치에 고정하지 않고, 추론 시점에 자연어 지시문과 예·아니오 질의로 전달받아 콘텐츠를 판정합니다. 텍스트, 이미지, 텍스트·이미지 혼합 입력을 지원하며 yesno 로짓으로부터 연속적인 안전성 점수를 계산할 수 있습니다. 원문이 소개한 벤치마크에서 텍스트 종합 F1 84.9%, 거부 탐지 91.5%, 멀티모달 종합 F1 83.8%를 기록했지만, 모든 평가에서 일관되게 1위를 차지한 것은 아닙니다.

핵심 포인트

  • 추론 시점 정책 적응: <Instruct>, <Query>, <Document> 형식으로 평가 맥락, 안전성 기준, 판정 대상을 입력받아 재학습 없이 새로운 정책을 적용합니다.
  • 이진 질의응답 인터페이스: 추론 시 yesno 두 토큰의 로짓만 사용하며, 두 값을 정규화해 안전성 점수로 활용하거나 서비스별 임계값을 적용할 수 있습니다.
  • 멀티모달·다국어 지원: 텍스트와 이미지 입력을 하나의 인터페이스로 처리하고, 한국어를 포함한 12개 언어를 지원합니다.
  • 주요 평가 결과: 텍스트 안전성 분류 종합 F1 84.9%, 거부 탐지 91.5%, 멀티모달 안전성 종합 F1 83.8%를 기록했습니다. 다만 RTP-LX 다국어 프롬프트에서는 70.3%로 일부 대형 모델보다 낮았고, LlavaGuard 벤치마크에서도 LlavaGuard-7B보다 낮은 점수를 보였습니다.
  • 데이터 중심 학습 레시피: 약 5,410만 개 샘플을 공개 데이터, 합성 대조 데이터, 멀티모달 데이터로 구성하고, 서로 다른 데이터셋의 라벨과 분류 체계를 공통 형식으로 통합했습니다.
  • 효율적인 모델 구성: Ministral-3-3B-Base-2512와 Pixtral 계열 비전 인코더를 기반으로 LoRA 미세조정을 적용했으며, 세 체크포인트를 SLERP 방식으로 병합했습니다. BF16 기준 16GB VRAM에 올릴 수 있고 vLLM, llama.cpp, Transformers로 실행할 수 있습니다.

왜 중요한가

기존 안전성 분류 모델은 유해성 범주와 정책이 모델에 고정되는 경우가 많아 배포 환경이 바뀔 때 재학습이 필요했습니다. Shieldstral은 정책을 자연어 질의로 분리해 제품별·상황별 기준을 추론 시점에 전달하려는 설계를 취하며, 하나의 모델을 여러 모더레이션 정책에 활용할 가능성을 제시합니다.

또한 3B 규모와 단일 토큰 출력 방식을 통해 멀티모달 안전성 분류를 비교적 작은 하드웨어에서 운영하려는 선택지를 제공합니다. 다만 벤치마크별 성능 편차가 있으므로 실제 도입 시에는 대상 언어, 콘텐츠 유형, 오탐·미탐 비용, 요구 지연시간을 기준으로 별도 검증이 필요합니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-06-pytorchkr-topic-11532-mistral-3b-shieldstralsource_url 및 HTML 원문과 함께 저장되어 있습니다.