개요

Unsloth는 DeepSeek-V4-Flash-0731을 Unsloth GGUF 또는 llama.cpp로 로컬 실행할 수 있다고 발표했다. 공식 가이드는 이 모델을 총 284B 파라미터·활성 13B, 1M 컨텍스트의 오픈 모델로 설명하며, 핵심 제약은 활성 파라미터가 아니라 수백 GB에 가까운 전체 가중치와 실행 메모리다.

공식 확인

  • DeepSeek-V4-Flash-0731은 2026년 7월 31일 업데이트된 Flash 모델이며, 공식 가이드 기준 총 284B·활성 13B 파라미터와 1M 컨텍스트를 갖는다.
  • Unsloth 가이드는 UD-Q8_K_XL을 약 162GB의 lossless 양자화로, UD-Q4_K_XL을 약 155GB의 near-lossless 양자화로 구분한다.
  • 약 103GB인 3비트 양자화는 컨텍스트와 런타임 오버헤드를 고려해 총 110GB 안팎의 메모리가 권장된다. Q8은 최소 169GB의 가용 메모리가 권장된다.
  • Unsloth Studio와 llama.cpp 경로가 제공되며, 가이드에는 macOS·Windows·Linux에서의 Studio 사용과 reasoning effort 조절 방법이 정리돼 있다.
  • Unsloth가 제시한 벤치마크는 Terminal Bench 2.1 82.7%, DeepSWE 54.4%, NL2Repo 54.2%이며, 모델 카드의 비교표에는 DeepSeek-V4-Pro Preview·GLM-5.2·Opus-4.8 등이 함께 포함된다. 이는 벤더/배포자 자료에 기반한 수치로 독립 재현 결과는 아니다.

X 게시물과 공식 가이드의 차이

X 게시물은 “168GB RAM에서 lossless 4-bit, 110GB RAM에서 3-bit”라고 홍보한다. 반면 연결된 공식 가이드는 Q8을 lossless로, Q4를 near-lossless로 표기한다. 따라서 이 노트에서는 4비트 lossless라는 표현을 확정 사실로 승격하지 않고, 공식 가이드의 더 구체적인 구분을 우선한다.

실사용 의미

  • “활성 13B”만 보고 13B급 로컬 모델로 판단하면 안 된다. MoE의 활성 파라미터는 계산량과 관련되지만, 로컬 적재에는 전체 양자화 가중치와 KV 캐시가 영향을 준다.
  • 일반적인 64GB·96GB급 Mac에서는 공식 권장치에 미달한다. 110GB 이상 통합 메모리나 RAM+VRAM 조합이 있어야 3비트 실험을 현실적으로 검토할 수 있다.
  • 이 발표는 DeepSeek V4 계열의 에이전트·코딩 모델을 API뿐 아니라 로컬 인프라에서도 운용하려는 흐름을 보여준다. 기존 deepseek-v4moc-chinese-llm-models의 V4-Pro 중심 기록에 Flash 0731의 로컬 실행 축을 보완한다.

관련 노트

검증

  • Unsloth X 게시물, 연결된 공식 가이드, Hugging Face 모델 카드를 2026-08-01에 대조했다.
  • Raw SHA-256은 각 raw 파일 frontmatter에 기록했다.
  • 벤치마크와 “lossless” 표현은 독립 검증이 아닌 배포자/모델 카드 주장으로 표시했다.