출처
- source_url: https://discuss.pytorch.kr/t/deepspec-deepseek/11049
- author: 9bow
- published: Fri, 03 Jul 2026 12:30:51 +0000
- raw: raw source:
web-2026-07-03-pytorchkr-topic-11049-deepspec-deepseek-speculative-decoding-draft-models
개요
DeepSpec은 DeepSeek이 공개한 추측 디코딩(Speculative Decoding)용 초안 모델(draft model)의 풀스택 학습·평가 코드베이스다. 작은 초안 모델이 여러 토큰을 한번에 제안하면 큰 타깃 모델이 한 번의 순전파로 검증해 생성 속도를 높이는 기법을 다룬다. 저장소는 데이터 준비 유틸리티, 초안 모델 구현, 학습 코드, 평가 스크립트를 하나에 묶어 엔드투엔드 파이프라인을 제공한다. 기본 환경은 GPU 8장 단일 노드를 가정하며, Qwen3와 Gemma 계열을 타깃 모델로 지원한다.
핵심 포인트
- 3단계 파이프라인: 데이터 준비(타깃 모델 출력 캐시 생성) → 초안 모델 학습 → 추측 디코딩 벤치마크 평가
- 지원 알고리즘: DSpark, DFlash, Eagle3. 동일 파이프라인 위에서 서로 비교 가능
- 기반 기술: 학습 프레임워크와 Eagle3 구현은 SpecForge(Apache-2.0), DFlash 설계는 DFlash(MIT)에서 가져옴
- 공개 체크포인트: Qwen3-4B/8B/14B, Gemma-4-12B-it 조합의 초안 체크포인트를 Hugging Face 공개
- 학습 데이터: open-perfectblend 데이터셋의 non-thinking 생성물 사용
- 평가 벤치마크: gsm8k, math500, aime25, humaneval, mbpp, livecodebench, mt-bench, alpaca, arena-hard-v2 포함
- 라이선스: MIT이나, 일부 서드파티 코드는 각 라이선스를 따르므로 NOTICE 파일 참고
- 강한 제약: 동일한 학습 설정·조건을 맞추지 않으면 결과 비교가 의미 없어짐
왜 중요한가
대형 LLM의 핵심 병목인 토큰당 지연 시간을 추측 디코딩으로 줄이는 접근이, 연구에서 실제 학습·평가·공개 체크포인트까지 풀스택으로 풀려 있어 재현과 확장이 쉽다. 여러 초안 알고리즘을 동일 조건에서 비교할 수 있는 벤치마크 체계를 제공해, 추측 디코딩 연구의 표준 기반이 될 수 있다.
원문
https://discuss.pytorch.kr/t/deepspec-deepseek/11049
후속 링크 및 키워드
- GitHub: https://github.com/deepseek-ai/DeepSpec
- 키워드: speculative decoding, draft model, DSpark, DFlash, Eagle3, SpecForge, Qwen3, Gemma, MIT license
원문 보존 위치
원문 전체는 raw source: web-2026-07-03-pytorchkr-topic-11049-deepspec-deepseek-speculative-decoding-draft-models에 source_url 및 HTML 원문과 함께 저장되어 있습니다.