출처
- source_url: https://discuss.pytorch.kr/t/diffusiongemma-gemma-4/11526
- author: 9bow
- published: Thu, 06 Aug 2026 06:30:01 +0000
- raw: raw source:
2026-08-06-pytorchkr-topic-11526-diffusiongemma-gemma-4
개요
DiffusionGemma는 자기회귀 Gemma 4 26B A4B 체크포인트를 이산 텍스트 확산 모델로 미세조정해, 토큰을 하나씩 생성하는 대신 256토큰 캔버스를 병렬로 반복 정제하는 연구다. 연구팀은 사전학습을 새로 수행하지 않고 지도 미세조정(SFT)과 샘플러 증류·강화학습(SD·RL)을 적용했으며, 전체 AR 학습 토큰 예산의 10% 미만을 사용했다고 설명한다. 보고서 기준 NVIDIA H100 한 장, FP8·배치 크기 1에서 약 1,500 TPS와 순전파당 약 20토큰을 기록했지만, 자기회귀 Gemma 4 대비 일부 능력과 높은 배치 처리량을 교환한다. 이 연구의 핵심 주장은 확산 모델이 AR 모델을 전반적으로 능가한다는 것이 아니라, 기존 AR 가중치를 활용해 초저지연 디코딩 지점을 만들 수 있다는 가능성이다.
핵심 포인트
- AR 디코딩의 병목 우회: 단일 요청이나 낮은 동시성 환경에서 AR 생성은 토큰마다 가중치와 KV 캐시를 반복적으로 읽는 메모리 대역폭 병목을 겪는다. DiffusionGemma는 256토큰 블록을 동시에 처리해 이 작업을 상대적으로 연산 중심으로 전환한다.
- AR 체크포인트의 확산 모델 개조: Gemma 4 26B A4B의 트랜스포머 백본을 유지한 채, 깨끗한 컨텍스트에는 인과 어텐션을 적용하고 노이즈 캔버스 내부에는 양방향 어텐션을 적용한다.
- 이산·멀티노멀 확산: 임베딩 공간에서 연속 확산 후 토큰으로 반올림하는 방식 대신 어휘의 이산 상태에서 직접 확산과 디노이징을 수행한다. 이전 단계에서 선택된 토큰도 같은 캔버스 안에서는 다시 수정될 수 있어 자기 교정이 가능하다.
- 블록 자기회귀와 KV 캐시: 완성된 256토큰 캔버스를 시퀀스 이력에 확정하고 다시 인코딩해 KV 캐시에 덧붙인 뒤 다음 블록을 생성한다. 이 방식으로 가변 길이 출력과 긴 컨텍스트 처리를 지원한다.
- 자기 조건화와 적응형 샘플링: 이전 예측의 확률 분포를 연속 신호로 다음 디노이징 단계에 전달하고, 엔트로피 기반 토큰 수락·온도 담금질·적응적 조기 종료를 결합한다. 최대 48단계 대신 다운스트림 평가에서 평균 약 12단계를 사용했다고 보고한다.
- 속도와 품질의 교환: 보고된 속도는 Gemma 4 AR의 204 TPS, MTP 적용 AR의 303 TPS보다 높지만, 추론·지식·코딩·에이전트 과제의 점수는 해당 AR 기준선보다 낮다. 낮은 배치에서는 유리하지만 동시 사용자 약 32명 이후에는 AR 모델이 처리량에서 앞설 수 있다.
- 실험적 공개 모델: 가중치는 Apache 2.0으로 공개되며 Transformers, vLLM, Hackable Diffusion 기반 미세조정 툴킷을 지원한다. 동시에 토큰 말더듬, 멀티모달 환경의 닫는 생각 태그 누락, 높은 배치에서의 처리량 한계가 남은 과제로 제시된다.
왜 중요한가
DiffusionGemma는 확산 언어 모델을 처음부터 사전학습하지 않고도 기존 오픈 웨이트 AR 모델을 출발점으로 활용할 수 있다는 실용적 경로를 제시한다. 특히 낮은 동시성의 대화형 서비스, 구조화된 출력, 입력과 출력의 상당 부분을 병렬로 처리할 수 있는 작업에서는 디코딩 지연을 줄이는 설계 선택지가 될 수 있다. 또한 동일한 가중치로 텍스트 확산과 표준 AR 생성을 모두 지원하므로, 요청의 난이도·품질 요구·지연 목표에 따라 디코딩 방식을 선택하는 하이브리드 서빙을 검토할 수 있다. 다만 본문이 제시한 결과는 특정 H100 환경과 실험적 구현에 기반하며, AR 기준선 대비 품질 격차와 배치 크기별 성능을 함께 고려해야 한다.
후속 링크 및 키워드
- 원문: https://discuss.pytorch.kr/t/diffusiongemma-gemma-4/11526
- 공식 문서: https://ai.google.dev/gemma/docs/diffusiongemma
- Hugging Face 모델: https://huggingface.co/google/diffusiongemma-26B-A4B-it
- Hackable Diffusion: https://github.com/google/hackable_diffusion
- vLLM 배포 레시피: https://recipes.vllm.ai/Google/diffusiongemma-26B-A4B-it
- 관련 키워드:
discrete diffusion,multinomial diffusion,block-AR,self-conditioning,sampler distillation,adaptive stopping,speculative decoding,text diffusion,hybrid decoding,KV cache
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-06-pytorchkr-topic-11526-diffusiongemma-gemma-4에 source_url 및 HTML 원문과 함께 저장되어 있습니다.