출처
- source_url: https://discuss.pytorch.kr/t/diffusion-llm-llada-diffusiongemma/11311
- author: 9bow
- published: Mon, 20 Jul 2026 11:30:43 +0000
- raw: 2026-07-20-pytorchkr-topic-11311-diffusion-llm-llada-diffusiongemma
개요
확산 언어 모델(Diffusion Language Model, dLLM)은 주류 LLM의 좌→우 자기회귀(AR) 생성이라는 전제 자체를 바꾼 모델이다. 답변 영역 전체를 마스킹한 상태에서 출발해, 여러 번의 복원(denoising) 단계를 거치며 마스킹된 토큰들을 병렬로 채워 넣는다 — 이미지 확산의 노이즈 제거 발상을 이산 텍스트 토큰 위에 재현한 것. 이 글은 개념 → 대표 기반 모델(LLaDA, Dream, Mercury, DiffusionGemma, Nemotron Diffusion) → 추론 디코딩 전략 → 아키텍처 가속 기법 → 학습/정렬(RL) → 한계와 전망 순으로 dLLM 연구 지형을 종합한다.
개념 — 마스킹 확산과 AR의 근본적 차이
- 원리: 텍스트는 이산적이라 이미지처럼 가우시안 노이즈를 더할 수 없어, 토큰을 특별한
[MASK]로 점차 바꾸는 흡수 상태(마스킹) 확산을 쓴다. 순방향 과정은 시간 t가 0→1로 갈수록 마스킹 비율을 선형으로 높이고, 역방향(마스크 예측기)이 이를 복원한다. 학습은 마스킹된 토큰에만 교차 엔트로피를 계산하되 1/t 가중치를 곱하며, 이는 음의 로그 가능도의 상한(ELBO의 재구성)임이 증명되어 있다. - BERT MLM과의 차이: BERT는 고정
15% 마스킹을 한 번에 맞히는 표현 학습이지만, 마스킹 확산은 마스킹 비율이 01 무작위로 변하고 1/t 가중치가 붙어 로그 가능도 상한이 된다 — 이 차이 덕분에 dLLM은 빈 상태에서 문장 전체를 생성할 수 있는 원리적 생성 모델이 된다. - 양방향 어텐션과 KV 캐시 소실: dLLM의 마스크 예측기는 인과 마스크 없는 양방향 어텐션을 쓴다. 병렬 생성의 원천이지만, 복원 단계마다 모든 토큰 표현이 갱신될 수 있어 AR이 누리던 KV 캐시를 그대로 쓸 수 없다 — 이후 소개할 가속 기법 상당수가 이 잃어버린 캐시를 되살리려는 시도다.
- 블록 확산: 답변을 블록으로 나눠 블록 내부는 병렬(확산), 블록 사이는 순차(AR)로 처리하는 절충안. LLaDA에 재학습 없이 적용하면 GSM8K 69.4→78.6, MATH 31.9→42.2로 오르는데, 저자들은 이것이 확산 자체의 우수성보다 SFT 데이터의 EOS 패딩이 유발한 조기 종료 문제를 완화한 결과라고 설명한다. DiffusionGemma·Nemotron Diffusion 등 대부분의 최신 모델과 가속 기법이 블록 확산 위에서 설계된다.
기반 모델 5종
- LLaDA(8B, 밑바닥부터 학습): Renmin University·Ant Group. 2.3T 토큰(LLaMA3 8B의 15T 대비 약 1/6)만으로 사전학습하고도 MMLU 65.9, GSM8K 70.3로 LLaMA3 8B(GSM8K 48.7)를 크게 앞섬. 중국어 시 완성 과제의 역방향에서 AR의 고질적 “역전의 저주”를 깨고 GPT-4o를 앞섬 — 저자들은 목적 함수가 임의 순서 자기회귀와 등가임을 증명. 이후 거의 모든 dLLM 연구의 기준선.
- Dream 7B / Dream-Coder(AR 초기화): HKU·Huawei Noah’s Ark Lab. Qwen2.5-7B 가중치로 초기화 후 확산 목적으로 이어 학습 — LLaDA의 약 1/4인 0.6T 토큰만으로 MMLU 69.5, HumanEval 57.9(LLaDA 32.9)를 기록. 계획 과제에 특히 강해 Countdown 16.0(Qwen2.5 6.2), Sudoku 81.0(Qwen2.5 21.0). Dream-Coder는 검증 가능 보상 RL을 더해 코드에 특화, 서로 다른 생성 패턴(스케치 우선/좌→우/추론-코드 교대)이 학습 중 자연 창발한다고 보고.
- Mercury(상용, Inception Labs): 속도-품질 절충 곡선에 집중한 첫 상용 dLLM. Mercury Coder Mini는 HumanEval 88.0에 초당 1109토큰, Small은 90.0에 초당 737토큰 — 속도 최적화 프론티어 모델 대비 최대 10배 빠름(GPT-4o Mini·Claude 3.5 Haiku는 초당 60토큰대). Copilot Arena 사람 평가에서 품질 공동 2위·속도 1위.
- DiffusionGemma(MoE, Google DeepMind): Gemma 4 MoE(총 25.2B/활성 3.8B) 위에 이산 텍스트 확산을 얹은 오픈 가중치 멀티모달 모델. 같은 AR 모델(Gemma 4 26B A4B) 대비 대부분 벤치마크에서 뒤짐(MMLU Pro 77.6% vs 82.6%, AIME 69.1% vs 88.3%) — 품질보다 낮은 배치에서의 지연시간 단축이 목적임을 정직하게 보여줌. vLLM이 네이티브 지원한 최초의 dLLM으로, H200에서 초당 1288토큰(AR 대비 ~6배). 별도 연구 How Transparent is DiffusionGemma?는 해석 가능성 분석에서 자기 조건화 벡터를 해석 가능 정보로 보면 Gemma 4와 비슷한 수준으로 모니터링 가능하다고 결론.
- Nemotron Diffusion(NVIDIA, 3-모드): 하나의 모델이 AR·확산·자기추측(self-speculation) 세 디코딩 모드를 모두 지원. AR+블록확산 결합 손실로 Ministral3에서 이어학습. 자기추측 디코딩(확산으로 병렬 초안 생성 + AR로 검증)이 Qwen3-8B 대비 순전파당 약 5.9배 많은 토큰을 생성, SPEED-Bench 약 4배 처리량 향상. 수용 길이 6.82(EAGLE-3의 2.75, MTP의 4.24를 크게 앞섬).
추론: 토큰을 언제 어떤 순서로 열 것인가
- CCD(Beyond Confidence): 단일 단계 신뢰도 대신 최근 여러 단계의 예측 일관성을 보는 궤적 정정. Dream 기준 Trip Planning에서 단계 수 3.48배 줄이며 점수는 오히려 15.10→19.01.
- Prophet(조기 확정 디코딩): dLLM이 최종 단계 훨씬 전에 이미 정답을 내부적으로 확정한다는 관찰(GSM8K 최대 97%, MMLU 최대 99%가 절반 단계에서 이미 정답 도달)에서 출발 — 신뢰도 격차가 임계값을 넘으면 조기 종료, 복원 단계 최대 약 3.4배 절감. 다른 가속과 곱셈적으로 결합(Fast-dLLM 6.82배 + Prophet → 7.66배).
- Train for the Worst, Plan for the Best(ICML 2025): MDM 학습은 Θ(L·2^L)개 부분 문제를 대비해야 하지만, 추론에서 적응적 순서를 고르면 어려운 부분 문제를 우회할 수 있다는 이론. 최고 확률 마진 순서를 쓰면 Sudoku 정확도 6.88%→89.49%(7배 큰 AR 모델의 87.18%마저 앞섬).
- The Flexibility Trap(2026, Tsinghua·Alibaba): 위 논문에 정면 반론 — 수학·코딩 같은 일반 추론에서는 임의 순서가 “분기 토큰”을 우회해 해답 다양성을 조기에 붕괴시킴. HumanEval에서 AR 순서로만 풀리는 문제 21.3% vs 그 반대 0.6%. 대안 JustGRPO는 RL 동안만 AR 순서 정책을 써 GSM8K 89.1%, MATH-500 45.1% 달성.
아키텍처 최적화: 반복 계산 줄이기
- dLLM-Cache / DyLLM: 인접 복원 단계 간 특징 유사도를 활용한 적응적 캐싱 — dLLM-Cache는 LLaDA GPQA에서 FLOPs 약 8.08배 절감(정확도 손실 없음), DyLLM은 처리량 LLaDA 최대 7.6배·Dream 최대 9.6배(FFN 비중이 큰 Dream에서 이득이 더 큼).
- FlashBlock: 블록 확산에서 블록 외부 어텐션은 단계 간 안정적이라는 관찰로 블록 내부만 재계산 — 토큰 처리량 최대 1.44배, 메모리 부담 0.11% 이하.
- DES(Dynamic Expert Sharing): MoE dLLM 특유의 “전문가 폭발” 문제를 블록 단위 코어셋 선택으로 완화 — 고유 전문가 활성화 55%+ 감소, 지연시간 최대 38% 절감, 정확도 99% 유지.
- DFlash: 확산을 최종 생성기가 아니라 AR 목표 모델을 가속하는 speculative decoding 드래프터로 사용 — 목표 모델 은닉 특징을 드래프터 전 계층에 주입해 약 6배 무손실 가속(EAGLE-3 대비 최대 2.5배).
학습과 정렬: 다루기 힘든 가능도와의 씨름
dLLM은 AR과 달리 연쇄 법칙으로 로그 가능도를 못 구해 ELBO 근사가 필요하고, 이 근사가 분산·편향을 끌어들인다는 공통 난제를 안는다.
- LLaDA 1.5 / VRPO: DPO를 확산에 적용할 때 이중 몬테카를로 추정의 분산이 편향까지 유발 — 샘플링 예산 확대·시간 전체 배분·대조 샘플링으로 “공짜 점심”처럼 분산을 줄임. GSM8K 78.6→83.3, 비용은 사전학습의 0.5% 미만.
- d1 / diffu-GRPO: dLLM 최초의 정책 경사 RL. 무작위 프롬프트 마스킹으로 순전파 한 번에 로그 확률 추정 — GSM8K 78.2→82.1, Countdown 20.7→42.2(계획 과제 사실상 2배 개선).
- GDPO: diffu-GRPO의 평균장 근사가 “심하게 편향”됐다고 지적, 시퀀스 수준 ELBO를 SDMC(결정론적 구적법+소수 몬테카를로)로 저비용화 — Countdown 512 길이 기준 80.86(diffu-GRPO 42.2를 크게 앞섬), H100 2장으로 학습 가능.
한계와 전망
- dLLM은 “AR의 순차 병목을 병렬 복원으로 바꾸고 낮은 배치에서 남는 연산으로 지연시간을 사는” 거래 위에 서 있다. DiffusionGemma가 같은 아키텍처 AR보다 대부분 벤치마크에서 뒤진다는 사실이 이를 정직하게 보여준다 — 아직 품질에서 AR을 앞서는 기술이 아니라 특정 조건에서 속도를 사는 기술.
- AR 생태계가 오래 다져온 최적화 스택(KV 캐시, MoE 라우팅, 정렬)을 dLLM은 캐싱·코어셋 선택·확산 특화 RL로 새로 쌓는 중.
- 수렴점은 블록 확산 + 자기추측: 순수 확산·순수 AR 양극단 대신 블록 내부 병렬/블록 간 순차가 사실상 표준이 됐고, Nemotron Diffusion·DFlash처럼 확산을 AR 가속 부품으로 쓰는 접근이 실용적 성과를 냄. 확산이 AR을 대체하기보다 상호 보완할 수 있다는 것.
- 열린 질문: 토큰을 어떤 순서로 열 것인가 — Train for the Worst는 적응적 순서가 퍼즐에 유리함을, Flexibility Trap은 일반 추론에서는 독이 될 수 있음을 보여 아직 결론이 안 남.
왜 중요한가
이 분야는 “모델이 아니라 하니스가 경쟁 무대”라는 2026-07-20-pytorchkr-topic-11305-mozilla-ai-2026-3-3의 결론과는 결이 다른, 아키텍처 레벨의 근본적 대안 축을 보여준다 — 속도가 곧 배포 비용인 저지연 서빙 시나리오에서 dLLM은 AR을 대체할 잠재적 옵션이며, DiffusionGemma의 vLLM 네이티브 통합과 Nemotron Diffusion의 자기추측 모드는 이미 실전 서빙 단계에 진입했음을 보여준다.
참고 링크
- 원문: https://discuss.pytorch.kr/t/diffusion-llm-llada-diffusiongemma/11311
- LLaDA: https://arxiv.org/abs/2502.09992
- Mercury: https://arxiv.org/abs/2506.17298
- Dream 7B: https://arxiv.org/abs/2508.15487
- Dream-Coder 7B: https://arxiv.org/abs/2509.01142
- DiffusionGemma: https://huggingface.co/google/diffusiongemma-26B-A4B-it
- How Transparent is DiffusionGemma?: https://arxiv.org/abs/2606.20560
- Nemotron Diffusion: https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-8B
- Beyond Confidence (CCD): https://arxiv.org/abs/2512.02044
- Prophet: https://arxiv.org/abs/2508.19982
- Train for the Worst, Plan for the Best: https://arxiv.org/abs/2502.06768
- The Flexibility Trap: https://arxiv.org/abs/2601.15165
- dLLM-Cache: https://arxiv.org/abs/2506.06295
- DyLLM: https://arxiv.org/abs/2603.08026
- FlashBlock: https://arxiv.org/abs/2602.05305
- Dynamic Expert Sharing: https://arxiv.org/abs/2602.00879
- DFlash: https://arxiv.org/abs/2602.06036
- LLaDA 1.5 / VRPO: https://arxiv.org/abs/2505.19223
- d1: https://arxiv.org/abs/2504.12216
- GDPO: https://arxiv.org/abs/2510.08554