출처
- source_url: https://discuss.pytorch.kr/t/llada2-2-levenshtein-diffusion-lm/11463
- author: 9bow
- published: Thu, 30 Jul 2026 21:30:55 +0000
- raw: raw source:
2026-07-31-pytorchkr-topic-11463-llada2-2-levenshtein-diffusion-lm
LLaDA2.2: 레벤슈타인 편집을 도입한 확산 언어 모델
개요
LLaDA2.2는 확산 언어 모델의 병렬 디코딩 과정에 DELETE와 INSERT 연산을 추가해, 기존의 고정 길이 치환 중심 편집을 레벤슈타인 편집으로 확장한 모델이다. 이를 통해 중복 토큰 삭제, 누락된 토큰 삽입, 토큰 정렬 변경과 같은 오류를 복원 과정에서 처리할 수 있도록 설계했다. 연구팀은 128K 컨텍스트, MoE 블록 라우팅, 환경 보상 기반의 L-EBPO 강화학습을 함께 제안했다. 공개 모델은 비임베딩 파라미터 100B 규모의 MoE 확산 모델인 LLaDA2.2-flash다. 원문은 7개 에이전트 벤치마크 평균 53.83점과 11개 워크로드 평균 1.64배의 디코딩 처리량을 보고한다.
핵심 포인트
- 레벤슈타인 편집 도입:
KEEP,SUBSTITUTE,DELETE,INSERT네 가지 연산을 사용해 출력 토큰의 내용뿐 아니라 시퀀스 길이와 정렬도 조정한다. - 확산 모델의 에이전트 취약점 보완: 병렬 복원에서 발생하는 n-gram 반복, 깨진 JSON, 모호한 도구 호출 경계와 초기 오류의 누적 문제를 편집 과정으로 완화하려 한다.
- LCS 기반 편집 레이블 자동 생성: 초안과 목표 시퀀스의 최장 공통 부분 수열을 이용해 편집 연산에 대한 학습 레이블을 자동으로 구성한다.
- 128K 네이티브 컨텍스트: 8K에서 64K, 이후 128K로 지속 사전학습을 단계적으로 진행하고, 장문 문서·저장소 코드·에이전트 궤적을 활용한다.
- MoE 블록 라우팅: 확산 디코딩 블록 단위로 승인된 전문가 풀을 먼저 구성한 뒤 토큰별 라우팅을 제한해, 블록마다 활성화되는 전문가 수와 시스템 비용을 예측 가능하게 만든다.
- L-EBPO 강화학습: 토큰 생성과
DELETE·INSERT편집 결정을 하나의 행동 공간으로 통합하고, 환경 피드백을 통해 편집 전략을 최적화한다. - 성능 비교: 원문에 따르면 LLaDA2.2-flash는 Ling-2.6-flash보다 평균 에이전트 벤치마크 점수는 낮았지만, τ²-Bench·PinchBench·MCP-Atlas에서는 앞섰고 평균 디코딩 처리량은 더 높았다.
왜 중요한가
확산 언어 모델은 여러 토큰을 동시에 생성해 지연 시간을 줄일 가능성이 있지만, 병렬 결정으로 인해 구조적 오류와 장기 에이전트 작업에서의 오류 누적 문제가 발생할 수 있다. LLaDA2.2는 단순히 잘못된 토큰을 다른 토큰으로 바꾸는 방식에서 벗어나, 토큰을 삭제하거나 새 위치를 삽입하는 편집 메커니즘을 복원 루프에 통합했다. 특히 도구 호출 인자, JSON 구조, 코드처럼 토큰 하나의 삽입·삭제가 뒤쪽 정렬 전체에 영향을 주는 작업에서 이 접근의 의미를 평가할 수 있다. 다만 원문에 제시된 결과는 특정 벤치마크와 워크로드에 대한 비교이므로, 자기회귀 모델을 전반적으로 대체한다고 해석해서는 안 된다.
후속으로 볼 링크 및 키워드
- 원문: https://discuss.pytorch.kr/t/llada2-2-levenshtein-diffusion-lm/11463
- 확산 언어 모델: https://arxiv.org/abs/2502.09992
- LLaDA2.0: https://arxiv.org/abs/2512.15745
- LLaDA2.1: https://arxiv.org/abs/2602.08676
- Insertion Transformer: https://proceedings.mlr.press/v97/stern19a.html
- Levenshtein Transformer: https://papers.nips.cc/paper_files/paper/2019/hash/675f9820626f5bc0afb47b57890b466e-Abstract.html
- 관련 키워드:
Diffusion LM,Levenshtein Editing,DELETE/INSERT,MoE Block Routing,128K Long Context,L-EBPO,Agent RL,Tool Calling
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-07-31-pytorchkr-topic-11463-llada2-2-levenshtein-diffusion-lm에 source_url 및 HTML 원문과 함께 저장되어 있습니다.