100B 파라미터도 가뿐하게! MoE와 Token Editing으로 AR 모델의 속도를 넘어서다
MoE 스케일링, Token Editing(T2T+M2T), S-Mode/Q-Mode, RL Framework -- LLaDA 2.X가 Diffusion LLM을 실용화하는 과정.

100B 파라미터도 가뿐하게! MoE와 Token Editing으로 AR 모델의 속도를 넘어서다
Part 3에서 LLaDA가 Masked Diffusion을 8B 스케일로 확장하며 "Diffusion LLM은 가능하다"를 증명했습니다. 하지만 실용적인 문제가 남아 있었습니다: 속도가 AR 모델에 비해 훨씬 느리고, RLHF 같은 정렬 학습이 부재했습니다.
2025년 11월 Ant Group의 InclusionAI가 LLaDA 2.0으로 이 간극을 좁히기 시작했고, 2026년 2월 LLaDA 2.1에서 Token Editing이라는 혁신으로 속도-품질 트레이드오프를 재정의했습니다.
이 글에서는 8B에서 100B로의 스케일링, MoE 아키텍처의 도입, 그리고 Token Editing의 작동 원리를 다룹니다.
LLaDA 2.0: 100B로의 도약
LLaDA 2.0은 두 가지 모델을 출시했습니다:
| 모델 | 총 파라미터 | 활성 파라미터 | 레이어 | Heads | Context | Vocab |
|---|---|---|---|---|---|---|
| LLaDA 2.0-mini | 16B | 1.4B | 20 | 16 | 32,768 | 157,184 |
| LLaDA 2.0-flash | 100B | 6.1B | 32 | 32 | 32,768 | 157,184 |
핵심 변화: MoE(Mixture of Experts) 도입.
원본 LLaDA 8B는 dense 모델이었습니다 -- 모든 파라미터가 매 입력에 대해 활성화됩니다. LLaDA 2.0은 MoE 구조를 채택해 총 파라미터는 크게 키우되, 실제 추론 시에는 소수의 expert만 활성화됩니다.
LLaDA 2.0-flash는 100B 파라미터 중 6.1B만 활성화됩니다. 이것은 Mixtral, DeepSeek 등 AR MoE 모델과 동일한 전략입니다: "모델의 전체 지식은 넓게 유지하되, 추론 비용은 낮게."
관련 포스트

Paper of the Week #3 — FLOP이 절반이라고 시간이 절반은 아닙니다
정수 하나로 MoE expert 연산을 절반으로 줄이는 논문(arXiv 2609.04575)의 표 5를 A100 한 장에서 1점 안쪽으로 재현했습니다. 논문에 없는 속도를 쟀더니 HF transformers에서는 0, 지금 쓰는 순정 vLLM의 batch 1에서도 0, batch 8에서 1.35배였습니다. 재정규화 없이 학습된 OLMoE 대조군과 2호가 약속한 iso-cost 정산도 실었습니다.

논문은 절반에서 멈췄습니다. 4분의 1은 30점이 아니라 4점을 잃고, 재정규화 없이 학습된 모델이 이유를 알려줍니다
arXiv:2609.04575가 돌리지 않은 두 칸을 채웠습니다. Qwen3.6-35B-A3B에서 k₁=2·3, 그리고 재정규화 없이 학습된 OLMoE에 k₂ 기법을 통째로 적용한 결과입니다. 두 번째가 논문 메커니즘의 반증 시험입니다.

MoE expert를 절반만 켜는 정수 하나 — batch 1에서는 공짜가 아니었습니다
arXiv:2609.04575의 표 5를 A100 한 장으로 재현하고, 논문에 없는 처리량을 쟀습니다. HF transformers에서는 이득이 없고, 순정 vLLM의 batch 1에서도 없고, batch 8에서 1.35배입니다.