Nemotron-Labs-TwoTower:用 block diffusion 挑戰 LLM 逐 token 生成瓶頸
NVIDIA Nemotron-Labs-TwoTower 是 two-tower block-wise diffusion language model:凍結 AR/context tower 處理上下文,訓練 diffusion/denoiser tower 以 mask diffusion 並行生成 token block。模型卡聲稱在 2×H100、block size 16、γ=0.8 下達 2.42× AR throughput 並保留 98.7% aggregate quality。
Hugging Face:nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16
Paper:Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context
license: other,license_name 為 nvidia-open-model-license,並寫明 ready for commercial use;這不是 OSI 意義的「開源授權」,更精確說法是 NVIDIA Open Model License 下的 open weights / commercially usable model。商用前仍應讀 NVIDIA Nemotron Open Model License。原文重點
- 傳統 LLM 生成多為 autoregressive:一個 token 接一個 token 從左到右生成。
- 這帶來 latency / throughput 瓶頸,尤其在 agent loop 裡多次呼叫時會累積成明顯體感。
- NVIDIA Nemotron-Labs-TwoTower 把模型拆成 context tower 與 denoiser tower。
- context tower 凍結,負責處理乾淨 prompt 與已 committed tokens。
- denoiser tower 用 mask diffusion 對 token block 並行生成與反覆修正。
- 模型卡聲稱:2.42× generation throughput、98.7% aggregate quality retained。
核對到的模型資訊
| 項目 | 內容 |
|---|---|
| Model ID | nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16 |