一句话总结
主流大模型清一色是自回归(AR)架构——从左到右逐 token 生成,一个字一个字「挤」出来。2025 年起,Inception Labs 的 Mercury、蚂蚁 + 人大的 LLaDA 把图像领域大杀四方的扩散模型搬到了文本上:并行生成、双向上下文、迭代修正。两年间这个方向从论文走向商业化 API 与开源生态,正在改写「推理速度与生成质量二选一」的旧规则。
数据来源
本文事实依据来自:LLMGuide 扩散语言模型专题(meko1.github.io,2026 更新)、知乎「扩散语言模型(DLM)综述」、康奈尔 Kuleshov 实验室技术分享(经 80aj.com 转载)、GitHub 仓库数据(ML-GSAI/LLaDA ⭐3.9k、inclusionAI/LLaDA2.0 ⭐693、LLaDA2.X ⭐517)、Inception Labs Mercury 产品公开信息,以及钛媒体 Edge AI Daily 早报(2026-09-01)对扩散语言模型产业化的汇总。
自回归的瓶颈:一个字一个字「挤」出来的 AI
过去五年,GPT、Claude、Gemini 这些我们熟悉的模型,底层都是同一种范式:自回归。生成一个句子就像排队过闸机——第一个 token 出来,第二个才能动,第 N 个必须等前 N-1 个全部完成。
这套「串行」机制带来三大痛点:
- 延迟随长度线性增长:写一篇长文,等待时间与字数成正比;
- 单向视野:只能看左边,改不了右边已经写错的部分;
- 一步错、步步错:早期的错误会在后续生成中被不断放大,无法回头修正。

在消费级场景里,这几秒的等待尚可忍受;但在代码补全、实时对话、Agent 多轮调用这些低延迟、高吞吐场景里,串行生成正在成为推理成本与体验的双重瓶颈。
扩散范式:图像领域已验证的「先骨架、后细节」
扩散模型(Diffusion Models)在图像领域早已封神:Stable Diffusion、Midjourney、Sora 都是它的作品。它的核心思想是从噪声中逐步去噪,由粗到细——先定整体骨架,再补细节纹理。
把同样的思路搬到文本,直觉上非常诱人:一次生成多个 token、任意位置同时推进、写错了可以多轮迭代修正——这更接近人类写作,而不是打字机。
但难点也在这里:文本是离散的。图像扩散往像素上加的是连续高斯噪声,有成熟的数学工具;而文本 token 是离散符号,不能直接加高斯噪声。怎么办?业界走出两条路。
文本是离散的:两条技术路线

掩码扩散(Masking Diffusion):多步 BERT,主流路线
前向过程:把句子中比例 t 的 token 替换成 [MASK],t 从 0 一路涨到接近 1——t=0 是原文,t=1 是全部掩码。这与 BERT 的掩码语言建模是同一个操作,只是变成了连续可调的时间步。
反向过程:训练 Transformer 在「部分被掩码的句子 + 时间步 t」条件下,同时预测所有被掩码的位置。推理时多轮迭代 unmask,由粗到细生成完整文本。
这套框架与 BERT 的 MLM 训练数学上兼容——LLaDA 甚至可以理解为「多步、可控噪声比例的 BERT 生成器」。工程成本低(沿用 MLM 代码),是当前绝对主流,代表工作:LLaDA、Dream 7B、Mercury。
得分式离散扩散(SEDD):数学严谨,工程复杂
另一条路用连续时间马尔可夫链定义「token 之间的跳转」,训练目标是得分熵损失(score entropy loss),推理时用类似 Euler 求解器逐步降噪。数学上与图像扩散更同构,但工程实现复杂得多——目前学界成果多、工业部署少,代表工作:SEDD、DiffuBERT。
代表工作时间线:2024 - 2026

| 时间 | 工作 | 发布方 | 意义 |
|---|---|---|---|
| 2024 | SEDD | Stanford | 首个困惑度追平 GPT-2 的离散扩散模型,证明「扩散能做语言建模」 |
| 2025 | LLaDA-8B | 人大 + 蚂蚁 | 首个 8B 级「从零训练」扩散 LLM,指令跟随、少样本推理接近 LLaMA3-8B |
| 2025 | Dream 7B | HKU | 用 Qwen2.5 权重初始化,一次 forward 出多 token,编辑任务大幅领先 AR |
| 2025 | Mercury / Mercury Coder | Inception Labs | 首个商业化扩散 LLM,官方展示 1000+ token/s,主打代码生成 |
| 2025 | DiffuLLaMA / DiffuGPT | 学术界 | 从预训练 AR 模型「改造」为 DLM,几万步微调即可,为大规模落地铺路 |
| 2026 | LLaDA2.0 / LLaDA2.X | 蚂蚁 InclusionAI | 扩散 LLM 系列开源生态成型,目标「理解与生成整个世界」 |
| 2026 | Mercury 2 | Inception Labs | 新一代扩散模型 API,社区已出现流式去噪展示应用 |
DLM vs AR:一张表看懂取舍
| 维度 | 自回归 LLM | 扩散 LLM |
|---|---|---|
| 生成顺序 | 从左到右,严格因果 | 任意顺序、可并行 |
| 单次 forward 产出 | 1 个 token | 多 token(数十到上百) |
| 上下文可见性 | 只能看左边 | 双向,全序列可见 |
| 长文本一致性 | 强 | 追赶中,容易「局部通顺、全局失衡」 |
| 精确问答 / 数学 | 强 | 目前弱于顶级 AR |
| 代码填洞 / 编辑 | 需要专门 FIM 目标 | 原生支持,双向语境天然贴合 |
| 输出长度 | 无上限(EOS 结束) | 通常固定长度,需预设或迭代扩展 |
| 推理延迟 | 与生成长度线性相关 | 与去噪步数 K 相关(K 远小于长度) |
| KV Cache | 有,且是核心优化 | 无标准 KV Cache,每步需重算注意力 |
一句话:DLM 与 AR 不是「谁替代谁」,而是**「推理速度 / 编辑灵活性」vs「生成质量 / 生态成熟度」**的取舍。
「快 10 倍」的真相:吞吐与延迟的公式变了
为什么扩散 LLM 号称推理快 10 倍?关键在于单次 forward 的产出变了:
- 自回归:一次 forward 只出一个 token,权重加载成本被 1 个 token 平摊;
- 扩散:一次 forward 同时填多个位置,把「过一遍权重」的成本平摊到几十上百个 token 上。
这在内存带宽受限的推理场景(batch 小、序列长)优势最大——这也是 Mercury 为什么主打代码补全:低延迟、高吞吐、中短序列,恰好是扩散 LLM 的主场。官方展示的 1000+ token/s,在代码场景里已经具备商用吸引力。
但要注意:10 倍加速不是普适的。长上下文下,双向注意力的 O(L²) 开销会吃掉并行收益;精确问答、数学推理等「必须答对」的任务,扩散模型目前仍落后于顶级自回归模型。
尚待攻克的短板
- 规模未验证:扩散 LLM 尚未扩展到千亿参数,通用基准上与前沿 AR 模型仍有 5-20 个百分点差距
- 无标准 KV Cache:双向注意力每轮 refine 都要重算 K/V,只能靠 prefix cache、减少去噪步数、稀疏化注意力弥补
- 输出长度控制:AR 的「生成到 EOS 就停」依然是最优雅的方案,DLM 需要固定长度、块式扩展或长度预测头
- 对齐困难:DLM 的生成概率是多步去噪的联合分布,直接套 PPO/DPO 不成立,需要专门设计
- 训练稳定性:每个样本要「多角度」看不同掩码比例,收敛所需数据量更大
2026 趋势:混合架构与工业落地
2026 年最值得关注的方向,是混合架构——AR 主干出草稿、扩散头做局部并行填空/refine;或反过来,扩散主干出骨架、AR 头收尾。DiffuLLaMA 证明的「AR 模型低成本改造为 DLM」路径(权重初始化 + 双向注意力 + 扩散化微调,便宜一到两个数量级),让扩散能力可以借力现有生态快速铺开。
产业侧,9 月初的行业早报(Edge AI Daily)将扩散语言模型列为「跨入工业主流」的关键信号:Google 开源 DiffusionGemma(块级扩散,约 4 倍加速)、NVIDIA 推出 Nemotron-Labs-Diffusion(多模式切换,最高约 6.4 倍加速)等进展密集出现——从「论文玩具」到「开源权重 + 商业 API」,这个范式正在完成最后一公里。
对开发者的意义
- 代码补全场景:扩散 LLM 的 1000+ token/s 与原生填洞能力,是 Copilot 类工具的新选择
- 文档编辑 / 重写:双向上下文让「改一段、补一句」天然比 AR 更顺手
- Agent 调用成本:并行生成降低多轮调用的延迟累积,长时运行 Agent 的体验会明显改善
- 开源生态:LLaDA2.0 系列已在 GitHub 开源(蚂蚁 InclusionAI),可本地部署实验;相关模型与生态可在 Hugging Face 找到
总结
- 自回归的三大痛点——串行延迟、单向视野、无法修正——正是扩散 LLM 的三大卖点
- 两条技术路线:掩码扩散(主流,多步 BERT)vs 得分式离散扩散(SEDD,数学严谨、工程复杂)
- 两年时间线:SEDD 2024 追平 GPT-2 → LLaDA-8B 2025 从零训练 → Mercury 商业化 → LLaDA2.0 与 Mercury 2 在 2026 走向工业主流
- 快 10 倍的真相:单次 forward 产出多 token,摊薄权重加载成本,内存带宽受限场景优势最大
- 短期不会取代 AR:质量差距、生态成熟度、对齐与训练稳定性仍是硬伤;混合架构(AR 骨架 + 扩散填空)是更现实的落地路径
- 给开发者的信号:代码补全、文档编辑、Agent 延迟优化,是扩散 LLM 最早兑现价值的三个场景