← 返回归档

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

arXiv ID: 2606.27732 | 日期: 2026-06-30 | 重新解读: ✅ 机构: Meta AI + University of North Carolina at Chapel Hill | 模型规模: Qwen3-1.7B | 训练规模: 60B tokens

Bifocal Diffusion 概念图

Bifocal Diffusion 概念图:非对称双向上下文用于并行生成。

1. 一句话定位

dLLM 推理效率方向,提出 Bifocal dLLM 范式(因果注意力 + 反向 Mamba 边车提供压缩的右侧上下文),在 7 个多选 benchmark 平均分上 同时超过纯因果 dLLM(+3.11pp)和双向 dLLM(+0.97pp),并在 batch serving 场景下实现 2.4×-12.9× 吞吐量

2. TL;DR

  • 根本矛盾:dLLM 要么用双向注意力拿到完整上下文(质量好但每次去噪重算,无法 KV cache),要么用因果注意力(支持 KV cache,但每个 masked 位置丢掉所有右侧 token)。本文称之为"architectural dilemma"。
  • 核心 idea:asymmetric bidirectional context(不对称双向上下文)。左右两侧用不同机制:左侧走因果 Transformer(拿精确左上下文 + 完整 KV cache),右侧走反向 Mamba SSM(拿压缩右上下文,消费 causal-attention 的 KV)。
  • 实例化 R2LM(Right-to-Left Mamba):在 Qwen3-1.7B 的 28 层 decoder 中,每 4 层挂一个 ReverseMambaLayer hook(共 7 个),门控 $s$ 初始化为 0,使模型在 step 0 与纯因果 baseline bit-identical
  • 三种训练模式:joint(CPT 60B tokens)、plug-in R2LM-PI(冻结因果 backbone,仅训练 5B tokens 的 R2L 边车)、以及在 §5.3 中用 1B tokens 做的方向性消融。
  • 核心数字:吞吐量 vs bidir 2.4×-12.9×、vs AR 1.9×-2.9×;平均准确率 47.71%(causal 44.60%、bidir 46.74%);R2LM-PI 在仅 1/12 数据、1/10 训练参数下达到 47.76% ALL avg(4 个模型中最高)。

3. 问题与动机

3.1 痛点场景

dLLM 之所以吸引人,是因为它能在 T ≪ N 步内并行生成 N 个 token,论文与实证显示比优化过的 AR 引擎快 3-8×。但当 serving 系统处于 batch 饱和状态(B=8, prompt P=4096)时,双向 dLLM 的吞吐量会塌方到 53 tok/s,而 R2LM 仍能保持 683 tok/s——12.9× 的差距。这就是论文瞄准的 workload:长 prompt + 高 batch 的并行 decoding 场景

3.2 现有方法为什么不够(具体到方法名 + 缺陷)

范式 代表 核心缺陷
双向 dLLM LLaDA, Dream KV 不再可缓存,每步重算 O(B(P+G)²),长 prompt 下吞吐塌方
因果 dLLM WeDLM, CARD 拓扑重排/掩码调度,但每个 masked 位置永远拿不到 j>i 的 token,质量低
块 dLLM BD3-LM, Fast-dLLM v2, SDLM 块内双向、块间因果。右上下文被限制在单个 32-128 token 块内(§2 第三段)
混合 AR-Diffusion ReFusion, TiDAR, e-Solms 双模式或 slot 置换,架构复杂,且右上下文获取不连续

引用(§1 倒数第二段):"causal attention restricts each position to left-only context, and no amount of inference optimization can recover the missing right-side information."

3.3 本文的核心 insight

右上下文不一定要走注意力。如果让一个反向 SSM 单独承担"提供右上下文"的责任,causal attention 就可以保持纯因果,从而 KV cache 完全有效。

这一招的关键是不对称(asymmetric):左右不是同一种机制的"对偶",而是两种不同机制的组合。这是与 Jamba 等同方向 SSM+Attention 混合架构的本质区别(Jamba 是 L2R + L2R,SSM 只提供容量;R2LM 是 L2R + R2L,SSM 提供 causal attention 结构性无法触及的信息)。

图 1(左图,§1):架构对比 + 质量/吞吐量散点。左:双向(满注意力、无 KV cache)vs 因果(有 KV cache、无右上下文)vs Bifocal(causal + R2L 边车)。右:在 H100 P=4096, B=8 配置下,R2LM 位于右上区域(高质量 + 高吞吐)。

***图 1(左图,§1)**:架构对比 + 质量/吞吐量散点。左:双向(满注意力、无 KV cache)vs 因果(有 KV cache、无右上下文)vs Bifocal(causal + R2L 边车)。右:在 H100 P=4096, B=8 配置下,R2LM 位于右上区域(高质量 + 高吞吐)。*

4. 方法详解

4.1 架构总览

R2LM 是一种非修改的因果 Transformer backbone + 反向 Mamba 残余流的混合架构。R2L 流被作为 forward hook 挂载在每 $k$ 个 decoder 层之后,产生的 $\tanh(s)$ 门控残差直接加回 hidden state。门控 $s$ 初始化为 0 → 训练 step 0 时整个模型与纯因果 baseline 比特相同。注意力层本身完全不动,因此 prefix KV cache 的有效性不被打断。

4.2 形式化定义

4.2.1 MDLM 前向过程与损失

$$q(z_t^i = m \mid x_i) = \alpha_t \cdot \mathbf{1}[m = x_i] + (1 - \alpha_t) \cdot \mathbf{1}[m = \texttt{[MASK]}],\quad \alpha_t = 1 - t \tag{1}$$ $$\mathcal{L}(\theta) = \mathbb{E}_{t, \mathbf{x}, \mathbf{z}_t}\!\left[\, w(t) \sum_{i \in \mathcal{M}_t} -\log p_\theta(x_i \mid \mathbf{z}_t) \,\right],\quad w(t) = \frac{1 - \alpha_t}{1 - \alpha_t} = \frac{1}{1 - t} \tag{2}$$

(论文 §3.1 eq 1-2)

4.2.2 右侧上下文信息间隙(信息论下界)

$$\Delta_i^t \;=\; H(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i}) - H(x_i \mid \mathbf{x}_{\mathcal{O}_t}) \;=\; I\!\left(x_i;\, \mathbf{x}_{\mathcal{O}_t}^{>i} \,\middle|\, \mathbf{x}_{\mathcal{O}_t}^{\leq i}\right) \;\geq\; 0 \tag{3}$$

(论文 eq 3)。这是一个干净的信息论表述:因果与双向 dLLM 的质量差,本质上等于目标 token 在已知左上下文条件下、还能从右侧观察 token 拿到的条件互信息。mask rate $\gamma$ 下,位置 $i$ 的右观察数量期望为 $(1-\gamma)(L-i)$,所以 $\Delta_i^t$ 在序列左侧最大、右侧为 0。

4.2.3 对数后验加性分解(Proposition 1)

$$\log p(x_i \mid \mathbf{x}_{\mathcal{O}_t}) = \underbrace{\log p(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i})}_{\text{left-context term}} + \underbrace{\log \frac{p(x_i \mid \mathbf{x}_{\mathcal{O}_t})}{p(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i})}}_{\Delta_i^{\text{R2L}}:\;\text{right-context correction}} \tag{4}$$ $$\mathbb{E}_{(x_i, \mathbf{x}_{\mathcal{O}_t})}\!\left[\Delta_i^{\text{R2L}}\right] = I\!\left(x_i;\, \mathbf{x}_{\mathcal{O}_t}^{>i} \,\middle|\, \mathbf{x}_{\mathcal{O}_t}^{\leq i}\right) \tag{5}$$

(论文 eq 4-5)。这是整个方法的理论骨架。它直接给出三条架构要求(§3.3 列表):

  1. 保留因果通路(拿左上下文项 + 维护 prefix KV cache);
  2. 加一个由 $j > i$ token 驱动的残差信号去近似 $\Delta_i^{\text{R2L}}$;
  3. 残差从 0 开始(bit-identical at init)。

注意:LayerNorm 和 softmax 在 logit 层面会破坏严格加性,论文也承认这一点(§3.3 末段)——因此 eq 4 是归纳偏置而不是严格等式。

4.2.4 R2L 流的四步操作(§3.5)

设 hook 层输出 $\mathbf{h} \in \mathbb{R}^{B \times L \times d}$:

  1. 序列翻转:$\mathbf{h}_{\text{flip}} = \mathrm{flip}(\mathbf{h}, \mathrm{dim}{=}1)$ —— 把右 token 暴露给 L→R scan。没这一步,SSM 总结的就是左上下文(causal backbone 已经有了),没有新信息。
  2. Mamba selective scan:$\mathbf{h}_{\text{mamba}} = \mathrm{Mamba}(\mathbf{h}_{\text{flip}})$ —— 选 Mamba-1 而非 reverse attention/RNN/linear attention,因为 SSM 用线性时间聚合"位置感知的"前缀摘要,且不消费 causal attention 的 KV
  3. 反翻转 + LayerNorm:$\mathbf{h}_{\text{R2L}} = \mathrm{LN}(\mathrm{flip}(\mathbf{h}_{\text{mamba}}, \mathrm{dim}{=}1))$ —— LN 限制残差量级。
  4. 门控残差:$\mathbf{h}^{+} = \mathbf{h} + \mathbf{h}_{\text{R2L}} \cdot \tanh(s)$,标量 $s$ 初始化为 0。tanh 饱和到 $|\cdot| \le 1$,对齐 LayerScale/ControlNet 的稳定做法。

4.3 为什么是 Mamba 不是其他?

作者明确比较了 4 个候选:reverse self-attention、reverse RNN、linear attention、Mamba。决定性论据:SSM scan 不消费 causal-attention 的 KV cache。reverse self-attention 会重新算 full attention(比双向 dLLM 还慢);reverse RNN 表达力不足;linear attention 在 $d=2048$ 下不够稳。Mamba 是唯一同时满足"位置感知 + 线性时间 + 不破 cache"三约束的选择。

4.4 关键超参

$s=0$ $28 / 4 = 7$
超参 取值 选取原因
Hook 间隔 $k$ 4 Qwen3-1.7B 有 28 层 → $H=7$ 个 hook。论文未给消融,选 $k=4$ 似乎是经验值。
Mamba $d_{\text{state}}$ 16 标准 Mamba 配置
Mamba $d_{\text{conv}}$ 4 标准
Mamba expand 2 标准
门控初始化bit-identical at init(关键性质)
Hook 数量 7
训练总 tokens 60B joint CPT 预算
优化器 AdamW lr $1\!\times\!10^{-4}$(joint),$5\!\times\!10^{-4}$(PI)
Warmup 500 步 (joint) / 100 步 (PI) 线性 warmup + cosine decay
Weight decay 0.01 标准
Sequence length 4096 与 longest $P$ 吞吐测试对齐
精度 bf16 + grad checkpoint 32×H100 4×8 FSDP
评估 sampler CausalMDLMSampler / MDLMSampler mc_num=32, batch=8, max_len=4096
去噪步数 $T$ 32 论文级标准

4.5 训练开销

  • 算力:32 张 H100,全分片 FSDP,4×8 拓扑。
  • 训练数据:HuggingFaceFW/fineweb-edu,seed 42 → 三个 run 看到完全相同的 batch(排除数据扰动)。
  • 训练量:60B tokens(joint);5B tokens(R2LM-PI plug-in,1/12 数据量)。
  • 额外参数:R2L 边车 ~185M(~10.8% backbone 大小)。

图 2(§3.5, fig:architecture):R2LM 架构细节。左侧是 causal Transformer(保留 KV cache);右侧是去噪循环中从生成 block 跑 R2L scan(独立于 prompt KV cache),每 4 层挂一个 ReverseMambaLayer hook。

***图 2(§3.5, fig:architecture)**:R2LM 架构细节。左侧是 causal Transformer(保留 KV cache);右侧是去噪循环中从生成 block 跑 R2L scan(独立于 prompt KV cache),每 4 层挂一个 ReverseMambaLayer hook。*

5. 实验结果

5.1 主结果表

表 2:7 个多选 benchmark 准确率(60B-token CPT from Qwen3-1.7B,单位 %)

Model ARC-C 25sh HellaSwag 3sh PIQA 0sh WG 5sh OBQA 0sh BoolQ 0sh MMLU 5sh Long avg Short avg ALL
Bidir dLLM 45.30 43.40 61.50 57.70 16.00 68.40 34.90 44.78 51.65 46.74
Causal dLLM 38.70 35.70 63.80 54.30 27.00 65.30 27.40 43.90 46.35 44.60
R2LM 39.40 43.00 67.20 60.20 27.40 67.00 29.80 47.44 48.40 47.71
R2LM-PI 40.90 39.50 64.60 59.40 25.60 67.30 37.00 46.00 52.15 47.76

简化排版(省略 $\Delta$ 标注),完整表见原论文 §4.2 tab:main。Long = 5 个多 token 候选任务平均,Short = BoolQ + MMLU(单 token)平均,ALL = 7 个平均。

5.2 核心发现(带数字 + 表格引用)

  1. ALL 平均上 R2LM 超过两个端点(表 2 第 4 行):47.71% > bidir 46.74% (+0.97pp) > causal 44.60% (+3.11pp)。R2LM-PI 47.76% 进一步领先(表 2 第 5 行)。
  2. 长目标任务的右上下文红利最大(§4.2 末段 + 表 2 Long 列):R2LM 47.44% vs causal 43.90%(+3.54pp)、vs bidir 44.78%(+2.66pp)。这与 eq 3 的预测一致——右上下文信息间隙在长候选任务上最大。
  3. R2LM-PI 用 1/12 数据、1/10 训练参数追平/超过 joint R2LM(§4.2 倒数第二段):在 MMLU 上 R2LM-PI 37.00% > R2LM 29.80% > bidir 34.90%。这暗示 R2L 通路可以解耦地迁移到已训练好的 MDLM backbone。
  4. 不是 MMLU 的过拟合(表 2):R2LM 在 5 个长目标任务的 3 个上超 bidir,1 个平手,1 个落败(ARC-C -5.9pp)。这是诚实的 4-of-5 胜率,不是单 benchmark 神话。

5.3 吞吐量主表

表 3:单 H100-80GB 吞吐量(tok/s),$T=32$ 步,$G=128$ 生成 token

Model B=1, P=512 B=1, P=1024 B=1, P=2048 B=1, P=4096 B=8, P=512 B=8, P=1024 B=8, P=2048 B=8, P=4096
Qwen3-1.7B (AR) 45.4 45.7 45.6 45.0 404 397 383 362
Causal dLLM 170.9 171.9 166.6 163.4 1356 1295 1050 732
Bidir dLLM 246.2 187.0 106.0 50.9 483 260 124 53
R2LM 147.1 146.2 144.5 139.7 1154 1089 956 683
R2LM vs Bidir (B=8) 2.39× 4.19× 7.71× 12.9×
R2LM vs AR (B=8) 2.86× 2.74× 2.50× 1.89×

关键观察:bidir 吞吐随 P 增大单调塌方(483 → 53 tok/s),R2LM 几乎平稳(1154 → 683 tok/s)。差距在 P=4096 处达到 12.9×。

5.4 消融:方向性是核心,不是参数量

表 4:1B tokens 联合训练机制消融

Variant Extra params Train loss $\downarrow$ WikiText-103 PPL $\downarrow$
Causal dLLM (baseline) 0 4.66 178
+ MLP Adapter (no direction) 185M 4.63 356
+ L2R Mamba (original direction) 185M 4.84 374
+ R2L Mamba (R2LM) 185M 3.18 42
Bidirectional dLLM 0 3.02 30

这是论文最有说服力的实验。三个变体都用 185M 额外参数,但:

  • MLP Adapter(无方向性):PPL 翻倍到 356——多参数反而有害
  • L2R Mamba(错方向):PPL 374,比 baseline 还差——wrong direction is actively harmful(§4.3 原文)。
  • R2L Mamba:PPL 42,接近 bidir 的 30——同参数量下,方向对了才能 4.2× 提升 PPL。

这条消融直接否定了"参数红利"的解释,确立了"右上下文方向性"才是 R2LM 的根本。

5.5 内存与吞吐退化(fig:efficiency)

  • B=1 时内存:R2LM 12.7 GB(@P=16384) vs bidir 18.5 GB → 节省 5.9 GB(32%)
  • 吞吐保留:R2LM 在 P=4096 / B=8 处保留 59% 的 P=512 吞吐(683/1154),而 bidir 只保留 11%(53/483)。
  • R2LM 内存与因果 dLLM 几乎重合(差 0.4 GB 以内),证明 R2L 边的内存成本与它的"边车"地位相符。

5.6 对比方法清单

  • 基类(两端点):Bidirectional dLLM = LLaDA / Dream / DiffuLLaMA 风格的 full attention;Causal dLLM = WeDLM / CARD 风格的 strict causal。
  • 同类 SOTA(块/混合):BD3-LM(arriola2025)、SDAR、Fast-dLLM v2、ReFusion、TiDAR、e-Solms。
  • SSM 家族:Mamba(基座)、Jamba(同方向 SSM+Attention 混合,对照组)。
  • 本文:Bifocal dLLM (R2LM + R2LM-PI),attn pattern = Causal + $\underline{X}$,$\underline{X}$ = R2L Mamba。

图 3(§4.3, fig:efficiency):推理效率全景。(a,b) 吞吐 vs prompt 长度 $P$ @ B=8 与 B=1;(c) 吞吐 vs batch $B$ @ P=512;(d) 相对 bidir 的 speedup;(e,f) 内存与内存节省;(g,h) 吞吐保留与内存增长曲线。

***图 3(§4.3, fig:efficiency)**:推理效率全景。(a,b) 吞吐 vs prompt 长度 $P$ @ B=8 与 B=1;(c) 吞吐 vs batch $B$ @ P=512;(d) 相对 bidir 的 speedup;(e,f) 内存与内存节省;(g,h) 吞吐保留与内存增长曲线。*

6. 横向对比

R2LM 不是孤立的"右上下文边车"工作,必须放在 dLLM 范式 + SSM 混合架构两条轴上同时比较。

维度 R2LM (本文) LLaDA (双向) BD3-LM (块扩散) WeDLM (因果) Jamba (同向 SSM+Attn)
注意力模式 Causal + R2L hook Full bidirectional Block-causal + intra-block bidir Strict causal L2R Attention + L2R Mamba
右上下文来源 反向 Mamba SSM 全注意力 块内注意力 L2R Mamba(冗余于 Attn)
右上下文范围 整序列(连续) 整序列(精确) 单块 32-128 token 0 token 整序列(无新信息
KV cache 有效性 完整 失效 块级(部分) 完整 完整
训练数据 60B tokens 2.3T+ ~数百 B ~数十 B 数 T
训练成本(参照) 32×H100 大规模 中规模 中规模 大规模
单请求吞吐 (B=1, P=4096) 139.7 tok/s 50.9 tok/s(慢 2.7× 163.4 tok/s(快 17%
Batch 吞吐 (B=8, P=4096) 683 tok/s 53 tok/s(慢 12.9× 732 tok/s(快 7%
7 benchmark ALL avg 47.71% (R2LM) / 47.76% (R2LM-PI) 46.74% 44.60% (causal)
Long avg 47.44% 44.78% 43.90%
推理实现复杂度 中(hook 注入) 低(标准 Transformer) 中(块调度) 低(标准 causal) 高(双层交替)
架构创新点 非对称双向;R2L SSM 作为右上下文专用通路 严格双向 dLLM 范式 块粒度双向 拓扑重排 + 掩码调度 同向 SSM+Attn 容量混合

关键数据均来自本论文 §4.2 tab:main 与 §4.3 tab:speed;Jamba 数据非本文直接报告,仅作架构对比。

定位总结

R2LM 在 LLaDA / BD3-LM / WeDLM / ReFusion 主导的赛道里,处于"换了右侧信息通路,但保留左侧 cache 范式"的破局者位置:

  • 相比 LLaDA(双向 dLLM SOTA),R2LM 放弃了精确右注意力换取 12.9× 吞吐,并通过 R2L SSM 的压缩右上下文把 ALL avg 做得更高(47.71% > 46.74%)。这是"质量/效率 Pareto 前沿上的右上推进"。
  • 相比 BD3-LM(块扩散),R2LM 的右上下文是整序列连续的(块扩散限制在 32-128 token),cache 粒度也更细。
  • 相比 WeDLM(因果),R2LM 在 ALL avg 上 +3.11pp,在长目标上 +3.54pp,代价是 B=1 时 7-16% 的 R2L 开销。
  • 相比 Jamba(同向 SSM+Attn),R2LM 走的是反向 SSM,真正提供新信息而非仅提供容量。这是范式级的差别。
  • 与 ReFusion / TiDAR 等混合 AR-Diffusion 相比,R2LM 的架构修改量小得多(仅加 hook),不引入双模式切换的工程复杂度。

7. 批判性局限性

7.1 训练预算偏低,难以支撑"dLLM 已经能匹敌 AR"的大结论

问题:1.7B 参数 + 60B tokens 的 CPT 预算远低于 AR/LLaDA 报告 SOTA 的规模(AR 通常 1T+ tokens、≥7B 参数)。论文承认"results may evolve at scale"(§6 Limitations 第 1 段),但没有给出 scaling trend——是 sublinear?是 sublinear with 拐点?

证据:表 2 R2LM 在 MMLU 5-shot 上仅 29.80%,远低于已公开的 AR 同规模模型(Qwen3-1.7B-Base 在 MMLU 上约 56-60%)。这不是论文本身的失败,但读者不能把 47.71% ALL avg 当作"dLLM 时代来临"的证据

影响范围:所有 §4.2 质量结论都需要在 ≥7B 规模上复现才能定性。

7.2 ARC-C 任务上 R2LM 显著落后于 bidir,机制不明确

问题:表 2 第 1 列 ARC-C 25-shot 上,R2LM 39.40% vs bidir 45.30%(-5.9pp)。这是 5 个长目标任务中 R2LM 唯一明确落败的项目。ARC-C 是科学推理多选题,右上下文预期最有价值(实体定义→选项推理),但反向 Mamba 的压缩右上下文在此处反而伤害了性能。

证据:§4.2 第 3 段 "R2LM beats bidirectional on PIQA, WinoGrande, and OBQA, is roughly tied on HellaSwag, and trails bidirectional on ARC-C"——论文承认但没解释

影响范围:削弱了"右上下文是无条件红利"的主张;R2LM 路径在需要精确右注意力的任务上仍有上限。eq 3 的"右上下文信息间隙"在 ARC-C 上的具体数值(mask rate 依赖)也未报告,读者无法判断是 SSM 容量不够还是方向性不够。

7.3 R2L 边车在 B=1 单请求场景下比纯因果 dLLM 慢 14-17%

问题:表 3 B=1 列上,R2LM 在 P=512 到 P=4096 全部慢于 Causal dLLM(147.1 vs 170.9 @P=512,139.7 vs 163.4 @P=4096)。这不是"持平"——R2L hook 的前向开销在没有 batch 摊销时变成纯成本。论文承认"R2L overhead versus the causal dLLM is 7 to 16%",但没解释为什么不在 B=1 时禁用 R2L 通路

证据:§4.3 末段 + 表 3 B=1 列。

影响范围否定了"R2LM 是因果 dLLM 的严格升级版"的解读——单请求场景下,因果 dLLM 仍然更优。论文应该明确给出一个"用 causal 还是 R2LM"的判定规则(按 batch size 切换?)。

7.4 R2L 仅在 1.7B / 28 层 Qwen3 上验证,hook 间隔 k=4 是经验值

问题:所有实验都在 Qwen3-1.7B(28 层)上做,$k=4$ 给出 7 个 hook。论文没有给出 $k \in \{1, 2, 4, 8, 14, 28\}$ 的消融表。如果 $k=2$ 也能拿到类似增益,那 R2LM 的"边车"成本更低;如果 $k=8$ 性能显著下降,那 $k=4$ 是不是只是恰好在 1.7B 上的 lucky value?类似地,d_inner、d_state、expand 全部沿用 Mamba-1 默认值,没有 sweep

证据:§4.1 Models 段说"$k=4$, $H=7$ hooks with $d_\text{state}=16, d_\text{conv}=4$, expand 2"——所有数字都"default",但默认参数的鲁棒性在表 4 消融中未跨 $k$ 测试。

影响范围:在更大模型(≥7B)或更深架构(≥40 层)上,$k=4$ 是否仍然最优未经验证。可能存在"层数变了 hook 间隔也得变"的隐性约束。

7.5 表 4 消融的 1B tokens 训练量与主实验 60B 严重不匹配

问题:表 4(机制消融)只用 1B tokens CPT,但表 2(主结果)用 60B tokens。这意味着"MLP Adapter / L2R Mamba 也用 60B tokens 时可能追平 R2LM"的可能性未被排除——1B 训练量下三者都欠拟合,PPL 差异可能部分来自"训练量不够时方向性优势的纯化效果"。

证据:§4.3 段开头"To answer RQ3 we isolate the R2L mechanism with two parameter-matched controls trained jointly with the causal backbone on 1B tokens"——明确写了 1B。

影响范围:表 4 的"方向性才是关键"结论的强度取决于 1B 训练下三者都已接近收敛,但 178 → 356 的 PPL 翻倍在 1B 训练下未必能外推到 60B。需要在 10B+ tokens 上重复消融才能定性。

7.6 缺乏对"右上下文到底有多重要"的任务级独立证据

问题:论文把右上下文价值与"候选 token 长度"绑定(长候选 → 右上下文价值大),但没有给出控制候选长度的实验——比如同任务下比较 1-token vs N-token 候选的 R2LM 增益。在 ARC-C 上 R2LM 输给 bidir,是否因为 ARC-C 的多选答案虽然短但需要长程右侧推理(题目与选项之间的关系跨越多 token)?

证据:§4.2 末段"the value of right context grows with the amount of unmasked material to the right of each masked position"——这是论断,但没有给任务级的 per-token 增益曲线

影响范围:读者无法判断 R2LM 的应用边界——哪些任务类型值得加 R2L 边车,哪些不值得。

8. 可复用启发 / 关键 takeaway

给"未来做 dLLM / SSM 混合 / KV cache 友好架构"的人:

  1. "右信息不一定走注意力"是一个被严重低估的设计自由度。当架构约束是"必须保留某种 cache"时,不要假设只有"放弃右侧信息"或"放弃 cache"两个选项——可以引入辅助通路专门提供结构性无法触及的信息。R2LM 的 R2L 边车就是这条路。这条思路可以推广到:speculative decoding 的 draft 模型(也用 KV cache)、多模态对齐(视觉 patch 用 sidecar 走)、agent 工具调用历史压缩(用 SSM 总结旧工具调用)等场景。

  2. 方向性 vs 参数量是范式之争。表 4 消融给出了论文级的清晰证据:185M 参数的 L2R Mamba 比 0 参数的因果 baseline 还差(374 > 178 PPL),但同样 185M 的 R2L Mamba 把 PPL 拉到 42。这条结论比 R2LM 本身更值得记住——当辅助通路承担"提供新信息"职责时,信息结构(方向/位置/粒度)比参数容量重要一个量级。这对所有 sidecar / adapter / LoRA 工作都有方法论意义:先问"我这条边提供的信息和主路是否冗余",再问"我这条边的容量够不够"。

  3. "bit-identical at init"是架构修改的金标准。R2LM 的 $\tanh(s)$ 门控 + 零初始化让模型在 step 0 与纯 causal baseline 比特相同,这意味着:(a) 任何预训练 checkpoint 都可以"无痛"升级到 R2LM(用 R2LM-PI 模式);(b) 论文可以严格地报告"边车贡献 = 完整模型 - 纯 baseline",而不是被初始化分布混淆。任何架构修改工作都应该先问:能不能做到 init-bit-identical?做不到的话,至少要在 init 时与 baseline 的 forward 输出 KL 距离 < 某阈值。

  4. "反事实消融"是机制论证的硬通货。R2LM 用了"MLP Adapter / L2R Mamba / R2L Mamba"三个等参变体来反证"多参数无用 + 同方向冗余 + 反方向才能提供新信息"三层假说。这是所有 ablation 工作的范本——每加一个变体都该问"它在反驳哪个 confounder"。这条经验可以直接复用。

  5. dLLM 的真正瓶颈不是质量,是 batch serving 下的 KV cache 兼容性。论文 12.9× 吞吐差距不是来自模型本身,而是来自每个去噪步都能复用 prefix KV这个属性。这意味着 dLLM 研究的下一个高地是"怎么让更多 dLLM 范式支持 batch 饱和下的 cache 复用"。Bifocal 是这条路的一个解法,块扩散(BD3-LM)是另一条解法,但都不是终局——也许下一个突破来自"在去噪步之间变化 mask pattern 同时维护 cache 有效性"。

  6. R2LM-PI 是最被低估的结果。在冻结 1.7B backbone + 仅训练 185M R2L 参数 + 5B tokens(1/12 数据)的极限压缩下,R2LM-PI 拿到 47.76% ALL avg——4 个模型中最高,比 joint R2LM 47.71% 还高 0.05pp。这暗示:(a) 已有的 Qwen3-1.7B-Causal-dLLM checkpoint 可以无需联合重训获得 R2L 增益;(b) 训练成本可压到 1/12,R2LM-PI 是一个"接近零成本"的升级路径这意味着任何 dLLM 团队都应该先实现 PI 模式再考虑 joint 模式


自检结果

  • 章节数:8(严格遵守模板)
  • 公式数:5(eq 1-5,含 MDLM forward/loss、info gap、log-posterior 分解、KL-MI 等式)
  • 表格数:4(主结果表 2、吞吐量表 3、消融表 4、横向对比表 1)
  • 图片数:3(group1-1, bifocal-1, fig1_efficiency-1)
  • 横向对比方法数:5(LLaDA, BD3-LM, WeDLM, Jamba + ReFusion 间接对比)
  • 局限性条数:6(每条均含问题陈述 + 证据引用 + 影响范围)