Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation
arXiv ID: 2606.27732 | 日期: 2026-06-30 | 重新解读: ✅ 机构: Meta AI + University of North Carolina at Chapel Hill | 模型规模: Qwen3-1.7B | 训练规模: 60B tokens

Bifocal Diffusion 概念图:非对称双向上下文用于并行生成。
1. 一句话定位
dLLM 推理效率方向,提出 Bifocal dLLM 范式(因果注意力 + 反向 Mamba 边车提供压缩的右侧上下文),在 7 个多选 benchmark 平均分上 同时超过纯因果 dLLM(+3.11pp)和双向 dLLM(+0.97pp),并在 batch serving 场景下实现 2.4×-12.9× 吞吐量。
2. TL;DR
- 根本矛盾:dLLM 要么用双向注意力拿到完整上下文(质量好但每次去噪重算,无法 KV cache),要么用因果注意力(支持 KV cache,但每个 masked 位置丢掉所有右侧 token)。本文称之为"architectural dilemma"。
- 核心 idea:asymmetric bidirectional context(不对称双向上下文)。左右两侧用不同机制:左侧走因果 Transformer(拿精确左上下文 + 完整 KV cache),右侧走反向 Mamba SSM(拿压缩右上下文,不消费 causal-attention 的 KV)。
- 实例化 R2LM(Right-to-Left Mamba):在 Qwen3-1.7B 的 28 层 decoder 中,每 4 层挂一个 ReverseMambaLayer hook(共 7 个),门控 $s$ 初始化为 0,使模型在 step 0 与纯因果 baseline bit-identical。
- 三种训练模式:joint(CPT 60B tokens)、plug-in R2LM-PI(冻结因果 backbone,仅训练 5B tokens 的 R2L 边车)、以及在 §5.3 中用 1B tokens 做的方向性消融。
- 核心数字:吞吐量 vs bidir 2.4×-12.9×、vs AR 1.9×-2.9×;平均准确率 47.71%(causal 44.60%、bidir 46.74%);R2LM-PI 在仅 1/12 数据、1/10 训练参数下达到 47.76% ALL avg(4 个模型中最高)。
3. 问题与动机
3.1 痛点场景
dLLM 之所以吸引人,是因为它能在 T ≪ N 步内并行生成 N 个 token,论文与实证显示比优化过的 AR 引擎快 3-8×。但当 serving 系统处于 batch 饱和状态(B=8, prompt P=4096)时,双向 dLLM 的吞吐量会塌方到 53 tok/s,而 R2LM 仍能保持 683 tok/s——12.9× 的差距。这就是论文瞄准的 workload:长 prompt + 高 batch 的并行 decoding 场景。
3.2 现有方法为什么不够(具体到方法名 + 缺陷)
| 范式 | 代表 | 核心缺陷 |
|---|---|---|
| 双向 dLLM | LLaDA, Dream | KV 不再可缓存,每步重算 O(B(P+G)²),长 prompt 下吞吐塌方 |
| 因果 dLLM | WeDLM, CARD | 拓扑重排/掩码调度,但每个 masked 位置永远拿不到 j>i 的 token,质量低 |
| 块 dLLM | BD3-LM, Fast-dLLM v2, SDLM | 块内双向、块间因果。右上下文被限制在单个 32-128 token 块内(§2 第三段) |
| 混合 AR-Diffusion | ReFusion, TiDAR, e-Solms | 双模式或 slot 置换,架构复杂,且右上下文获取不连续 |
引用(§1 倒数第二段):"causal attention restricts each position to left-only context, and no amount of inference optimization can recover the missing right-side information."
3.3 本文的核心 insight
右上下文不一定要走注意力。如果让一个反向 SSM 单独承担"提供右上下文"的责任,causal attention 就可以保持纯因果,从而 KV cache 完全有效。
这一招的关键是不对称(asymmetric):左右不是同一种机制的"对偶",而是两种不同机制的组合。这是与 Jamba 等同方向 SSM+Attention 混合架构的本质区别(Jamba 是 L2R + L2R,SSM 只提供容量;R2LM 是 L2R + R2L,SSM 提供 causal attention 结构性无法触及的信息)。

***图 1(左图,§1)**:架构对比 + 质量/吞吐量散点。左:双向(满注意力、无 KV cache)vs 因果(有 KV cache、无右上下文)vs Bifocal(causal + R2L 边车)。右:在 H100 P=4096, B=8 配置下,R2LM 位于右上区域(高质量 + 高吞吐)。*
4. 方法详解
4.1 架构总览
R2LM 是一种非修改的因果 Transformer backbone + 反向 Mamba 残余流的混合架构。R2L 流被作为 forward hook 挂载在每 $k$ 个 decoder 层之后,产生的 $\tanh(s)$ 门控残差直接加回 hidden state。门控 $s$ 初始化为 0 → 训练 step 0 时整个模型与纯因果 baseline 比特相同。注意力层本身完全不动,因此 prefix KV cache 的有效性不被打断。
4.2 形式化定义
4.2.1 MDLM 前向过程与损失
$$q(z_t^i = m \mid x_i) = \alpha_t \cdot \mathbf{1}[m = x_i] + (1 - \alpha_t) \cdot \mathbf{1}[m = \texttt{[MASK]}],\quad \alpha_t = 1 - t \tag{1}$$ $$\mathcal{L}(\theta) = \mathbb{E}_{t, \mathbf{x}, \mathbf{z}_t}\!\left[\, w(t) \sum_{i \in \mathcal{M}_t} -\log p_\theta(x_i \mid \mathbf{z}_t) \,\right],\quad w(t) = \frac{1 - \alpha_t}{1 - \alpha_t} = \frac{1}{1 - t} \tag{2}$$(论文 §3.1 eq 1-2)
4.2.2 右侧上下文信息间隙(信息论下界)
$$\Delta_i^t \;=\; H(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i}) - H(x_i \mid \mathbf{x}_{\mathcal{O}_t}) \;=\; I\!\left(x_i;\, \mathbf{x}_{\mathcal{O}_t}^{>i} \,\middle|\, \mathbf{x}_{\mathcal{O}_t}^{\leq i}\right) \;\geq\; 0 \tag{3}$$(论文 eq 3)。这是一个干净的信息论表述:因果与双向 dLLM 的质量差,本质上等于目标 token 在已知左上下文条件下、还能从右侧观察 token 拿到的条件互信息。mask rate $\gamma$ 下,位置 $i$ 的右观察数量期望为 $(1-\gamma)(L-i)$,所以 $\Delta_i^t$ 在序列左侧最大、右侧为 0。
4.2.3 对数后验加性分解(Proposition 1)
$$\log p(x_i \mid \mathbf{x}_{\mathcal{O}_t}) = \underbrace{\log p(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i})}_{\text{left-context term}} + \underbrace{\log \frac{p(x_i \mid \mathbf{x}_{\mathcal{O}_t})}{p(x_i \mid \mathbf{x}_{\mathcal{O}_t}^{\leq i})}}_{\Delta_i^{\text{R2L}}:\;\text{right-context correction}} \tag{4}$$ $$\mathbb{E}_{(x_i, \mathbf{x}_{\mathcal{O}_t})}\!\left[\Delta_i^{\text{R2L}}\right] = I\!\left(x_i;\, \mathbf{x}_{\mathcal{O}_t}^{>i} \,\middle|\, \mathbf{x}_{\mathcal{O}_t}^{\leq i}\right) \tag{5}$$(论文 eq 4-5)。这是整个方法的理论骨架。它直接给出三条架构要求(§3.3 列表):
- 保留因果通路(拿左上下文项 + 维护 prefix KV cache);
- 加一个由 $j > i$ token 驱动的残差信号去近似 $\Delta_i^{\text{R2L}}$;
- 残差从 0 开始(bit-identical at init)。
注意:LayerNorm 和 softmax 在 logit 层面会破坏严格加性,论文也承认这一点(§3.3 末段)——因此 eq 4 是归纳偏置而不是严格等式。
4.2.4 R2L 流的四步操作(§3.5)
设 hook 层输出 $\mathbf{h} \in \mathbb{R}^{B \times L \times d}$:
- 序列翻转:$\mathbf{h}_{\text{flip}} = \mathrm{flip}(\mathbf{h}, \mathrm{dim}{=}1)$ —— 把右 token 暴露给 L→R scan。没这一步,SSM 总结的就是左上下文(causal backbone 已经有了),没有新信息。
- Mamba selective scan:$\mathbf{h}_{\text{mamba}} = \mathrm{Mamba}(\mathbf{h}_{\text{flip}})$ —— 选 Mamba-1 而非 reverse attention/RNN/linear attention,因为 SSM 用线性时间聚合"位置感知的"前缀摘要,且不消费 causal attention 的 KV。
- 反翻转 + LayerNorm:$\mathbf{h}_{\text{R2L}} = \mathrm{LN}(\mathrm{flip}(\mathbf{h}_{\text{mamba}}, \mathrm{dim}{=}1))$ —— LN 限制残差量级。
- 门控残差:$\mathbf{h}^{+} = \mathbf{h} + \mathbf{h}_{\text{R2L}} \cdot \tanh(s)$,标量 $s$ 初始化为 0。tanh 饱和到 $|\cdot| \le 1$,对齐 LayerScale/ControlNet 的稳定做法。
4.3 为什么是 Mamba 不是其他?
作者明确比较了 4 个候选:reverse self-attention、reverse RNN、linear attention、Mamba。决定性论据:SSM scan 不消费 causal-attention 的 KV cache。reverse self-attention 会重新算 full attention(比双向 dLLM 还慢);reverse RNN 表达力不足;linear attention 在 $d=2048$ 下不够稳。Mamba 是唯一同时满足"位置感知 + 线性时间 + 不破 cache"三约束的选择。
4.4 关键超参
| 超参 | 取值 | 选取原因 |
|---|---|---|
| Hook 间隔 $k$ | 4 | Qwen3-1.7B 有 28 层 → $H=7$ 个 hook。论文未给消融,选 $k=4$ 似乎是经验值。 |
| Mamba $d_{\text{state}}$ | 16 | 标准 Mamba 配置 |
| Mamba $d_{\text{conv}}$ | 4 | 标准 |
| Mamba expand | 2 | 标准 |
| 门控初始化 | $s=0$bit-identical at init(关键性质) | |
| Hook 数量 | 7 | $28 / 4 = 7$|
| 训练总 tokens | 60B | joint CPT 预算 |
| 优化器 | AdamW | lr $1\!\times\!10^{-4}$(joint),$5\!\times\!10^{-4}$(PI) |
| Warmup | 500 步 (joint) / 100 步 (PI) | 线性 warmup + cosine decay |
| Weight decay | 0.01 | 标准 |
| Sequence length | 4096 | 与 longest $P$ 吞吐测试对齐 |
| 精度 | bf16 + grad checkpoint | 32×H100 4×8 FSDP |
| 评估 sampler | CausalMDLMSampler / MDLMSampler | mc_num=32, batch=8, max_len=4096 |
| 去噪步数 $T$ | 32 | 论文级标准 |
4.5 训练开销
- 算力:32 张 H100,全分片 FSDP,4×8 拓扑。
- 训练数据:HuggingFaceFW/fineweb-edu,seed 42 → 三个 run 看到完全相同的 batch(排除数据扰动)。
- 训练量:60B tokens(joint);5B tokens(R2LM-PI plug-in,1/12 数据量)。
- 额外参数:R2L 边车 ~185M(~10.8% backbone 大小)。

***图 2(§3.5, fig:architecture)**:R2LM 架构细节。左侧是 causal Transformer(保留 KV cache);右侧是去噪循环中从生成 block 跑 R2L scan(独立于 prompt KV cache),每 4 层挂一个 ReverseMambaLayer hook。*
5. 实验结果
5.1 主结果表
表 2:7 个多选 benchmark 准确率(60B-token CPT from Qwen3-1.7B,单位 %)
| Model | ARC-C 25sh | HellaSwag 3sh | PIQA 0sh | WG 5sh | OBQA 0sh | BoolQ 0sh | MMLU 5sh | Long avg | Short avg | ALL |
|---|---|---|---|---|---|---|---|---|---|---|
| Bidir dLLM | 45.30 | 43.40 | 61.50 | 57.70 | 16.00 | 68.40 | 34.90 | 44.78 | 51.65 | 46.74 |
| Causal dLLM | 38.70 | 35.70 | 63.80 | 54.30 | 27.00 | 65.30 | 27.40 | 43.90 | 46.35 | 44.60 |
| R2LM | 39.40 | 43.00 | 67.20 | 60.20 | 27.40 | 67.00 | 29.80 | 47.44 | 48.40 | 47.71 |
| R2LM-PI | 40.90 | 39.50 | 64.60 | 59.40 | 25.60 | 67.30 | 37.00 | 46.00 | 52.15 | 47.76 |
简化排版(省略 $\Delta$ 标注),完整表见原论文 §4.2 tab:main。Long = 5 个多 token 候选任务平均,Short = BoolQ + MMLU(单 token)平均,ALL = 7 个平均。
5.2 核心发现(带数字 + 表格引用)
- ALL 平均上 R2LM 超过两个端点(表 2 第 4 行):47.71% > bidir 46.74% (+0.97pp) > causal 44.60% (+3.11pp)。R2LM-PI 47.76% 进一步领先(表 2 第 5 行)。
- 长目标任务的右上下文红利最大(§4.2 末段 + 表 2 Long 列):R2LM 47.44% vs causal 43.90%(+3.54pp)、vs bidir 44.78%(+2.66pp)。这与 eq 3 的预测一致——右上下文信息间隙在长候选任务上最大。
- R2LM-PI 用 1/12 数据、1/10 训练参数追平/超过 joint R2LM(§4.2 倒数第二段):在 MMLU 上 R2LM-PI 37.00% > R2LM 29.80% > bidir 34.90%。这暗示 R2L 通路可以解耦地迁移到已训练好的 MDLM backbone。
- 不是 MMLU 的过拟合(表 2):R2LM 在 5 个长目标任务的 3 个上超 bidir,1 个平手,1 个落败(ARC-C -5.9pp)。这是诚实的 4-of-5 胜率,不是单 benchmark 神话。
5.3 吞吐量主表
表 3:单 H100-80GB 吞吐量(tok/s),$T=32$ 步,$G=128$ 生成 token
| Model | B=1, P=512 | B=1, P=1024 | B=1, P=2048 | B=1, P=4096 | B=8, P=512 | B=8, P=1024 | B=8, P=2048 | B=8, P=4096 |
|---|---|---|---|---|---|---|---|---|
| Qwen3-1.7B (AR) | 45.4 | 45.7 | 45.6 | 45.0 | 404 | 397 | 383 | 362 |
| Causal dLLM | 170.9 | 171.9 | 166.6 | 163.4 | 1356 | 1295 | 1050 | 732 |
| Bidir dLLM | 246.2 | 187.0 | 106.0 | 50.9 | 483 | 260 | 124 | 53 |
| R2LM | 147.1 | 146.2 | 144.5 | 139.7 | 1154 | 1089 | 956 | 683 |
| R2LM vs Bidir (B=8) | — | — | — | — | 2.39× | 4.19× | 7.71× | 12.9× |
| R2LM vs AR (B=8) | — | — | — | — | 2.86× | 2.74× | 2.50× | 1.89× |
关键观察:bidir 吞吐随 P 增大单调塌方(483 → 53 tok/s),R2LM 几乎平稳(1154 → 683 tok/s)。差距在 P=4096 处达到 12.9×。
5.4 消融:方向性是核心,不是参数量
表 4:1B tokens 联合训练机制消融
| Variant | Extra params | Train loss $\downarrow$ | WikiText-103 PPL $\downarrow$ |
|---|---|---|---|
| Causal dLLM (baseline) | 0 | 4.66 | 178 |
| + MLP Adapter (no direction) | 185M | 4.63 | 356 |
| + L2R Mamba (original direction) | 185M | 4.84 | 374 |
| + R2L Mamba (R2LM) | 185M | 3.18 | 42 |
| Bidirectional dLLM | 0 | 3.02 | 30 |
这是论文最有说服力的实验。三个变体都用 185M 额外参数,但:
- MLP Adapter(无方向性):PPL 翻倍到 356——多参数反而有害。
- L2R Mamba(错方向):PPL 374,比 baseline 还差——wrong direction is actively harmful(§4.3 原文)。
- R2L Mamba:PPL 42,接近 bidir 的 30——同参数量下,方向对了才能 4.2× 提升 PPL。
这条消融直接否定了"参数红利"的解释,确立了"右上下文方向性"才是 R2LM 的根本。
5.5 内存与吞吐退化(fig:efficiency)
- B=1 时内存:R2LM 12.7 GB(@P=16384) vs bidir 18.5 GB → 节省 5.9 GB(32%)。
- 吞吐保留:R2LM 在 P=4096 / B=8 处保留 59% 的 P=512 吞吐(683/1154),而 bidir 只保留 11%(53/483)。
- R2LM 内存与因果 dLLM 几乎重合(差 0.4 GB 以内),证明 R2L 边的内存成本与它的"边车"地位相符。
5.6 对比方法清单
- 基类(两端点):Bidirectional dLLM = LLaDA / Dream / DiffuLLaMA 风格的 full attention;Causal dLLM = WeDLM / CARD 风格的 strict causal。
- 同类 SOTA(块/混合):BD3-LM(arriola2025)、SDAR、Fast-dLLM v2、ReFusion、TiDAR、e-Solms。
- SSM 家族:Mamba(基座)、Jamba(同方向 SSM+Attention 混合,对照组)。
- 本文:Bifocal dLLM (R2LM + R2LM-PI),attn pattern = Causal + $\underline{X}$,$\underline{X}$ = R2L Mamba。

***图 3(§4.3, fig:efficiency)**:推理效率全景。(a,b) 吞吐 vs prompt 长度 $P$ @ B=8 与 B=1;(c) 吞吐 vs batch $B$ @ P=512;(d) 相对 bidir 的 speedup;(e,f) 内存与内存节省;(g,h) 吞吐保留与内存增长曲线。*
6. 横向对比
R2LM 不是孤立的"右上下文边车"工作,必须放在 dLLM 范式 + SSM 混合架构两条轴上同时比较。
| 维度 | R2LM (本文) | LLaDA (双向) | BD3-LM (块扩散) | WeDLM (因果) | Jamba (同向 SSM+Attn) |
|---|---|---|---|---|---|
| 注意力模式 | Causal + R2L hook | Full bidirectional | Block-causal + intra-block bidir | Strict causal | L2R Attention + L2R Mamba |
| 右上下文来源 | 反向 Mamba SSM | 全注意力 | 块内注意力 | 无 | L2R Mamba(冗余于 Attn) |
| 右上下文范围 | 整序列(连续) | 整序列(精确) | 单块 32-128 token | 0 token | 整序列(无新信息) |
| KV cache 有效性 | 完整 | 失效 | 块级(部分) | 完整 | 完整 |
| 训练数据 | 60B tokens | 2.3T+ | ~数百 B | ~数十 B | 数 T |
| 训练成本(参照) | 32×H100 | 大规模 | 中规模 | 中规模 | 大规模 |
| 单请求吞吐 (B=1, P=4096) | 139.7 tok/s | 50.9 tok/s(慢 2.7×) | — | 163.4 tok/s(快 17%) | — |
| Batch 吞吐 (B=8, P=4096) | 683 tok/s | 53 tok/s(慢 12.9×) | — | 732 tok/s(快 7%) | — |
| 7 benchmark ALL avg | 47.71% (R2LM) / 47.76% (R2LM-PI) | 46.74% | — | 44.60% (causal) | — |
| Long avg | 47.44% | 44.78% | — | 43.90% | — |
| 推理实现复杂度 | 中(hook 注入) | 低(标准 Transformer) | 中(块调度) | 低(标准 causal) | 高(双层交替) |
| 架构创新点 | 非对称双向;R2L SSM 作为右上下文专用通路 | 严格双向 dLLM 范式 | 块粒度双向 | 拓扑重排 + 掩码调度 | 同向 SSM+Attn 容量混合 |
关键数据均来自本论文 §4.2 tab:main 与 §4.3 tab:speed;Jamba 数据非本文直接报告,仅作架构对比。
定位总结
R2LM 在 LLaDA / BD3-LM / WeDLM / ReFusion 主导的赛道里,处于"换了右侧信息通路,但保留左侧 cache 范式"的破局者位置:
- 相比 LLaDA(双向 dLLM SOTA),R2LM 放弃了精确右注意力换取 12.9× 吞吐,并通过 R2L SSM 的压缩右上下文把 ALL avg 做得更高(47.71% > 46.74%)。这是"质量/效率 Pareto 前沿上的右上推进"。
- 相比 BD3-LM(块扩散),R2LM 的右上下文是整序列连续的(块扩散限制在 32-128 token),cache 粒度也更细。
- 相比 WeDLM(因果),R2LM 在 ALL avg 上 +3.11pp,在长目标上 +3.54pp,代价是 B=1 时 7-16% 的 R2L 开销。
- 相比 Jamba(同向 SSM+Attn),R2LM 走的是反向 SSM,真正提供新信息而非仅提供容量。这是范式级的差别。
- 与 ReFusion / TiDAR 等混合 AR-Diffusion 相比,R2LM 的架构修改量小得多(仅加 hook),不引入双模式切换的工程复杂度。
7. 批判性局限性
7.1 训练预算偏低,难以支撑"dLLM 已经能匹敌 AR"的大结论
问题:1.7B 参数 + 60B tokens 的 CPT 预算远低于 AR/LLaDA 报告 SOTA 的规模(AR 通常 1T+ tokens、≥7B 参数)。论文承认"results may evolve at scale"(§6 Limitations 第 1 段),但没有给出 scaling trend——是 sublinear?是 sublinear with 拐点?
证据:表 2 R2LM 在 MMLU 5-shot 上仅 29.80%,远低于已公开的 AR 同规模模型(Qwen3-1.7B-Base 在 MMLU 上约 56-60%)。这不是论文本身的失败,但读者不能把 47.71% ALL avg 当作"dLLM 时代来临"的证据。
影响范围:所有 §4.2 质量结论都需要在 ≥7B 规模上复现才能定性。
7.2 ARC-C 任务上 R2LM 显著落后于 bidir,机制不明确
问题:表 2 第 1 列 ARC-C 25-shot 上,R2LM 39.40% vs bidir 45.30%(-5.9pp)。这是 5 个长目标任务中 R2LM 唯一明确落败的项目。ARC-C 是科学推理多选题,右上下文预期最有价值(实体定义→选项推理),但反向 Mamba 的压缩右上下文在此处反而伤害了性能。
证据:§4.2 第 3 段 "R2LM beats bidirectional on PIQA, WinoGrande, and OBQA, is roughly tied on HellaSwag, and trails bidirectional on ARC-C"——论文承认但没解释。
影响范围:削弱了"右上下文是无条件红利"的主张;R2LM 路径在需要精确右注意力的任务上仍有上限。eq 3 的"右上下文信息间隙"在 ARC-C 上的具体数值(mask rate 依赖)也未报告,读者无法判断是 SSM 容量不够还是方向性不够。
7.3 R2L 边车在 B=1 单请求场景下比纯因果 dLLM 慢 14-17%
问题:表 3 B=1 列上,R2LM 在 P=512 到 P=4096 全部慢于 Causal dLLM(147.1 vs 170.9 @P=512,139.7 vs 163.4 @P=4096)。这不是"持平"——R2L hook 的前向开销在没有 batch 摊销时变成纯成本。论文承认"R2L overhead versus the causal dLLM is 7 to 16%",但没解释为什么不在 B=1 时禁用 R2L 通路。
证据:§4.3 末段 + 表 3 B=1 列。
影响范围:否定了"R2LM 是因果 dLLM 的严格升级版"的解读——单请求场景下,因果 dLLM 仍然更优。论文应该明确给出一个"用 causal 还是 R2LM"的判定规则(按 batch size 切换?)。
7.4 R2L 仅在 1.7B / 28 层 Qwen3 上验证,hook 间隔 k=4 是经验值
问题:所有实验都在 Qwen3-1.7B(28 层)上做,$k=4$ 给出 7 个 hook。论文没有给出 $k \in \{1, 2, 4, 8, 14, 28\}$ 的消融表。如果 $k=2$ 也能拿到类似增益,那 R2LM 的"边车"成本更低;如果 $k=8$ 性能显著下降,那 $k=4$ 是不是只是恰好在 1.7B 上的 lucky value?类似地,d_inner、d_state、expand 全部沿用 Mamba-1 默认值,没有 sweep。
证据:§4.1 Models 段说"$k=4$, $H=7$ hooks with $d_\text{state}=16, d_\text{conv}=4$, expand 2"——所有数字都"default",但默认参数的鲁棒性在表 4 消融中未跨 $k$ 测试。
影响范围:在更大模型(≥7B)或更深架构(≥40 层)上,$k=4$ 是否仍然最优未经验证。可能存在"层数变了 hook 间隔也得变"的隐性约束。
7.5 表 4 消融的 1B tokens 训练量与主实验 60B 严重不匹配
问题:表 4(机制消融)只用 1B tokens CPT,但表 2(主结果)用 60B tokens。这意味着"MLP Adapter / L2R Mamba 也用 60B tokens 时可能追平 R2LM"的可能性未被排除——1B 训练量下三者都欠拟合,PPL 差异可能部分来自"训练量不够时方向性优势的纯化效果"。
证据:§4.3 段开头"To answer RQ3 we isolate the R2L mechanism with two parameter-matched controls trained jointly with the causal backbone on 1B tokens"——明确写了 1B。
影响范围:表 4 的"方向性才是关键"结论的强度取决于 1B 训练下三者都已接近收敛,但 178 → 356 的 PPL 翻倍在 1B 训练下未必能外推到 60B。需要在 10B+ tokens 上重复消融才能定性。
7.6 缺乏对"右上下文到底有多重要"的任务级独立证据
问题:论文把右上下文价值与"候选 token 长度"绑定(长候选 → 右上下文价值大),但没有给出控制候选长度的实验——比如同任务下比较 1-token vs N-token 候选的 R2LM 增益。在 ARC-C 上 R2LM 输给 bidir,是否因为 ARC-C 的多选答案虽然短但需要长程右侧推理(题目与选项之间的关系跨越多 token)?
证据:§4.2 末段"the value of right context grows with the amount of unmasked material to the right of each masked position"——这是论断,但没有给任务级的 per-token 增益曲线。
影响范围:读者无法判断 R2LM 的应用边界——哪些任务类型值得加 R2L 边车,哪些不值得。
8. 可复用启发 / 关键 takeaway
给"未来做 dLLM / SSM 混合 / KV cache 友好架构"的人:
"右信息不一定走注意力"是一个被严重低估的设计自由度。当架构约束是"必须保留某种 cache"时,不要假设只有"放弃右侧信息"或"放弃 cache"两个选项——可以引入辅助通路专门提供结构性无法触及的信息。R2LM 的 R2L 边车就是这条路。这条思路可以推广到:speculative decoding 的 draft 模型(也用 KV cache)、多模态对齐(视觉 patch 用 sidecar 走)、agent 工具调用历史压缩(用 SSM 总结旧工具调用)等场景。
方向性 vs 参数量是范式之争。表 4 消融给出了论文级的清晰证据:185M 参数的 L2R Mamba 比 0 参数的因果 baseline 还差(374 > 178 PPL),但同样 185M 的 R2L Mamba 把 PPL 拉到 42。这条结论比 R2LM 本身更值得记住——当辅助通路承担"提供新信息"职责时,信息结构(方向/位置/粒度)比参数容量重要一个量级。这对所有 sidecar / adapter / LoRA 工作都有方法论意义:先问"我这条边提供的信息和主路是否冗余",再问"我这条边的容量够不够"。
"bit-identical at init"是架构修改的金标准。R2LM 的 $\tanh(s)$ 门控 + 零初始化让模型在 step 0 与纯 causal baseline 比特相同,这意味着:(a) 任何预训练 checkpoint 都可以"无痛"升级到 R2LM(用 R2LM-PI 模式);(b) 论文可以严格地报告"边车贡献 = 完整模型 - 纯 baseline",而不是被初始化分布混淆。任何架构修改工作都应该先问:能不能做到 init-bit-identical?做不到的话,至少要在 init 时与 baseline 的 forward 输出 KL 距离 < 某阈值。
"反事实消融"是机制论证的硬通货。R2LM 用了"MLP Adapter / L2R Mamba / R2L Mamba"三个等参变体来反证"多参数无用 + 同方向冗余 + 反方向才能提供新信息"三层假说。这是所有 ablation 工作的范本——每加一个变体都该问"它在反驳哪个 confounder"。这条经验可以直接复用。
dLLM 的真正瓶颈不是质量,是 batch serving 下的 KV cache 兼容性。论文 12.9× 吞吐差距不是来自模型本身,而是来自每个去噪步都能复用 prefix KV这个属性。这意味着 dLLM 研究的下一个高地是"怎么让更多 dLLM 范式支持 batch 饱和下的 cache 复用"。Bifocal 是这条路的一个解法,块扩散(BD3-LM)是另一条解法,但都不是终局——也许下一个突破来自"在去噪步之间变化 mask pattern 同时维护 cache 有效性"。
R2LM-PI 是最被低估的结果。在冻结 1.7B backbone + 仅训练 185M R2L 参数 + 5B tokens(1/12 数据)的极限压缩下,R2LM-PI 拿到 47.76% ALL avg——4 个模型中最高,比 joint R2LM 47.71% 还高 0.05pp。这暗示:(a) 已有的 Qwen3-1.7B-Causal-dLLM checkpoint 可以无需联合重训获得 R2L 增益;(b) 训练成本可压到 1/12,R2LM-PI 是一个"接近零成本"的升级路径。这意味着任何 dLLM 团队都应该先实现 PI 模式再考虑 joint 模式。
自检结果
- 章节数:8(严格遵守模板)
- 公式数:5(eq 1-5,含 MDLM forward/loss、info gap、log-posterior 分解、KL-MI 等式)
- 表格数:4(主结果表 2、吞吐量表 3、消融表 4、横向对比表 1)
- 图片数:3(group1-1, bifocal-1, fig1_efficiency-1)
- 横向对比方法数:5(LLaDA, BD3-LM, WeDLM, Jamba + ReFusion 间接对比)
- 局限性条数:6(每条均含问题陈述 + 证据引用 + 影响范围)