一、文章主要内容总结该研究聚焦扩散大型语言模型(dLLMs)的强化学习(RL)优化,核心围绕“去噪轨迹中推理过程的非均匀性”展开分析与方法创新:核心问题指出:现有dLLM的轨迹型RL方法普遍采用均匀子采样策略,假设所有去噪步骤同等重要,但这一假设存在缺陷——推理过程中仅少数“关键节点”决定最终成败,均匀分配梯度预算会浪费计算资源在无意义步骤上,导致训练不稳定、推理精度不足。轨迹动态分析:通过熵基不确定性、置信度边际(CM)不确定性、熵变化率(RoEC)三种指标,首次系统分析dLLM去噪轨迹,发现轨迹中存在“困惑区”(zones of confusion):即不确定性骤增、信念突变的短暂阶段,且这些区域的位置会随训练进程和任务类型动态变化,与最终推理结果强相关。方法提出:基于上述分析,提出自适应轨迹策略优化(ATPO)框架,核心是用“RoEC+CM混合规则”替代均匀子采样,动态将梯度预算分配给高杠杆步骤(困惑区),且不改变原有RL目标、奖励函数和计算预算。实验验证:在GSM8K、Math500、数独、Countdown等推理基准测试中,ATPO与diffu-GRPO、GDPO、d2等方法相比,在不同生成长度下均实现推理精度提升,同时显著增强训练稳定性;消融实验证明RoEC与CM的混合策略优于单一指标策略。二、文章创新点打破均匀性假设:首次从理论和实证层面否定“