本期内容速览:
1.面向视觉-语言推理的分解式在线蒸馏:通过梯度引导实现视觉定位(ICML 2026 Spotlight)
2.从文字到世界:大语言模型能否成为隐式的文本世界模型?(ACL 2026 Oral)
3.InfiniteWeb:可扩展的网页训练环境合成
4.迈向高效的大语言模型退火训练:基于原则性样本选择的方法(ICML 2026 Spotlight)
5.通往在线监督微调(On-Policy SFT):分布判别理论及其在大语言模型训练中的应用
1.面向视觉-语言推理的分解式在线蒸馏:通过梯度引导实现视觉定位(ICML 2026 Spotlight)

论文链接:https://arxiv.org/abs/2606.00564 (opens in new tab)
多模态大语言模型在利用策略蒸馏进行推理训练时,往往受限于单一的单片式目标函数。这种方法未能充分考虑多模态任务中语言建模与视觉感知之间的内在张力,导致模型在处理需深入理解图像的复杂推理任务时,其视觉接地能力(visual grounding)常成为性能提升的主要瓶颈。
为解决这一难题,研究员们通过数学分解损失函数,揭示了语言先验与视觉接地目标在几何空间上近乎正交的特性。常规的单片式蒸馏被动平衡两者,未能有效强制模型增强感知保真度。对此,研究员们提出一种视觉梯度引导方法VGS(Visual Gradient Steering)。该方法引入辅助视觉目标,通过动态重定向优化轨迹,显式优先处理视觉子空间,并结合语言保持正则化器,在强化视觉接地的同时,防止了对原有语言推理能力的负面影响。

实验表明,VGS显著提升了学生模型在多项复杂多模态推理基准测试中的表现,不仅在纯蒸馏设置下效果优越,还可作为一种有效的正则化手段融入强化学习微调流程,在保持模型推理链连贯性的基础上,显著增强了感知准确度。
2.从文字到世界:大语言模型能否成为隐式的文本世界模型?(ACL 2026 Oral)

论文链接:https://arxiv.org/abs/2512.18832 (opens in new tab)
智能体学习高度依赖交互经验,但真实环境交互成本高昂、覆盖有限且推理阶段动作不可逆,严重制约了智能体的规模化训练与可靠决策。世界模型有望缓解这些瓶颈,但大语言模型能否作为可靠的世界模型并为下游智能体带来实质收益,尚缺乏系统性评估。
对此,研究员们提出了一个由保真度与一致性、可扩展性与鲁棒性以及智能体效能组成的三层评估框架。该框架聚焦文本环境,将其作为连接语言建模与世界建模的受控统一接口,并将目标从单纯的下一词预测,重构为交互协议下的下一状态预测。

通过在五种代表性文本环境中对该框架的评估,研究员们发现:首先,经过充分训练的模型能够捕捉环境的内隐动态,并在结构化设置中表现出高度的保真度,而监督微调对实现高保真建模至关重要。其次,世界模型性能随数据量、模型参数规模及环境复杂度的增加系统性地扩展,展现出良好的可扩展性。最后,高质量的世界模型能为下游智能体带来明确提升,例如,在WebShop环境中,行动验证使GPT-4o的性能提高了5.5%,而在SciWorld环境中,采用热启动强化学习实现了约15%的增益。这证实了将语言模型作为文本环境世界模型的潜力,同时明确了其在数据合成、模型内推理及可靠决策制定方面的应用价值,为推动智能体学习从文本领域向更广泛的场景演进奠定了实证基础。
3.InfiniteWeb:可扩展的网页训练环境合成

论文链接:https://arxiv.org/abs/2601.04126 (opens in new tab)
GUI智能体在代表用户与图形界面交互方面展现出了巨大的潜力,也是构建实用AI助手的重要方向。然而,训练这些智能体缺乏能够支持大规模训练的合适环境。尽管已有一些基准测试提供了宝贵的测试平台,但它们使用的真实网站由于多样性单一、网站限流、任务不可撤销等等问题,难以作为训练环境进行稳定的强化学习。
为此,研究员们推出InfiniteWeb系统,能够大规模自动生成适用于GUI智能体训练的功能性网页虚拟环境。该系统以网站种子描述和参考设计图为输入,通过统一接口规范,由任务推导共享数据模型与API,确保跨页数据的一致性。
在功能层面,系统采用任务驱动测试开发模式,迭代修正任务相关的业务逻辑以保证功能正确性。视觉上,系统结合从真实网页截图中提取的视觉特征引导前端生成,维持页面风格的多样性。此外,系统还能自动产生带有代码插桩的可验证任务评测器,输出稠密奖励信号供智能体训练使用。

实验结果表明,InfiniteWeb系统在构建真实网页环境方面超越了主流的商用代码智能体。以此合成环境训练的GUI智能体,在OSWorld、Online-Mind2Web和MobileWorld上分别提升6.9%、5.7%和3.9%。这证明合成环境具备较高真实性与跨平台迁移价值,为大规模GUI智能体训练提供了可扩展的环境合成方案。
4.迈向高效的大语言模型退火训练:基于原则性样本选择的方法(ICML 2026 Spotlight)

论文链接:https://arxiv.org/abs/2605.31175 (opens in new tab)
大语言模型预训练的退火阶段是模型最终收敛并确立质量的关键时期,然而如何在该阶段有效选择训练数据仍是一大挑战。常规策略通常依赖于领域过滤或上下文扩展等经验启发式方法,缺乏基于优化理论的原则性依据。针对这一问题,研究员们通过损失地形的谱几何视角来刻画退火阶段,指出优化收敛要求梯度更新满足不同特征方向上的异构约束。
为实现这一目标,研究员们提出了DiReCT框架,将退火阶段的样本选择重新表述为一个约束优化问题。该框架基于黑塞矩阵的谱特性,对每个样本的梯度施加明确的方向约束,从而可识别出符合最优曲率感知下降路径的样本。
考虑到高效实现,DiReCT利用随机投影技术近似高维梯度,显著降低了计算开销。整套数据调度流程仅需在训练前对数据集做一次推理,即可完成预计算。此外,借助连续松弛和逐次凸近似(SCA)求解器,该方法有效解决了非凸对齐约束下的组合优化难题。

实验表明,DiReCT在各种模型规模下均能一致达到业界领先的性能。其核心优势在于能够主动选择那些在平坦子空间内放大下降信号,同时抑制尖锐方向上噪声的样本,从而在导航几何瓶颈时保持稳定收敛。
理论分析进一步通过PAC-Bayes边界证明了这种基于平坦方向选择的更新能够收缩轨迹曲率,改善模型的泛化能力。同时数据分析揭示,算法倾向于选择那些具有更高预训练损失且序列长度较长的样本:这类样本能提供充足梯度能量,推动优化沿平坦损失曲面持续加速收敛。这些结果证实,相比于单纯追求信息密度的经验方法,优先确保更新方向对齐,对于提升大模型潜能更为重要。
5.通往在线监督微调:分布判别理论及其在大语言模型训练中的应用

论文链接:https://arxiv.org/abs/2602.12222 (opens in new tab)
在大语言模型训练的后期阶段,监督微调因其计算高效而广受青睐,但相较于强化学习,其泛化能力通常稍逊一筹。这种差距主要源于强化学习采用了策略内数据,能够更好地保留模型原有的分布特征并缓解灾难性遗忘,而标准监督微调则倾向于强制模型平等地拟合所有外部数据,导致模型在处理分布差异较大的数据时,其预训练的知识结构会受到损害。
为了弥合这一差距,研究员们提出了分布判别理论DDT,通过信号检测理论提供了一种线性阈值的决策视角,并确定了中心化对数似然(CLL)作为衡量分布判别最优的标准。在序列生成场景下,通过构建CLL统计量化生成序列与模型分布的对齐情况。

基于上述理论,研究员们开发了两种互补的应用技术:一是分布内微调(IDFT),在损失函数层面,通过自适应调节机制赋予模型内部分布中置信度更高的样本更高的权重,从而在训练过程中保护模型结构,避免过拟合分布之外的噪声或极端样本;二是提示解码(Hinted Decoding),在数据层面,通过在解码过程中动态地将训练语料重新对齐至模型的自身分布,生成与模型能力更匹配的训练样本。
在多个前沿大语言模型及数据集上的广泛实验结果表明,上述框架在保持监督微调高效性的前提下,不仅能够有效缓解灾难性遗忘,还在泛化性能上超过了常用的离线强化学习算法,如DPO和SimPO。这种方法为在强化学习实施难度较大的领域,提供了一种具备极高实用价值和数据效率的替代方案。