a tall building lit up at night

微软亚洲研究院

ICML 上新 | 五项视觉研究,让模型更持久、更轻量、更统一、更聚焦

公開済み

本期内容速览:

1.让虚拟世界告别遗忘:构建具有持久三维记忆的世界模型

2.CoD-Lite:基于扩散模型的实时生成式图像压缩

3.一个向量,装下整段视频:视觉生成模型里的隐式记忆表征

4.基于下一词元扩散的多模态隐式语言建模

5.ViTL:融合交错式推理的长视频问答

1.让虚拟世界告别遗忘:构建具有持久三维记忆的世界模型

title,image

论文链接:https://arxiv.org/abs/2603.03482 (opens in new tab)

现有的交互式世界模型常缺乏对环境的三维表示,只能从数据中隐式地学习三维一致性。而它们的空间记忆受限于有限的时间上下文窗口,所以在进行长程推演时容易丢失空间信息,导致一边生成一边遗忘,难以适配沉浸式交互和智能体训练等任务。  

针对这一瓶颈,研究员们提出了PERSIST框架,通过隐空间中的三维环境帧(world-frame)显式建模环境随时间演化的状态。具体而言,模型维护并预测一个三维环境帧,用于保存持久的空间记忆;同时预测相机状态,并根据当前视角将三维环境帧中的信息投影到可观测的二维屏幕空间;最后,利用一个world-to-pixel(世界状态到像素画面)生成模块,根据投影后的三维环境特征、动作以及二维图像特征合成当前视频帧。

在训练阶段,PERSIST 使用2D-VAE 和 3D-VAE 分别编码视频帧和三维环境帧,其中环境帧预测器和world-to-pixel 生成器均采用 Rectified Flow 框架,相机模型则通过因果Transformer 预测位置、朝向和视场变化。为缓解自回归推理中的误差累积,模型进一步引入 Diffusion Forcing 和随机噪声增强,使各个模块在训练时能够适应推理阶段由其他模块生成的隐空间特征。

diagram
图1:以单个视频帧初始化后,PERSIST 会根据用户动作在自回归循环中持续迭代世界状态。模型首先预测智能体周围的三维环境帧,并用一个前馈Transformer 预测相机参数,随后根据预测的相机参数将三维世界投影到相机平面,得到一簇按深度排序的世界隐特征;最后,模型利用这些与像素对齐的三维信息,对像素隐特征进行去噪并合成下一视频帧。

在 Luanti 环境中的实验表明,PERSIST 在长程交互式生成中明显优于 Oasis、WorldMem 等基线方法:600 帧生成任务中,FVD 从 Oasis 的 875 降至148;用户评估中,三维空间一致性和时间稳定性也显著提升。定性结果显示,PERSIST 能在数千帧交互推演中保持场景结构连贯,并能建模视野外环境的持续变化。

2.CoD-Lite:基于扩散模型的实时生成式图像压缩

title,image

论文链接:https://arxiv.org/abs/2604.12525 (opens in new tab)

在高性能生成式压缩领域,深度学习模型通常依靠大幅扩充参数量来提升视觉重建效果。这会带来极高的推理延迟,很难满足各类实时落地场景。如何平衡模型规模与运行效率,设计轻量化扩散架构是当下亟待解决的问题。

为突破这一局限,研究员们开展了多组实验分析,通过对比不同参数量的扩散模型性能,验证了压缩导向扩散预训练的优势。在轻量化模型上,相比通用生成扩散预训练方案,压缩导向扩散预训练能生成信息密度更高的图像表征,可弥补小模型表征能力不足的缺陷。研究员们同时发现,图像压缩任务并不需要全局注意力,轻量化卷积网络搭配蒸馏学习,即可还原完整的精细纹理。

基于这些发现,研究员们构建了一个轻量级的一步式卷积扩散图像编解码器。该方法采用紧凑的卷积主干网络,通过压缩导向扩散预训练和统一的蒸馏与对抗训练框架,成功实现了在A100 GPU上1080p分辨率下60 FPS的编码速度与42 FPS的解码速度。同时,该方法在保持与MS-ILLM等GAN类编解码器相当的FID指标的同时,可节省85%比特率,在提供高质量视觉重建的同时满足了低延迟的实时需求,有效搭建了生成式压缩与实际部署场景之间的桥梁。

diagram
图2:生成式图像编解码器的发展主要依赖于扩大模型规模,这导致解码延迟显著增加。相比之下,CoD-Lite在感知质量与解码速度之间实现了更优的平衡:能够在A100 GPU上实现实时1080p解码,并同时达到接近当前最先进的FID值。解码器参数与解码时间如图所示。

3.一个向量,装下整段视频:视觉生成模型里的隐式记忆表征

title,image

论文链接:https://arxiv.org/abs/2603.07615 (opens in new tab)

现代视觉生成大模型经过海量数据训练,沉淀了丰富的图像、视频先验知识。但像素、隐变量、图像标记这类传统视觉表征都独立于生成模型,无法直接复用模型内置知识,很难实现超高压缩倍率下的高效存储与内容复用,传统编码方案在极低码率场景画质衰减严重。对此,研究员们提出了全新的隐式视觉表征框架。该方案不再单独编码画面像素,而是把视觉信号建模为生成函数,依靠冻结扩散模型配套LoRA参数完成表征建模。像81帧长视频这类复杂视觉内容,都能进一步哈希压缩为单个紧凑向量,在极低比特条件下依旧保持优秀的视觉重建效果。

diagram
图3:基于扩散生成模型的单向量视觉压缩(左)和生成(右)框架。

对比传统视频编码、生成式压缩基线的实验结果显示,这套隐式表征方案重建画质的优势明显。得益于函数化的表征设计,推理阶段可灵活拓展优化策略,通过推理时多路径采样细化还原细节,持续提升画面观感。另外,这种隐式表征可以作为视觉生成模型的记忆,使得生成相似内容时,可以充分保留记忆中的信息,例如动作、人物、背景等。该思路打通了视觉压缩与生成模型的边界,形成了统一的技术框架,为高效视觉存储、可控视觉记忆提供了全新的实现思路。

4.基于下一词元扩散的多模态隐式语言建模

text

论文链接:https://arxiv.org/abs/2412.08635 (opens in new tab)

多模态生成长期面临异构数据难以统一建模的问题。文本和代码通常表示为离散词元,而图像、音频、视频及机器人动作等模态则具有连续性,二者难以在同一框架下进行统一处理。现有方案大多是拼接独立模块而搭建的流水线框架,不仅难以完成端到端的联合优化,还可能在模块的交互过程中产生信息损耗。

为解决上述问题,研究员们提出了潜语言建模LatentLM。该框架采用因果Transformer作为共享主干,通过变分自编码器(VAE)将不同模态的连续数据压缩为潜向量,并引入下一词元扩散机制。对于连续模态,模型以Transformer的隐状态为条件,通过轻量级扩散头以自回归方式逐个生成潜向量;对于文本等离散模态,则沿用标准的下一词元预测分支。此外,该框架配套设计了σ-VAE,以缓解潜空间中的方差坍塌问题。

diagram
图4:潜语言模型LatentLM以因果Transformer为共享主干,统一处理图像、音频和视频等连续数据,以及文本和代码等离散数据。该方法引入下一词扩散机制,通过自回归方式逐个生成潜在向量。该方法提供了一个通用接口,实现了多模态生成与理解的统一。

实验表明,在ImageNet图像生成任务中,4.79亿参数版本的LatentLM取得了2.24的FID指标,以更少的参数超越了6.75亿参数的DiT-XL/2(FID 2.27)。随着模型规模扩大,LatentLM表现出良好的可扩展性,推理吞吐量最高可提升2.84倍。将该框架融入多模态大模型后,其在语言建模困惑度、文生图FID和视觉问答等指标上均优于Transfusion及向量量化基线,并且随着训练数据规模扩大,性能优势进一步增强。

在语音合成任务中,σ-VAE可实现1600倍超高压缩比,解码步数仅为VALL-E 2的十分之一,并在说话人相似度和音频鲁棒性方面取得更优表现。该框架还可复用大模型现有的分布式训练体系,为统一多模态理解与生成提供高效且易于扩展的技术路径。

5.ViTL:融合交错式推理的长视频问答

title,image

论文链接:https://arxiv.org/abs/2510.04022 (opens in new tab)

长视频问答长期受困于“固定算力预算”与“答案往往藏在短暂片段里”的矛盾中。由于模型的token、帧数存在固定上限,现有模型多采用均匀或启发式采样,将大部分容量消耗在无关的背景画面上,这恰恰漏掉了承载答案的关键片段。现有的公开训练集很少将问题与真实时间区间绑定,模型只能直接输出答案,无法定位对应的推理依据,评测可追溯性较差。而时序定位与问答模块分开优化,即便片段定位精度提升,效果增益也很难转化为答题准确率。

针对这一瓶颈,研究员们提出了ViTL(Video-in-the-Loop)两阶段框架。第一阶段,模型先用低帧率快速浏览完整视频,定位一个或多个与问题相关的时间段;第二阶段再放大对应片段,以更高有效帧率编码画面并完成作答。两阶段共享固定的token总量,将视觉算力重新分配给关键证据片段,而非平均分配至全视频画面。

训练采用的是交错式组相对策略优化(GRPO),耦合时序IoU定位指标与答题奖励,让奖励信号可以反向传导至定位分支,引导模型优先学习利于正确作答的视频片段。为补齐时序定位所需的监督信号,研究员们搭建了VGrounding-QA数据集,依托GPT-4o对视频做细粒度结构化解析,提取实体并构建事件知识图,再基于图谱生成绑定真实时间区间的多时段、多选问答样本。

diagram
图5:ViTL与VGrounding-QA框架总览。给定长视频与问题,阶段1从问句中提取定位查询,预测相关时间区间;阶段2仅对筛选片段做高保真重编码,完成多选问答。整套流程采用R1类强化学习循环训练方案,联合优化时序IoU与问答两大目标,优先优化有效证据片段。

实验与消融结果显示,ViTL仅以128帧输入即在LVBench上达到47.4%,超过256帧均匀采样的Qwen2.5-VL 7B基线(43.7%),并以50%的帧输入量取得最高8.6%的性能提升。消融实验进一步表明,基于片段感知的token分配始终优于全局均匀采样。ViTL验证了固定算力下聚焦证据片段的设计思路,同时兼顾答题精度与时序可追溯性,为高效、可解释长视频大模型推理提供了全新可的行方案。

関連出版物