a tall building lit up at night

微软亚洲研究院

一句话表达意图,AI完成视觉交付:DeepVisual Agent 重新定义智能创作

公開済み

对于人类来说,视觉始终是信息获取效率最高的通道。神经科学研究表明,人类大脑每秒接收约1100万比特的感官信息,其中约80%来自视觉,但人脑有意识层面的信息处理速度仅有10–50比特/秒。视觉不仅承载着绝大部分信息输入,也是人类理解复杂内容、组织知识与完成决策的重要方式。但在生成式AI席卷全球的今天,绝大多数大模型与智能体依然停留在文本输出阶段。

由于文本输出的限制,原本旨在提升效率的AI反而给用户带来了大量需要二次加工的工作。对于知识工作者而言,超过60%的精力被消耗在资料检索、素材整理、版式设计、幻灯片制作等重复性的“元工作”上。而现有AI工具大多只能解决单点任务,难以形成完整的工作流闭环,大多停留在一次性输出结果阶段,缺少和AI往复沟通、迭代打磨的能力。

针对这一痛点,微软亚洲研究院推出了DeepVisual Agent。该智能体以“意图输入,视觉交付输出”为核心目标,突破了传统AI生图与纯文本输出的局限,将用户从繁琐的资料搜集、内容组织与视觉设计工作中解放出来。用户不再需要在多个工具间反复切换,只需输入一句任务描述,即可获得协作创作的视觉成果,如幻灯片、海报、信息图等。在这一过程中,DeepVisual Agent始终贯彻视觉优先、人类增强智能、动态自适应评估三大理念,重构人机协同的视觉创作流程,为用户提供端到端的解决方案,也为多模态智能体的发展提供了新的思路。

相关论文信息已整理至文末,欢迎点击了解更多技术详情。

拆解DeepVisual Agent:四步走通视觉交付全链路

从一个初步想法到可交付的视觉作品,DeepVisual Agent能够自动完成完整的视觉创作流程。这并非传统意义上的文生图或文生PPT,它更像一位经验丰富的设计师和助理的共同协作:先理解需求,再搜集资料、设计版式,并在用户与智能体持续沟通中迭代优化,最终交付一份可以继续编辑和使用的视觉物料。

第一步,收到用户需求后,DeepVisual Agent并不会立刻生成页面,而是先理解用户的真实需求。例如,确认幻灯片页数、输出语言、受众对象等关键信息,并据此自动规划整份演示文稿的逻辑框架。

gif
Demo 1:DeepVisual Agent对需求的理解 

第二步,完成结构规划后,DeepVisual Agent会主动搜集所需信息。例如,当用户制作关于“Mit Rahina遗址新发现”的PPT时,智能体会自动搜索全球权威新闻网站和学术数据库,获取相关素材并下载至素材库,省去了用户在浏览器与创作软件之间反复切换的繁琐操作。

第三步,基于设计简报和收集到的图文素材,DeepVisual Agent会自动规划每一页的视觉布局,生成标题、正文、图片、图标及配色方案,并保持整份文档在字体、色彩、页面结构等方面的风格统一。

相比许多生成式工具容易出现页面风格割裂、内容拼接感较强的问题,它更强调整套视觉内容的整体性,让内容逻辑与视觉风格同步建立,形成统一完整的表达。

gif
Demo 2:DeepVisual Agent进行版式设计

第四步,DeepVisual Agent为用户提供了可编辑(Make Edit)功能,针对不同用户偏好、使用习惯与任务特性,构建了多层级、可灵活选择的人机协作方式。包括,用户可以使用简单的自然语言指令修改,只需用如“删除页码”这样的文字描述需求;用户还可以基于图像修改模型进行交互式修改,比如直接框选出修改区域,然后描述修改行为;一键将生成结果转换为标准PPTX格式,允许用户像常规的PPTX设计流程一样,精细调整每一处细节。

与此同时,系统支持同时产生多个不同设计的版本给用户预览,方便用户选择最满意的方案,真正实现“所见即所得”的高效人机协同创作。

image
Demo 3:DeepVisual Agent的Make Edit功能使用

另外,研究员们还为DeepVisual Agent构建了一套包含上千种可视化技能的技能库(Skill Library) ,这些技能是智能体从大量公开教学视频中自动学习获得的。例如,行星环绕动态动画、滚动增长图表、多模块分层排版等,都可以直接应用到当前的文稿中。

gif
Demo 4:动态效果演示

目前,PPT只是DeepVisual Agent选择的第一个落地场景。未来,它还将逐步扩展至海报、信息图、网页、数据仪表盘等更多商业视觉内容。无论面对何种视觉交付需求,用户都能通过这一个智能体,实现从构思到交付的完整闭环。

多项核心技术构建面向持续人机协作的视觉智能体 

多项微软亚洲研究院自主研发的核心技术,让DeepVisual Agent 实现了能够将简单需求转化为结构完整、风格统一且支持持续迭代修改的一体化视觉创作。

主动获取信息,让AI告别“被动等素材”

传统AI工作流通常依赖用户提前搜集并上传参考资料,但DeepVisual Agent则能够同时打通互联网公开信息与本地私有文档两类数据源,具备深度检索、数据自动清洗和信息结构化能力。

一方面,智能体融合GUI Grounding(图形界面定位)与CUA(Computer Use Agent,计算机操作智能体)技术,既能识别屏幕内容、理解界面控件并操作电脑,还可访问传统搜索引擎难以触达的Web数据库与动态表单,获取更全面的信息。

另一方面,DeepVisual Agent底层搭载RE‑TRAC机制 (opens in new tab)。传统深度研究智能体在多轮检索中容易遗忘过往探索路径,高达93%的失败分支会被重复遍历。RE‑TRAC会在每轮检索结束后,将已有发现、验证结果和待解决问题压缩为结构化经验,并向下传递。这使得每一次检索都建立在已有信息之上,持续提升检索效率,确保获取的信息与生成任务高度匹配。

灵活共创:让修改更精准、更自然

过去几年,生成式AI虽然能够生成越来越精美的视觉作品,但大多数结果本质上仍是一张完整的图片:页面中的文字、图片、图标和图表融为一体。当用户希望调整其中某个细节时,如何让AI 准确理解要修改哪一部分、怎么修改,以及哪些部分需要保持不变,仍然是一个挑战。

针对不同的修改需求,研究员们为DeepVisual Agent自研了4B参数规模的轻量化文生图系列模型Lens,给用户提供了三种灵活的编辑方式。

自然语言或语音描述。用户可以直接通过文字或语音表达修改意图,模型支持超长提示词,能够理解复杂指令。目前已支持目标擦除、局部重绘、光影调整等能力,并持续扩展更多编辑场景。

手势涂画直观操作。研究员们还引入了Vibe Editing(氛围编辑),用户无需编写复杂提示词,直接在图片上用鼠标或触屏即可进行自然修改。例如,想删除某个物体,用户可直接圈出目标并画叉;想新增元素,框选位置并写下需求;想调整画风,圈选区域并输入“色调更暖”。这种“边改边看”的交互方式大幅降低了编辑门槛,也让AI能够真正融入人们熟悉的创作流程。

gif
Demo 5:Vibe Editing展示

元素级交互创作。对于需要更精细控制的场景,模型则可以将页面中的每一个元素转化为可独立编辑的对象——文字变成文本框,页面变成可缩放的矢量图形(SVG)。针对这些独立的文本框、图片、图标、图表等对象,用户可以直接对单个元素进行选择、删除、移动、缩放和内容修改,充分保留人工调整、自主定稿的操作空间。

这样,无论是通过自然语言表达意图、手势指定区域,还是直接操作页面元素,用户都可以选择最适合当前任务的方式和智能体进行双向协作。

自进化机制,打造可复用的技能库

除了具备单次高质量视觉生成能力外,DeepVisual Agent还拥有持续学习与成长的长效机制。

依托Video2Skill模块,DeepVisual Agent能够自动学习全网的公开教学视频,拆解其中的版式设计、动态效果、色彩搭配和排版规则,并将这些经验封装为可共享、带版本记录的标准化技能卡片,不断扩充自身的技能库。目前,该技能库已覆盖PPT制作、网页HTML、虚幻引擎、电子音乐、计算机辅助设计(CAD),以及游戏开发等多个领域。

在此基础上,智能体还搭配了SkillOpt技能优化机制 (opens in new tab),将各类创作技能视作可迭代训练的外部参数,通过“落地部署、用户反馈收集、效果校验”三个环节的循环,自动优化技能表现,持续修复动画卡顿、版式失衡和配色违和等问题。

同时,DeepVisual Agent基于已开源的Resource2Skill (opens in new tab)技术,能够支持导入外部视频素材,让用户不再手动编码,就可提炼出全新的创作手法、生成专属技能。该技术能够将人类的多媒体资源自动转化为智能体可执行的能力,让系统创作能力随着每一轮人机协作的积累持续自我丰富。

自适应打分,构建“越用越懂用户”的闭环

为保障不同场景、不同用户的视觉产出质量,DeepVisual Agent系统内置了动态、个性化、交互式评估框架DPI Eval。这是业界首个同时覆盖三大维度、面向智能体生成内容的统一评测框架。 

  • 动态评测:BizGenEval 模块针对每一类内容实时生成专属评测清单。例如,财务报告会侧重数据准确性、合规版式;演示文稿则偏重品牌统一度、视觉层级,二者的评测标准完全区分。
  • 个性化评测:系统将自动适配使用者身份、工作场景、审美偏好。摘要汇报与深度调研文稿采用两套评分标准,让评测可以更好地服务于人,而不是反向让人适配评测规则。
  • 交互式评测:针对DeepVisual Agent生成的数据看板、交互式应用,原来的静态截图无法实现完整评测的。通过引入CUA 智能体,用户可直接操作生成内容,点击交互、测试功能,替代了人工测试的人力。

更关键的是,这些来自用户交互过程中的反馈,还会重新进入模型优化流程,形成”生成-编辑-反馈-优化”的闭环。这意味着,DeepVisual Agent不只是完成一次创作任务,而是在每一次人机协作中不断学习,更准确地理解用户需求,逐渐形成更加符合个人创作习惯的视觉表达。

人机协同增强,而非人机替代 

“DeepVisual Agent从设计之初,就将‘持续性人机协同’作为贯穿整个系统的核心设计原则。”微软亚洲研究院资深首席研究员罗翀表示,“我们没有把目标局限于后期调整,而是搭建完整的学习链路,让系统持续吸收人类的创作习惯、审美偏好与表达逻辑。在多模态智能体的发展过程中,我们始终认为AI应该是增强人类能力的工具,而不是替代人类完成创作。”

在研究员们看来,DeepVisual Agent构建的是一套双向赋能、彼此成长的人机关系。AI承接素材检索、基础排版、版式搭建等重复性工作,可将知识工作者从繁琐的机械事务中解放,更专注创意构思、逻辑梳理、价值输出等高维度思考。与此同时,人类的每一次意图表达与偏好反馈,都会持续反哺模型迭代,让智能体不断适配个人创作风格,实现个性化的视觉创作能力。

智能体的发展不应只追求更强的自动化能力,更应始终围绕用户的需求展开,将创作的主导权交给用户,通过往复协作完成意图落地。只有让AI成为拓展人类创造力和表达能力的增强工具,人机协同才能真正释放智能时代的价值。

RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents

论文链接:https://arxiv.org/abs/2602.02486 (opens in new tab)

项目页面:https://github.com/microsoft/InfoAgent (opens in new tab)

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

论文链接:https://arxiv.org/abs/2606.29538 (opens in new tab)

代码链接:https://github.com/microsoft/Resource2Skill (opens in new tab)

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

论文链接:https://arxiv.org/abs/2605.23904 (opens in new tab)

项目页面:https://aka.ms/skillopt (opens in new tab)

BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation

论文链接:https://arxiv.org/abs/2603.25732 (opens in new tab)

项目页面:https://microsoft.github.io/BizGenEval/ (opens in new tab)

Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

论文链接:https://arxiv.org/abs/2605.21573 (opens in new tab)

関連出版物