TensorX

TensorX · Paper Blog

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu (Microsoft Research, National University of Singapore, Nanyang Technological University, Tsinghua University, Peking University, Shanghai Jiao Tong University, Westlake University, CFAR A*STAR) · 2026-07-05

Academic DisseminationAI AgentsMulti-modal GenerationScientific Communication

本文介绍了ResearchStudio-Reel,这是一个创新的学术传播自动化流水线。它能够将一篇 accepted 论文PDF一键转化为印刷级学术海报、带视觉高亮对齐的演讲视频以及高质量双语博客,且所有产出物在原生工具中均完全可编辑,重塑了学术成果发布的‘最后一公里’。

💡 核心创新点

传统的学术成果传播往往是一个极其耗费人力的过程。在论文录用后,作者不仅要制作海报、录制演讲视频,还要撰写通俗易懂的博客进行多平台推广。现有的自动化工具在解决这一“最后一公里”痛点时存在三个显著硬伤:首先是孤立提取(Isolated extraction),不同的任务独立读取PDF,导致海报上的图表编号、数据和博客或视频无法对齐;其次是单向渲染(One-way renders),工具往往只生成扁平化的PDF、不可编辑的MP4或者简单的Markdown,一旦作者需要微调,必须从头重新运行整套流水线;最后是软性质量门槛(Soft quality gates),依赖VLM的偏好评分进行排版,容易导致核心板块内容缺失或版面大量留白。

🌟 从单向死板渲染到全自动、可编辑的学术画布

为了打破这些传统学术自动化的枷锁,ResearchStudio-Reel提出了一种基于技能组合机制(composition of skills)的架构,它由单次运行的核心抽取器 Paper2Assets 以及三个高度并行的可编辑生成器(Paper2PosterPaper2VideoPaper2Blog)组成。通过统一的数据契约,所有生成器都共享来自 Paper2Assets 的同一套图表、文本锚点和核心结论,从而天然地保障了跨媒介的数据一致性。

更具革命性的是,ResearchStudio-Reel 完全抛弃了“一键黑盒生成”的逻辑,所有的多媒体输出均保留了原生工具编辑能力(Native-tool authoring)。生成的学术海报可以直接在 PowerPoint 中重新打开并调整每一个文本框、公式和矢量图形;视频配音也基于可编辑的 PPTX 幻灯片,使作者能像修改日常胶片一样进行微调;而博客则是版面感知、完全对齐的 Word 文件。最终,融合层 Paper2Reel 将这三个制品编织进一个自包含的、交互式 HTML 阅读器中,用户点击海报的任意小节即可无缝跳转并高亮视频和博客中的相应内容,实现了学术传播的高效闭环。

fig-01.png

🔍 背景与动机

学术传播层和论文本身的写作有着本质的区别。在相继经历了漫长的投稿与同行评议、好不容易搞定 Camera-ready 阶段之后,作者往往已经精疲力竭,而此时恰恰是学术影响力建设的黄金期。不仅学者个人需要准备现场宣讲的学术海报和虚拟会场的演讲视频,各大高校和研究机构的官微平台也急需通俗化的中文与英文博客解读。手动处理这些任务需要涉及大量的图像裁剪、多平台排版微调、文案转换以及繁琐的音画同步工作,是一项高强度、低容错的繁重劳动。

💔 学术传播的“最后一公里”痛点

现有的学术传播自动化流水线在实际落地上面临着难以逾越的鸿沟:

  • 数据拼写与事实冲突:一个孤立的多模态海报生成器可能将“图3”放在海报显著位置,而博客生成器却因为文本截断导致数据不一致。这种底层数据的“指代偏移”是完全不可避免的。
  • 修改成本极其高昂:学术界极其看重严谨性,一旦生成的制品出现微小的数据笔误或文字重叠,一方向生成的 PDF 或视频无法让用户“就地双击修改”,极大地挫伤了人类学者的使用积极性。
  • 排版失控与内容空洞:现有工具在排版时往往使用多模态大模型进行软性评估评分,这种方法在面对不同分辨率、长宽比不一的论文图表时极易出现排版溢出或大幅度空虚。如果一个 load-bearing(承重性)的版块因为内容填充不足而处于半空状态,整张海报的学术严谨性就会大打折扣。

因此,学术界急需一种兼顾强一致性保障原生可编辑性、以及硬性排版质量门槛约束的全新系统,来彻底解决学术“最后一公里”的效率与质量赤字问题。

📊 数据集与实验环境

为了全面验证 ResearchStudio-Reel 的实际效果,研究团队在包含 100篇 顶尖学术会议论文(涵盖机器学习、计算机视觉、自然语言处理等主要领域)的 Paper2Poster 基准测试集 上进行了高强度、全方位的定量评测。

🛠️ 实验评估基准与多模态环境配置

实验过程高度契合严谨的学术标准,所采用的环境和超参细节如下:

  • 评测尺度与公平度:所有生成的海报在评估时一律等比缩放至 <= 2560 px 宽度。这确保了不同的模型在接受多模态大模型裁判打分时,不会因为超高分辨率带来不公平的优势。
  • 评测指标设计:引入了 Paper2Poster 自带的六维度美学/信息评测量规,以及严苛的 PaperQuiz 理解力问题集,通过两款完全不参与训练的评测 VLM 模型 claude-opus-4.8gpt-5.5 进行盲测和自动评分。
  • 核心依赖环境
    • 图像转换与前端控制:使用无头 Chromium 运行 Playwright,负责超高精度的 HTML 到 PDF/PNG 的完美转换与页面像素分析。
    • 多媒体渲染引擎:通过无头模式运行的 LibreOffice 配合强大的命令行工具 ffmpeg,实现 PPTX 胶片到高清 MP4 视频的自动无缝压制。
    • 文字与版面感知处理:底层依赖 python-docx,在后台静默建立 Word 渲染布局检查。配音合成采用高拟真度的微软 Edge TTS 神经语音服务。

🛠️ 核心机制与研究方法

ResearchStudio-Reel 的整套设计哲学可以归结为一句话:“单次提取,多元复用,硬性约束,就地编辑”。整个系统的运作过程可以用如下的框架流程图(Figure 2)来概括:

fig-02.png

🏗️ 整体多媒介协同架构

系统的总线由五大核心“技能”(Skills)深度协同完成,其中 Paper2Assets 作为唯一的数据源头,极大地杜绝了事实冲突。以下是各个核心技能的 Step-by-Step 拆解和剖析:

📂 Paper2Assets:跨媒介资产的Factually-Consistent提取

Paper2Assets 的核心任务是将上传的论文 PDF 读入并解析,进行彻底的物理与语义解构。它的输入是原始 PDF 文件,输出则是包含整篇论文结构化数据的 Reusable Assets 资产包。其包含的核心子步骤如下:

  1. 双栏解析与文本抽取:通过物理层面的版面分析,识别论文的段落和层级结构,从而完美提取包含分页信息的正文。同时,通过双阶段的 Visual-AI Figure-cleanup(图表清理链),系统能自动剥离 PDF 中图表的附带 Caption 文字、多余的白边和残留线条。如果检测到一个栅格图像中打包了两个独立的子图,AI 验证器会启动 sub-agent 自动对其进行裁切与图像分裂,确保下游任务拿到最干净的图表。
  2. 元数据自动合成与外部检索:系统首先从论文首页解析出标题、作者、机构等核心元数据。随后,利用 Wikimedia Commons API 和 Wikidata,按最优匹配策略抓取并验证目标学术机构的官方 Logo,以及对应学术会议的 Venue 矢量图标。未匹配成功的图标直接保持隐藏,避免产生难看的占位符。同时,对论文的原文链接及开源代码仓库链接生成高精度的 QR 码以备后用。
  3. 叙事逻辑与音频计划清单生成:系统生成由 9 个经典模块组成的学术摘要(Problem, Motivation, Contribution, Method, Dataset/Benchmark, Key Result, Ablation, Headline Numbers, Takeaway)。这一摘要被牢牢固定为后续所有生成器的叙事主线,确保海报、视频和博客的讲解节奏完美对齐。

🎨 Staged-Fill海报微调:让排版自适应撑满

在生成学术海报时,系统利用 Paper2Assets 提供的提取资产,通过 Paper2Poster 模块进行自动化布局。此时面临的头号难题是:如何自适应填满一整张 A0 规格(1189extmmimes841extmm1189 ext{mm} imes 841 ext{mm})的高清学术海报?ResearchStudio-Reel 创新性地发明了 Staged-Fill 循环排版微调机制

🎯 核心结论:相比于一味追求绝对高文本密度的软性评分,基于硬排版反馈的 Staged-Fill 循环是解决海报画面失衡、空隙过大的最优解。

系统在每次循环时,在无头浏览器中渲染出当前的海报 HTML。针对海报上的每一个卡片分区,计算其内容高度与容器卡片真实高度的比值 fullRatio:

fullRatio=hcontenthcard\text{fullRatio} = \frac{h_{\text{content}}}{h_{\text{card}}}

在公式 上式 中,hextcontenth_{ ext{content}} 表示该卡片内所有被绘制元素最底边缘的 getBoundingClientRect 真实像素高度,而 hextcardh_{ ext{card}} 则表示该卡片内部的真实可用净高度。这个 fullRatio 被严格离散化映射为五种排版状态,并对应执行不同的 agent 操作决策:

  • EMPTY (<0.70< 0.70):表示版面大量留白。此时系统会触发补充内容生成机制,将 Paper2Assets 备用的副段落或备用图表调出并填充进去。
  • SPARSE (0.70extto0.900.70 ext{ to } 0.90):中度留白。通过文字润色助手,自动扩写或略微调大字体字号、增加段落行距进行填充撑满。
  • FULL (0.90extto1.000.90 ext{ to } 1.00):理想的目标饱满区间,保持当前状态不进行任何干涉。
  • SPILLAGE (1.00extto1.101.00 ext{ to } 1.10):卡片内容出现微小溢出。调用压缩机制,对文字叙述进行同义精简,或略微压缩空隙。
  • OVERFLOW (>1.10> 1.10):内容严重溢出。丢弃冗余段落,或者将非核心图表移除以释放空间。

fig-03.png

📐 像素级 DOM 映射与可编辑 PPTX 导出桥接

💡 关键技巧:通过像素级 DOM 几何数据到 PowerPoint EMU 单位的直接转换,ResearchStudio-Reel 实现了真正原生、完全可二次编辑的 PPTX 导出。

为了打破“单向不可修改”的缺陷,系统内置了一个超高精度的 PPTX 转换网关。它绝不采用“截图贴入”的方法,而是直接步行遍历在线 DOM 树,提取每一个 DOM 节点的 getBoundingClientRect 与经过渲染计算后的 getComputedStyle。系统通过一系列数学变换,将 CSS 像素无缝投影为 PowerPoint 原生的 EMU 空间尺寸单元。

  • 段落与富文本样式保留:每一个 ph1-h6li 节点均被精确建模为 PPTX 内的文本框,行内的加粗与斜体标签被拆解为独立的 RichTextRun 进行样式渲染。
  • 公式 OMML 重构:对于由 MathJax 渲染出的数学公式,系统会在 DOM 中预存其 data-tex 标记属性,随后在生成 PPTX 时将 LaTeX 代码重构为微软原生的 OMML 可编辑公式对象。这使得作者可以在 PPTX 中随时点击公式并进行二次修改。
  • 矢量卡片转换:海报上带圆角、渐变和阴影的复杂卡片卡板,会被精确重组为 PowerPoint 的 Shape 原生成型组件,极大地便利了后期的重新调色和美学编辑。

🎬 Paper2Video 与 Paper2Blog:视频与博客的生成机制

除了学术海报,ResearchStudio-Reel 还同步支持学术视频与博客的高质量、对齐化生成,进一步丰富了成果发布的表现手段。

🎬 Paper2Video 视觉焦点高亮与 Paper2Blog 布局修复

  • Paper2Video 视频生成:视频生成模块输入结构化的九小节配音文案,并生成一个配音-画面对应计划。在生成最终的音轨并与 Edge TTS 结合后,系统会计算出精确到单词级的 Word-timings 时间戳。为了向观众提供绝佳的注意力引导,系统会在生成的无字幕 MP4 视频中覆盖一层 Narration-aligned visual highlights(配音对齐视觉高亮组件),支持激光笔、区域聚光灯(spotlight)、卡片淡入和文字高亮遮罩等多样化视觉焦点。最终输出包括一版纯净的视频,一版带硬字幕烧录的高清 MP4,以及完整的 PPTX 视频大纲和 timeline.json 时间同步侧导文件。
  • Paper2Blog 博客生成:博客模块旨在针对中英双语环境生成完全本土化的、符合特定阅读习惯的技术博客。为了克服简单的“英译中”带来的语言僵硬和生硬直译,系统维护了一个统一的学术证据图谱(Evidence Map),并依据语言风格差异(例如:中文侧重于微信公众号的科普自推调性,英文侧重于官方 Research Blog 的严肃介绍基调)来分别起草内容。为了保证博客具有可读性,系统内置了 Word 布局修复门槛,能自动检查并修复孤行(orphan lines)、近乎空白的尾页、因图像超大而导致的文字过度断裂或排版空缺,最终输出两份可以直接用 Word 打开并排版极佳的 .docx 文件。

fig-04.png

fig-05.png

📈 结果与深度分析

实验评测表明,ResearchStudio-Reel 的生成质量在各项美学、信息承载力以及理解准确性指标上都取得了压倒性的优势。

📊 性能对撞:ResearchStudio-Reel 击败人类原版海报?

🚀 重大突破:ResearchStudio-Reel 在美学评分上达到了 3.52,大幅超越人类作者原始设计的 2.94 分。

如 Table 1(Figure 6 所示数据)中的盲测评测结果,我们来看一下具体的核心指标表现对比:

在代表人类设计美学和版面质量的三大子项(元素美学 Elem.、参与度 Engag.、整体布局 Layout)上,基于 Claude Code 驱动的 ResearchStudio-Reel 方案分别拿到了 3.333.26 以及 3.97 的高分,远远甩开了基线方案(如 Paper2Poster Tool 仅为 1.82 / 1.20 / 1.52),并对单次生成方案(GPT-5.5 单次生成为 2.98 / 2.88 / 3.22)保持了显著的领先优势。

在信息深度与逻辑清晰度(Low, Logic, Cont.)方面,ResearchStudio-Reel 同样展现出极高的质量,拿到了 4.00 / 4.00 / 3.71 的亮眼成绩。通过对评测 judges 的结果统计发现,在 84% 到 93% 的被测论文上,由本方法自动生成的学术传播包在两款 VLM 裁判的评分中均击败了人类作者为该学术论文制作的原始官方海报。

fig-06.png

这一结果深刻揭示了 Staged-Fill 排版反馈微调循环的威力:传统的 LLM 在单次生成长 A0 海报 HTML 时,缺乏视觉渲染后的尺寸反馈,容易退化到保守的多栏对称网格设计。而本方法通过动态的高度 fullRatio 检查,能够精准判断海报上的视觉稀疏或溢出状态,从而通过内容的微调将海报的版面充实度完美控制在最理想的视觉体验范围内。

⚠️ 当前局限性与未来愿景

尽管 ResearchStudio-Reel 的多媒介协同框架取得了长足的发展,但研究团队也指出了目前版本中存在的若干关键局限性:

  • 图像裁剪的残余痕迹 (L1):对于含有极高文本密度、或者将多项对比表和图混合在一起的原始 PDF 图表,Deterministic 裁切和 Visual-AI 有时可能会在图表边缘留下少许 caption 文本字样或残留的双栏边框线,导致下游展示时略显瑕疵。
  • 无法独立合成全新图表:整个系统为了严防数据幻觉,只提取并重用论文中已经存在和印刷好的图表。然而,优秀的学术成果宣讲海报或博客,往往需要人类作者专门为该海报绘制一个大颗粒度的、科普性质的方法学示意图或系统总揽卡片,这对于完全依赖无幻觉资产抽取的 AI 自动化系统而言,是一个极大的内容生成挑战。

在未来的工作中,研究团队计划探索在严格的数据与逻辑校验下引入安全的图像生成和示意图自动合成能力,并致力于引入更多真实人类专家读者的大规模主观阅读评测,以进一步逼近并超越人类顶尖设计师的真实创作水平。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号