【Video】LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
发布时间:2026/10/8 2:16:25 作者:尧图编辑部 阅读量:1,286

note动机长视频不能全量送进 MLLMuniform/exhaustive search 成本高、冗余多。目标是学会当前证据够不够不够的话下一步该看哪一段。核心动作预先把视频构造成 High / Medium / Low 三层 hierarchical captions。推理时模型先只看 High-level captions若证据不足就根据问题 当前已有证据选择最相关的时间段调用工具展开该段的 Medium-level captions仍不足再继续下钻到 Low-level / 具体 clip。即看粗摘要 → 选分支 → 展开细节 → 再判断 → 继续或停止。训练基于层次化 caption 构造 CoT-with-tool 轨迹先 SFT再 RLreward 同时鼓励答对、少走无关分支、尽早停止。结果在长视频理解 benchmark 上取得更好的 准确率–计算成本 trade-off显著减少无效 clip 浏览官方已开源训练、数据和评测代码。推荐阅读顺序Abstract → 图 1动机与框架→ 图 2CoTwT 实例→ 式 (3) 奖励函数 → 表 1主结果→ 图 5成败案例→ 第 6 节局限性。文章目录note一、研究动机长视频理解的瓶颈不在懂而在看完二、论文核心会翻页的推理模型2.1 总体思路把视频变成一本可跳转的书2.2 两个工具分工明确2.3 推理流程CoTwTChain-of-Thought-with-Tool2.4 训练3.3 万条轨迹SFT RL 两阶段三、实验结果准且省3.1 评测设置3.2 关键结论四、分析与讨论4.1 方法的本质贡献4.2 为什么思维链 工具这条路走得通4.3 局限与隐忧客观看待4.4 启示与后续方向一、研究动机长视频理解的瓶颈不在懂而在看完LongVideo-R1: Smart Navigation for Low-cost Long Video UnderstandingCVPR2026Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang YeUniversity of Chinese Academy of Sciences / Huawei Consumer Business Group代码与数据https://github.com/qiujihao19/LongVideo-R11. 现实矛盾多模态大模型MLLM在短视频、图像上已接近饱和但面对 1–2 小时的长视频时上下文窗口这道硬墙挡住了去路。现有解法几乎是清一色的暴力穷举把视频切成短片段 → 逐段生成字幕或摘要 → 汇总作答。Ego-R1、VideoTree 等 Agent 方案虽拿到不错的 QA 准确率但计算量随视频时长线性增长。这在实际场景中是致命的具身智能体需要在低延迟下对世界做出反应等不起几十轮推理视频对话服务受单条样本的处理预算约束穷举即等于不可部署。2. 被忽略的度量维度论文指出学界长期只优化 QA 准确率却很少有人问为这一分准确率花了多少。作者因此提出一个新的研究设定在低计算预算下做长视频理解追求的是准确率—效率的帕累托最优Pareto optimum而非单点精度最高。3. 核心假设也是全文的灵感来源人类看长视频答题从来不是从头看到尾而是扫一眼大纲 → 猜关键段落 → 跳过去确认。作者假设 MLLM 也应具备这种动态、迭代的主动性仅凭局部的高层上下文就能判断下一帧该看哪里。这就是从exhaustive search穷举转向goal-oriented reasoning目标导向推理的动机原点。4. 成本如何量化论文把一次 QA 的总计算成本定义为流水线中每一步估算开销的累加帧采样数、MLLM 调用次数等并明确排除离线预处理视频这类取巧方案——因为那不满足低延迟系统的要求。对应论文图表本节论点由图 1Figure 1支撑建议对照阅读。该图展示了 LongVideo-R1 的闭环工作机制contextual exploration上下文探索与 reasoning termination control推理与终止控制构成的自调节循环以及与线性扫描在调用次数上的直观差异。二、论文核心会翻页的推理模型2.1 总体思路把视频变成一本可跳转的书LongVideo-R1 大推理模型LRM 两个多模态工具 层次化视频树。关键设计是视频层次树层级含义默认设定第 0 层根整段视频 V[0, T]1 个节点第 1~D-1 层中等粒度片段每层 K 个子节点第 D 层叶约 16 秒的短片段可调用 QA 工具默认D 3K round(⁴√(T/16s))即每个非叶节点均分为 K 个等长、不重叠子片段叶子约 16 秒。这带来一个精妙的性质先看大片段粗粒度需要时再放大到细粒度。如同先在目录页定位章节再翻到具体段落——避免了逐页顺序阅读的浪费。作者也坦诚均匀切分并非最优语义连贯的内容可能被切到两个子片段中增加定位歧义。这是后续可改进点。2.2 两个工具分工明确工具输入输出调用层级作用video_cap()片段 采样帧数 F文本描述 t任意层通用描述用于找地方video_qa()片段 F 问题 q答案 a可答不知道仅叶子层针对性作答用于给答案区分二者的设计意图很重要cap是侦察兵便宜、泛化、帮你定位qa是狙击手只在最后一步、最小范围内使用直击问题。这种职责分离是降本的关键。2.3 推理流程CoTwTChain-of-Thought-with-Tool一次完整推理是一个自然语言构成的轨迹ε [S₁, S₂, ..., S_L]每一步 S_l (推理语句 r_l, 工具返回)最后一步输出答案 a。整个轨迹纯文本多模态工具以外部函数形式调用天然可被语言模型学习。算法直觉Algorithm 1取顶层字幕t₀ video_cap(V)作为起点推理模型rea()读历史 问题产出r₁循环解析r_l中的工具意图与目标片段 → 调用工具 → 追加历史 → 再推理终止条件r_l中包含答案或达到最大迭代次数。导航动作只有三种极其克制Drill down下钻当前片段相关但不够细 → 走向子节点Lateral traverse横向兄弟片段更可能含答案 → 平移Backtrack回溯此路不通 → 返回上层重选。对应论文图表Algorithm 1Hierarchical Video Reasoning建议逐行读尤其注意第 6 行的while r_L does not contain the answer——答案即终止信号是整个框架的灵魂。图 2Figure 2CoTwT 轨迹示例展示思考 → 调用 cap → 再思考 → 调用 qa → 作答的真实对话流是理解机制的最佳入口。2.4 训练3.3 万条轨迹SFT RL 两阶段数据从哪来这是本文的工程亮点从CGBench带 grounding 标注的视频语料抽取层次化视频字幕——天然匹配树结构用GPT-5 API基于 grounding 标注合成33K 条高质量 CoTwT 轨迹即思考过程 工具调用序列 最终答案的完整示范。用强模型GPT-5蒸馏轨迹给小模型Qwen3-8B是让 8B 模型具备会导航能力的必要条件——纯 SFT 学不会何时停。两阶段训练范式阶段目标作用SFT模仿 GPT-5 的轨迹学会格式与基本导航逻辑RL在预提取字幕上优化学会省——准确且尽早终止RL 奖励函数是本文的方法学核心。作者设计了专门奖励同时惩罚两类行为答错→ accuracy 奖励低绕路调用过多、看了无关片段→ efficiency 奖励低。这迫使模型在再看一眼确认与就此作答之间学会权衡。论文强调该奖励在预提取字幕上即可稳定训练、仅需少量 epoch工程上友好。对应论文图表图 3 / 第 4 节数据集构建流程与轨迹样例关注轨迹中cap与qa的交替节奏。奖励函数公式式 3 及其后重点看三项——答案正确奖励、调用轮数惩罚、冗余片段惩罚理解帕累托是如何被写进损失函数的。三、实验结果准且省3.1 评测设置基准LVBench、VideoMME、MLVU三个公认困难的长视频 QA 基准基线线性扫描类 AgentVideo-SALMONN 2、Ego-R1 等底座Qwen3-8B核心指标QA 准确率推理/导航轮数成本代理。3.2 关键结论结论 1准确率有竞争力成本大幅下降LongVideo-R1 在三个基准上取得与穷举型 Agent 相当的 QA 准确率但平均仅需≈10.5 轮推理与工具调用。直观对比一段 1 小时视频按 16 秒叶子切分叶子节点数以千计。线性扫描需调用工具上千次LongVideo-R1 只用 10 次量级——数量级级别的差距。结论 2层次化 早停 降本主因层次结构让模型先用 1 次cap覆盖数分钟内容避免过早陷入细节推理终止控制让模型在信息够了的瞬间停手避免为 1% 的精度多花 50% 的计算。结论 3RL 阶段不可替代消融实验见表显示仅 SFT 的模型会犹豫——反复调用cap却不敢作答加入 RL 后模型学会在置信度达标即终止轮数显著下降而准确率基本不掉。这验证了效率必须被显式奖励无法靠模仿学习获得。结论 4泛化到超长视频论文额外展示了在复杂电视剧上的超长视频理解能力——这是此前在严格预算下不可能的任务构成最强的定性证据。对应论文图表本节请务必对照数字以原表为准表 1Table 1三基准上的主结果对比横向比准确率、纵向比调用轮数/FLOPs是全文最重要的表。表 2Table 2消融实验w/o hierarchy / w/o RL / w/o cap-qa 分工用于确认每个模块的因果贡献。图 4Figure 4准确率–成本帕累托曲线直观呈现同样成本下谁更准同样精度下谁更省。图 5Figure 5典型案例的轨迹可视化——成功案例体现精准下钻失败案例体现语义切分歧义导致迷路极有参考价值。四、分析与讨论4.1 方法的本质贡献从检索到推理式导航的范式迁移。传统 RAG 式长视频理解是被动的先建索引、再检索、后作答检索与推理割裂。LongVideo-R1 把看哪里变成推理过程本身的一部分——下一步看哪里由当前已看到的内容与问题共同决定。这是Agent LRM范式在视频领域的干净落地。4.2 为什么思维链 工具这条路走得通可训练轨迹是文本可直接 SFT可奖励轮数、正确率都是可计算的标量天然适配 RL可解释每一步思考与工具调用都可被人类审阅见图 5 的案例。这三点构成了推理模型做 Agent的闭环优势。4.3 局限与隐忧客观看待局限说明成本口径偏理想成本按采样帧数 MLLM 调用估算未计入视频解码、字幕预提取、GPT-5 合成数据的真实开销。低成本是推理阶段的相对优势非端到端绝对优势。均匀切分的语义缺陷对话、动作常被切断到相邻片段导致定位模糊、需额外回溯。长跨度多跳推理弱答案依赖相隔很远的两个事件时局部推理易走偏最终触达迭代上限。依赖字幕质量cap的描述质量直接决定导航上限模糊/错误字幕会误导整个轨迹。基座规模限制Qwen3-8B 的推理与指令遵循能力有限更强基座应有更大收益空间。评测覆盖不足仅在 3 个基准 电视剧案例上验证未覆盖直播、监控、第一视角等真实长尾场景。4.4 启示与后续方向语义感知的切分用镜头边界、场景检测、ASR 章节替代均匀切分从根上缓解定位歧义可学习的导航策略把下钻/平移/回溯建模为策略网络替代当前 LLM 隐式决策记忆机制引入可写笔记本避免长轨迹中早期关键证据被上下文稀释成本模型的写实化把解码、I/O、批处理收益纳入给出可部署的端到端耗时向其他长上下文模态迁移同一套层次化 早停思路可直接用于长文档、长音频。