知识卡片:OmniReasoner:通过原生工具使用进行长音频-视频推理
- 英文标题:OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
- 英文关键词:omnimodal LLM, tool-use post-training, long audio-video reasoning, temporal grounding, zoom-in tool, TimeAnchor
- 原始来源:https://arxiv.org/abs/2607.19339v1
一句话结论
OmniReasoner 是一个针对全模态大语言模型(omnimodal LLM)的后训练框架,让模型学会在回答前自主决定是否调用“缩放”(zoom-in)工具对长音频-视频中的关键时间段进行高保真度检查,从而在降低计算成本的同时提升答案准确性和时间定位能力。
事件概述或研究问题
长音频-视频推理对全模态大语言模型而言非常困难,因为决定性证据往往稀疏、跨模态,且在全流上保持统一高保真度输入的代价过高。现有方法要么对所有帧均匀处理(浪费计算资源),要么无法灵活聚焦于关键片段。OmniReasoner 旨在让模型通过工具调用(tool-use)来动态选择高保真度区域,实现“先全局预览,再局部放大”的推理策略。
方法/产品要点
- 工具使用后训练框架:通过监督微调(SFT)和强化学习(RL)训练全模态LLM,使其学会在回答前判断是否需要调用“zoom-in”工具,并指定待检查的时间区间。
- 全局预览 + 局部缩放:模型先以低成本构建整个流的稀疏全局预览;当需要时,调用 zoom-in 工具对请求的时间区间进行更高保真度的视觉和音频检查,然后再给出最终回答。
- TimeAnchor 机制:由于全局预览和局部缩放使用不同的采样粒度(稀疏 vs 密集),TimeAnchor 保证工具的时间参数在不同粒度间保持有效且往返一致,而不依赖于某个特定采样率的帧索引。
- 时间增强数据引擎(Temporal Augmented Data Engine):通过视频编辑和合成自动生成带工具使用轨迹的训练数据,避免昂贵的人工区间标注。
主要结果或产业意义
- 在全模态和视频基准测试上,OmniReasoner 同时提升了答案准确性和时间定位精度,同时将高保真计算集中在信息密集区域。
- 代码已开源(https://github.com/RockyChen0205/OmniReasoner)。
- 意义:为长视频理解提供了一种高效、可扩展的“思考-工具调用”范式,降低了对全流高分辨率输入的资源需求,推动了全模态模型在监控、影视分析、多模态问答等场景的实际落地潜力。
为什么重要
与已有知识卡片(如 MV-Forcing、Cycle-World 等聚焦视频生成)不同,OmniReasoner 解决的是长音频-视频的推理与理解问题,尤其是如何让模型主动选择信息来源。它与“基于冻结离散扩散语言模型的音频原生语音识别”也不重复,后者专注语音转录。OmniReasoner 的价值在于首次将“工具使用后训练”(类似 LLM 中的 tool-use)引入全模态模型的音频-视频推理,并设计了对齐不同采样粒度的 TimeAnchor 机制。
局限与不确定性
- 论文未在材料中披露具体基准测试名称或量化结果(如准确率提升幅度),具体效果需查看原文实验部分。
- 合成数据引擎生成轨迹的覆盖广度与真实性可能存在偏差,需要验证在真实复杂场景中的泛化能力。
- 强化学习训练中奖励函数的设计细节待核实。
- 工具调用的决策过程是否可解释、是否会产生错误调用(如遗漏关键信息)未在摘要中说明。
可用于图书/PPT/简报的角度
- 示例标题1:“全模态模型的‘放大镜’:OmniReasoner 如何让 LLM 学会先看全局再聚焦细节”
- 示例标题2:“从均匀计算到智能缩放:长视频理解的新范式”
- 示例标题3:“TimeAnchor:让不同采样粒度下的时间对齐不再是难题”
与既有脉络的关系
本条是对长视频理解领域的增量贡献。与 MV-Forcing(视频生成)和 Cycle-World(视频世界模型误差缓解)不同,OmniReasoner 聚焦于推理时的信息选择与工具使用,是模型后训练(post-training)而非生成或世界模型方向的新探索。它延续了 LLM 中 tool-use 的思想,并将其扩展到跨模态(音频+视频)的长序列场景。
原始材料
URL: https://arxiv.org/abs/2607.19339v1
Track: academic
Topics: foundation-model
Manual title: 同英文标题
Candidate summary: 同本文开头摘要