知识卡片:OmniAssistBench:面向全模态大语言模型的助手式交互基准
English Title: OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
English Keywords: OmniAssistBench; Omni-LLMs; assistant-style interaction; benchmark; multi-turn video interaction; visual prompting
原始来源:https://arxiv.org/abs/2608.21360v1
一句话结论
OmniAssistBench 是一个面向全模态大语言模型(Omni-LLM)的助手式交互基准,通过将现有网络视频逆向工程为多轮引导任务,要求模型在动态交互中结合视觉状态、用户目标和先验知识进行实时引导;当前最强的专有模型 Gemini-3-Pro 仅得到 66.4/100,开源模型 Qwen3-Omni-Instruct 得到 51.2/100,说明模型距离可靠的全模态助手仍有明显差距。
事件概述或研究问题
传统视频理解评测是被动的、基于静态离线数据集的;但实时视频助手需要主动感知环境、理解用户目标并调用先验知识来提供帮助,而且模型的回答会反过来改变用户接下来的动作,因此静态数据集无法覆盖这种动态性。OmniAssistBench 的提出即是针对这一评测瓶颈。
方法/产品要点
- 针对同一用户目标存在多种完成路径、导致交互轨迹发散的问题,OmniAssistBench 向模型提供从源视频中得到的预定义先验,要求模型引导用户沿完全相同的路线走完任务。
- 由于真实交互视频稀缺,数据集通过对现有互联网视频进行逆向工程构建:先从视频中推断合理的用户目标,再将视频分割成多轮片段,模拟连续交互。
- 数据构建流程严格,总计投入超过 1000 个专家小时。
主要结果或产业意义
- Gemini-3-Pro(专有模型)得分 66.4/100;Qwen3-Omni-Instruct(开源模型)得分 51.2/100。
- 当前模型普遍能理解用户输入,但经常给出错误或不完整回答。
- 典型失败模式包括:对视觉提示(如手势)理解不足、多轮交互中不能保持历史上下文、无法等到目标事件出现后再回答(延迟响应能力不足)。
- 这些结果说明,全模态模型要在真实场景中担任可靠的实时引导助手仍有很大改进空间。
为什么重要
该基准针对的是 Omni-LLM 评测中静态离线数据无法覆盖动态交互的瓶颈,把关注点从“被动理解视频”转向“主动引导用户完成任务”。它给出了一种可操作的评测框架,并用 100 分制的统一分数比较专有与开源模型,便于后续模型迭代追踪进展。
与既有脉络的关系
与 MedPRESS 同属多轮交互行为评估,但 MedPRESS 聚焦医疗对话中的谄媚风险,OmniAssistBench 则面向通用全模态视频助手;与 Inter-X++ 关注多模态人-人交互分析与生成不同,OmniAssistBench 不评估交互序列的生成/感知,而是评估模型在实时引导任务中的助手能力。本条目的增量信息是提出了一种“逆向工程网络视频 + 预定义引导路线”的评测思路,并给出当前代表性模型的量化得分。
局限与不确定性
- 源材料未给出数据集规模(视频数量、任务数量、多轮轮次等),需待核实。
- 未披露完整的模型评测清单、评分细则以及人工验证方式,需待核实。
- 通过逆向工程网络视频模拟的交互是否能完全代表真实人机交互,材料没有提供效度验证,需待核实。
- 摘要只公开了 Gemini-3-Pro 和 Qwen3-Omni-Instruct 的得分,其他模型表现未知。
可用于图书/PPT/简报的角度
- 从“看懂视频”到“陪用户完成任务”:全模态大模型评测的新维度。
- 真实交互数据稀缺时,如何用现有网络视频“反向制造”多轮交互基准。
- 得分最高的模型也只有 66.4/100:全模态助手离“可靠助理”还有多远?
- 交互中“什么时候该说”比“说什么”更难:延迟响应与上下文保持是当前模型短板。
原始材料
- 标题:OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
- arXiv ID:2608.21360v1
- 作者:Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan
- 提交/更新时间:2026-08-21T17:59:52Z
- 主要类别:cs.CV
- URL:https://arxiv.org/abs/2608.21360v1
- PDF:https://arxiv.org/pdf/2608.21360v1