OmniAssistBench 是一个面向全模态大语言模型(Omni-LLM)的助手式交互基准,通过将现有网络视频逆向工程为多轮引导任务,要求模型在动态交互中结合视觉状态、用户目标和先验知识进行实时引导;当前最强的专有模型 Gemini-3-Pro 仅得到 66.4/100,开源模型 Qwen3-Omni-Instruct 得到 51.2/100,说明模型…
传统视频理解评测是被动的、基于静态离线数据集的;但实时视频助手需要主动感知环境、理解用户目标并调用先验知识来提供帮助,而且模型的回答会反过来改变用户接下来的动作,因此静态数据集无法覆盖这种动态性。OmniAssistBench 的提出即是针对这一评测瓶颈。