AI消息速览

通过模型融合超越前沿性能

事件日期 2026-07-07 · 产业观察 · 已接受

事件日期2026-07-07
信息日期2026-07-07
入库日期2026-07-07
通道产业观察
状态已接受
来源openrouter.ai

知识卡片:通过模型融合超越前沿性能

一句话结论

OpenRouter 推出的 Fusion 工具通过并行调用多个预算模型并融合其输出,在 100 项复杂研究任务上超越了 GPT-5.5 和 Claude Opus 4.8,且成本显著降低。

事件概述或研究问题

2026年6月12日,OpenRouter 宣布推出 Fusion——一种通过单个 API 调用并行调用多个模型、再使用评判模型(judge model)融合各模型输出结果的工具。为验证其效果,团队采用 Perplexity AI 设计的 DRACO 基准(100 项深度研究任务,涵盖学术、金融、法律、医学等 10 个领域),对比单个前沿模型与不同模型面板的得分。

方法/产品要点

  • Fusion 调用方式:用户发送提示词后,Fusion 将任务并行分发给面板中的多个模型(每个模型开启网络搜索和网页抓取),评判模型读取所有回复并生成结构化分析(共识点、矛盾点、独特见解等),再由调用模型基于此分析撰写最终答案。全部流程在服务器端完成。
  • 可定制面板:可通过 model: "openrouter/fusion" 使用默认面板,或自定义面板(如指定参与模型和评判模型)。
  • 防止作弊:由于测试中发现模型会搜索到 DRACO 评分标准(无意污染),团队通过 OpenRouter 的服务器工具排除了评分标准所在的域名,确保评测公正。
  • 防止模型自我作弊:通过排除托管评分标准的位置,所有模型统一应用。
  • 工具集统一:所有模型(单个和面板)均使用相同的三个服务器工具:web_search、web_fetch、bash,确保比较公平。

主要结果或产业意义

  • 超越前沿的融合性能:Fable 5 + GPT-5.5 融合(由 Opus 4.8 合成)得分 69.0%,超过所有单个模型(Fable 5 得分 65.3%)。Opus 4.8 + GPT-5.5 融合得分 67.6%。
  • 预算面板超越前沿:Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 面板得分 64.7%,超过 GPT-5.5(60.0%)和 Opus 4.8(58.8%),且成本仅为 Fable 5 的 50%。
  • 自身融合提升:将 Opus 4.8 与自己配对(两个相同模型)并合成,得分 65.5%,比单独 Opus 4.8(58.8%)高 6.7 个点,说明合成步骤本身(而非仅模型多样性)带来显著收益。
  • 产业意义:表明通过融合多个(尤其是低成本)模型可以接近甚至超越最昂贵的前沿模型,为提升 AI 推理能力提供了一条性价比更高的路径。

为什么重要

  • 展示了“模型多样性”类似团队协作的增益:将多个不同视角整合到复杂问题中,能产生更优质的结果。
  • 提供了一种无需等待单一模型不断迭代即可获得超越前沿性能的实用方法——只需一次 API 调用即可获得融合后的答案。
  • 对预算敏感的用户有吸引力:用更低的成本获得与前沿模型相当甚至更好的深度研究能力。

局限与不确定性

  • 基准局限性:DRACO 仅评估文本、英文交互,任务集静态,可能无法推广到未来的深度研究应用;绝对得分受评判模型选择影响(论文报告不同评判模型导致 10–25 分差异),但相对排名稳定。
  • Fable 5 内容过滤:由于 Fable 5 的内容过滤器阻止了 100 项任务中的 7 项执行,其得分基于 93 项任务,与其他模型(完成全部 100 项)的直接比较不完全公平。
  • 融合速度:当调用 Fusion 时,处理时间通常为标准调用的 2–3 倍(多模型并行等待 + 合成步骤)。
  • 编码场景:Fusion 不是编码模型的直接替代品,更适合用于需要深度研究的架构决策等问题,编码模型可选择性调用 Fusion。
  • 融合自身模型:虽然自身融合有提升,但不足以超越多样化模型组合,效果因模型而异。
  • DeepSeek V4 Pro 表现:待核实其高得分是否与工具调用预算限制有关(Opus 4.8 可能需要更多工具调用才能发挥全部能力)。

可用于图书/PPT/简报的角度

  • “预算模型联盟”崛起:多个廉价模型联合起来击败昂贵巨头——AI 领域的“小国联军”策略。
  • 合成智能 vs 单体智能:强调融合带来的系统级智能超越任何单一模型。
  • 从“调教一个模型”到“管理一群模型”:未来 AI 应用设计范式的转变。
  • 数据可视化:可制作条形图对比各模型及面板的 DRACO 得分,突出预算面板的性价比(成本 vs 性能散点图)。
  • 技术原理简化版:类比“团队头脑风暴 + 组长汇总”,解释 Fusion 的工作流。

原始材料

  • URL: https://openrouter.ai/blog/announcements/fusion-beats-frontier
  • 标题: Surpassing Frontier Performance with Fusion — OpenRouter Blog
  • 描述: A panel of budget models, fused through OpenRouter, outscored GPT-5.5 and Claude Opus 4.8 on 100 complex research tasks.
  • 发布日期: June 12, 2026(含6月14日更新FAQ)