AI消息速览

DeepSeek V4 Pro 0813 vs GPT-5.6 Sol:DeepSWE成本、编码与路由

事件日期 2026-08-18 · 产业观察 · 已接受

事件日期2026-08-18
信息日期2026-08-18
入库日期2026-08-19
通道产业观察
状态已接受
来源Together AI 博客

知识卡片:DeepSeek V4 Pro 0813 vs GPT-5.6 Sol:DeepSWE成本、编码与路由

英文标题:DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing
英文关键词:DeepSeek V4 Pro 0813; GPT-5.6 Sol; DeepSWE; routing; cascade; pass@k; cost; coding
原始来源:https://www.together.ai/blog/deepseek-v4-pro-0813-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing

一句话结论

在 DeepSWE 软件工程基准的 904 次 rollout 中,GPT-5.6 Sol 单次正确率领先(pass@1 72.7% vs 62.8%),但成本是 DeepSeek V4 Pro 0813 的 35 倍;若先跑 DeepSeek V4 Pro 0813、失败后再升级到 Sol 的级联策略,能以每任务 3.35 美元解决 83.0% 的任务,超过 Sol 单独使用(72.7%、8.37 美元)和完美单次路由 oracle(80.8%)。

事件概述或研究问题

Together AI 于 2026 年 8 月 18 日发表了一篇对比测试,研究在 DeepSWE(一个覆盖多种任务类型和编程语言的软件工程能力基准)上,成本极低的 DeepSeek V4 Pro 0813 与旗舰级 GPT-5.6 Sol 各自的准确率、成本、失败模式,以及两者组合路由的效果。测试在全部 113 个 DeepSWE 任务上各跑 4 次,共 904 次 rollout(每个模型 452 次),全部数据来自公开的逐次记录。

方法/产品要点

  • 模型:DeepSeek V4 Pro 0813(max)vs GPT-5.6 Sol(max),均通过 Together AI 运行。
  • 测试规模:113 个 DeepSWE 任务 × 4 次尝试 × 2 模型 = 904 rollouts。
  • 成本:Pro 每次 rollout 0.24 美元,Sol 每次 8.37 美元,差距约 35 倍。
  • 级联路由:先运行 Pro,若测试套件拒绝其输出,再升级到 Sol。该策略在测试中达到 83.0% 准确率,每任务 3.35 美元。
  • Pro 的其他特点:1.05M 上下文、函数调用和 JSON 模式、OpenAI 兼容 API、运行于美国基础设施。

主要结果或产业意义

  • 单次尝试(pass@1):Sol 72.7% vs Pro 62.8%;尝试次数增加后差距缩小并反转:pass@2 为 81.0% vs 78.5%,pass@4 为 85.8% vs 88.5%。
  • 价值指标:每 100 美元,Pro 解决约 260 个任务,Sol 解决约 9 个任务。
  • 速度与稳定性:Sol 中位耗时 17 分钟、53 步、输出 59k tokens;Pro 中位耗时 35 分钟、146 步、输出 101k tokens。Sol 有 61 个任务四次全过,Pro 只有 35 个。
  • 失败模式:Sol 的失败中有 20% 会破坏仓库已有测试套件,Pro 为 11%,即 Pro 失败时通常基线完整。
  • 任务域与语言:Sol 赢得 8 个任务域中的 6 个(1 个平局),在数据建模与序列化上达 92%,领先 Pro 28 个百分点;Pro 仅赢得 stateful reactivity(66 vs 64)。语言方面,Sol 赢 Python、Go、TypeScript、JavaScript,Pro 赢 Rust(65 vs 60)。
  • 模型差异与覆盖:两模型逐任务相关性为 0.54;共同解决 90 个任务,Pro 独有 10 个,Sol 独有 7 个,联合覆盖 107/113(94.7%)。Pro 没有独自扫清任何 Sol 完全失败的任务,而 Sol 有两个任务四次全过而 Pro 从未解决。
  • 路由价值:级联策略(83.0%/3.35 美元)甚至超过完美一次路由 oracle(80.8%),因为两次独立尝试优于一次完美选择。领先模型不影响准确率,但 Pro-first 成本远低(3.35 vs 8.44 美元)。

为什么重要

这是对“便宜模型 vs 旗舰模型”问题的一个具体量化回答:单看 pass@1 时 Sol 明显更强,但在允许多次尝试或通过路由组合时,低价模型的覆盖面和成本优势足以改变选择。该结果给出了一种可落地的生产策略——用 Pro 作为前端清掉大部分任务,只在确实需要时把困难余量交给 Sol,从而以低于 Sol 单独成本一半的价格获得超过 Sol 的准确率。相比已有相关卡片(如 DeepSeek V4 Flash 低价、GPT-5.6 Sol 改进),本条提供了这两条脉络的直接交锋数据,并引入了“级联路由”这一增量结论。

局限与不确定性

  • 所有数字仅基于本次 904 次 rollout,材料也指出其结果可能与其他公开的 DeepSeek V4 Pro 0813 vs GPT-5.6 Sol 分数卡不同。
  • 成本为 Together AI 运行价格,可能随定价调整而变化;测试在 Together AI 基础设施上进行,作者来自 Together AI,潜在利益关系待核实。
  • DeepSWE 是一个软件工程基准,不能保证推广到所有真实编码任务;级联策略依赖可自动验证的测试套件,若无法验证结果,该策略不适用。
  • 部分细节(如“Sol 是 precision flagship”“Pro 是 value outlier”等表述)为作者归纳,不构成独立事实。

可用于图书/PPT/简报的角度

  • 成本与单次准确率的权衡:35 倍价格差买到了什么?
  • pass@k 的意义:为什么“给四次机会”会改变模型排名。
  • 级联路由设计:如何用便宜模型过滤、用昂贵模型兜底,并超过“完美路由器”。
  • 失败模式分析:便宜模型反而更安全(回归率 11% vs 20%)的反直觉发现。
  • 按编程语言选模型:Rust 栈可以选 Pro,Python/Go 栈选 Sol。

与既有脉络的关系

本条是以下是三个既有卡片脉络的交叉更新:DeepSeek V4 Flash 低价引发价值讨论(本测试中的 Pro 0813 延续了 DeepSeek 系低价路线);ChatGPT 改进 GPT-5.6 Sol(本测试给出 Sol 在编码基准上的精确数据);Artificial Analysis 智能指数更新(本测试直接比较两模型在 DeepSWE 的实测表现)。增量信息是:在 DeepSWE 上,Pro-first + Sol-on-failure 的级联策略达到 83.0% 准确率、每任务 3.35 美元,优于任何单一模型及完美单次路由。

原始材料

  • 标题:DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing
  • 作者:Zain Hasan, Shobhit Dixit
  • 发布:2026-08-18
  • 来源:Together AI Blog(https://www.together.ai/blog/deepseek-v4-pro-0813-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing)
  • 关键数据表(节选):pass@1:Sol 72.7% vs Pro 62.8%;pass@4:Pro 88.5% vs Sol 85.8%;成本/rollout:Pro $0.24 vs Sol $8.37;级联:83.0% at $3.35;Oracle 1-shot router:80.8%。