知识卡片:GLM-5.3 与 GLM-5.3 Flash 在 DeepSWE 上的成本、编码与路由对比
英文标题:GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing
英文关键词:GLM-5.3, GLM-5.3 Flash, DeepSWE, distillation, cost, routing
原始来源:https://www.together.ai/blog/glm-5-3-vs-glm-5-3-flash-on-deepswe-cost-coding-and-routing
一句话结论
在 DeepSWE 基准上,GLM-5.3 Flash 以约 1/17 的 rollout 成本,实现了 pass@1 只比完整版 GLM-5.3 低 5.6 个百分点、pass@4 只低 2.6 个百分点的成绩;若采用“Flash 先跑、失败后升级到完整 GLM-5.3”的级联路由,可以每任务 1.70 美元解决 80.9% 的任务,超过完整版单独使用的 69.0% 和 3.99 美元。
事件概述或研究问题
- Together AI 于 2026-08-28 发布对比测试,评估 GLM-5.3 与其蒸馏版本 GLM-5.3 Flash 在 DeepSWE 上的表现。
- 实验覆盖 113 个 DeepSWE 任务,每个配置 4 次试验,两个模型均设为 max effort,共 900 次 rollout,其中完整版 452 次、Flash 448 次。
- 核心研究问题:Flash 版本便宜 17 倍,但质量到底损失了多少?这种损失是“能力下降”还是“稳定性下降”?能否通过重试和路由补回来?
方法/产品要点
- GLM-5.3 是完整开源权重模型;GLM-5.3 Flash 是其蒸馏兄弟模型,rollout 价格约为完整版的 1/17。
- 测试基准:DeepSWE v1,用于评估模型在多类软件工程任务和多种编程语言上的能力。
- 任务分类:将每个任务按 4 次尝试的结果分为 wall(0/4 通过)、flaky(部分通过)、solid(4/4 通过),以追踪蒸馏损失来自哪个部分。
- 级联路由:先运行 GLM-5.3 Flash,只有验证器拒绝答案时,再升级到完整 GLM-5.3。
- 产品状态:GLM-5.3 Flash 已在 Together AI 上线,美国托管,支持 function calling、JSON mode 与 OpenAI 兼容 API。
主要结果或产业意义
- 单次尝试:GLM-5.3 的 pass@1 为 69.0%,Flash 为 63.4%,差距 5.6 个百分点;pass@2 差距缩小到 4 个百分点;pass@4 分别为 87.6% 和 85.0%,差距只剩 2.6 个百分点。
- 成本:完整版每 rollout 3.99 美元,每 100 美元解决 17 个任务;Flash 每 rollout 0.24 美元,每 100 美元解决 264 个任务。
- 蒸馏损失主要是“一致性”,不是“能力”:完整版 48 个 solid 任务中,没有任何一个在 Flash 中变成完全无法解决;完整版能解决的 99 个任务中,Flash 仍能解决 93 个,覆盖率保留 94%。
- Flash 的真正短板是“无法用更多思考换成功”:在 flaky 任务中,更长运行是成功运行的比例,完整版为 61%,Flash 为 46%,低于抛硬币水平。
- 领域分化:Flash 在并发与持久化(+8)、Python(+5)、数据建模(+4)、协议(+3)上反超完整版;在 JavaScript、query/config、stateful reactivity、Rust、语言内部机制上落后。
- 唯一被点名的真实退步:Flash 在 6.9% 的 rollout 中会破坏已经通过的基线测试,完整版为 4.4%,因此需要用回归测试门禁来兜底。
- 级联路由结果:Flash 先跑、失败后升级完整版,解决率 80.9%,每任务成本 1.70 美元;两个模型每任务相关性为 0.61,并集覆盖 102/113 个任务,即 90.3%。
为什么重要
- 这项测试说明“蒸馏变小”不等于“均匀变笨”:Flash 保留了大量解题能力,但失去了单次尝试的稳定性和把额外计算转化为成功结果的搜索能力。
- 对工程选型有直接含义:成本敏感、吞吐优先或 best-of-k 工作流,默认选 Flash;JavaScript/query 较重或需要首枪可靠性的场景,选完整 GLM-5.3。
- 即使打算用完整版,也可以先用 Flash 做前置过滤,以不到一半的价格获得更高整体解决率。
与既有脉络的关系
- 已有相关卡片记录了 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 在 DeepSWE 上的跨模型级联路由;本条是同一基准上的另一组对比,但属于同一模型家族内部的蒸馏版本对比。
- 增量信息在于:同族蒸馏让“能力 vs 一致性”的归因更干净;同时给出了同族级联策略的成绩——80.9% 解决率、1.70 美元/任务,进一步支持“低成本模型先跑、高成本模型兜底”在 DeepSWE 上的通用性。
局限与不确定性
- 所有数据来自 Together AI 的本次实验设置,作者也说明结果可能与其他公开 GLM-5.3 vs GLM-5.3 Flash scorecard 不同。
- Flash 在 JavaScript 上的落后基于仅 5 个任务的样本,且由单个任务驱动,应视为方向性结论,而非稳定结论。
- 级联路由的收益依赖一个能正确拒绝错误答案的 verifier;如果验证器质量不足,实际解决率和成本会变化。
- 成本数据是本次运行的平均 rollout 成本,实际价格可能因用量、上下文长度和供应商定价而不同。
- 模型具体参数、蒸馏方法、硬件配置等未在材料中说明,待核实。
可用于图书/PPT/简报的角度
- 一句话版本:Flash 用 1/17 成本只换来 pass@1 落后 5.6 点、pass@4 落后 2.6 点,级联路由能以 1.70 美元/任务做到 80.9%。
- “蒸馏削掉的是稳定性,不是能力”——这是比单纯看 pass@1 更准确的模型蒸馏叙事。
- 决策建议:默认用 Flash,重试补稳定性;对 JavaScript/query 重任务用完整版;任何 Flash 输出都要过回归测试。
- 警示角度:低成本模型也有隐藏成本——它比完整版更可能破坏已经可以工作的代码。
原始材料
- 英文标题:GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing
- 作者:Zain Hasan, Shobhit Dixit
- 发布日期:2026-08-28
- 来源:https://www.together.ai/blog/glm-5-3-vs-glm-5-3-flash-on-deepswe-cost-coding-and-routing
- 原文简介:We ran 900 DeepSWE rollouts on GLM-5.3 and GLM-5.3 Flash. Flash gives up 5.6 points of pass@1 at 17x lower cost, and only 2.6 points at pass@4.