AI消息速览

GPT-5.6 进入 AWS Kiro:官方降价 20%,账单却少 82%

事件日期 2026-08-29 · 产业观察 · 已接受

事件日期2026-08-29
信息日期2026-08-29
入库日期2026-08-29
通道产业观察
状态已接受
来源新智元

知识卡片:GPT-5.6 进入 AWS Kiro:官方降价 20%,账单却少 82%

一句话结论
OpenAI 与 AWS 在 Kiro 平台上的测试显示,GPT-5.6 Terra 在 Terminal-Bench 2.1 上完成一个成功任务的成本下降约 82%;其中官方价格下调仅 20%,其余降幅来自智能体框架、编排系统和减少失败返工。AI 编程成本竞争正在从“每百万 token 单价”转向“把一个任务做完的总成本”。

英文标题 / 英文关键词

  • 英文标题:原文未提供英文标题(中文标题可理解为:Only a 20% Price Cut, Yet the Bill Drops 80%: GPT-5.6 Enters Claude’s Turf and Recalculates the Coding Bill)
  • 英文关键词:GPT-5.6, AWS Kiro, Terminal-Bench 2.1, coding agents, cost per successful task, model pricing, Claude Code

事件概述或研究问题

  • 2026 年 7 月,OpenAI 的 GPT-5.6 Sol/Terra/Luna 进入 AWS 软件开发智能体平台 Kiro,覆盖 IDE、CLI 和 Web;这是 OpenAI 模型第一次进入 Kiro。
  • 2026 年 8 月 24 日,OpenAI 公布与 AWS 联合测试结果:在 Terminal-Bench 2.1 上,Terra 在 Kiro 中完成一个成功任务的成本降低约 82%。
  • 研究问题:为什么官方价格只降 20%,任务级账单却少了约八成?

方法/产品要点

  • Terminal-Bench 2.1 不是让模型单独答题,而是让模型在终端环境中面对模糊目标,自己规划、调工具、写脚本、处理报错和迭代;因此成绩是“智能体+模型”组合的成绩。
  • OpenAI 把效率来源拆成三层:发起请求/组织上下文的智能体框架、中间调度请求的编排系统、GPU 上的模型本身;具体省钱方向包括更少的 token、更少的工具调用、更少的失败重试和绕路。
  • 模型分工:编码工作流可先用 Sol 做理解和计划,再换 Luna 实施已定义清楚的改动、写测试、跑评估。
  • Kiro 采用 spec-driven 流程:不直接写代码,先把模糊目标拆成需求文档、技术设计和可执行任务清单;代码修改前先让人过目,完成后自动跑测试。
  • GPT-5.6 在 Kiro 中隐藏思维链,用户只看到最终结果;官方称这是预期行为,不影响输出质量。
  • 可用性:三款模型属于渐进式、实验性开放,面向 Pro、Pro+、Pro Max 和 Power 用户;区域为美国弗吉尼亚北部和欧洲法兰克福,支持跨区域推理。

主要结果或产业意义

  • Terminal-Bench 2.1 公开榜单(原文摘录):
配置 准确率 成本
Claude Code + Fable 5 83.8% $552.67
Codex + GPT-5.5 83.1% $2059.19
Codex + GPT-5.6 Terra 78.4% $421.15
Codex + GPT-5.6 Luna 75.7% $241.45
  • 前两行准确率只差 0.7 个百分点,成本却差近 4 倍;同级别分数下,完成任务的成本可以成为新的决胜点。
  • Kiro 官方数据中,Terra 在 Coding Agent Index 上为 77.4 分,仅略高于 Claude Fable 5 的 77.2 分;卖点主要在于“这个分数所对应的价钱”。
  • 定价倍数:7 月 14 日上线时,同样的任务 Sol/Terra/Luna 分别扣 2.4/1.2/0.6 倍;7 月 30 日 OpenAI 调价后,Kiro 将 Luna 调整为 0.1 倍、Terra 为 1.0 倍,Sol 未动(原文未说明倍率基准,待核实)。
  • 产业意义:AWS 的开发智能体平台不再只绑一家模型,OpenAI 与 Claude 并排在同一模型选择器中;评价标准正从“每百万 token 多少钱”变成“让它把这件事做完,我到底要花多少”。

为什么重要

  • 这个案例说明,智能体平台上的“实际账单”由模型能力、框架组织上下文、编排调度、任务拆解和返工成本共同决定,模型 API 单价只占一部分。
  • 对开发者,选模型的问题从“每百万 token 单价”变为“完成一个成功任务的总成本”。
  • 对模型厂商,进入 AWS 等平台等于进入“多模型货架”,既获得渠道,也面临与 Claude 同台比价。
  • 与已有相关卡片的关系:已有卡片分别涉及 NIST AI RMF、Epoch AI 研究趋势和 OpenRouter 博客归档;本条不是重复那些内容,而是一个具体的产业事件,延续“AI 基础设施中间层快速产品化”的观察,并新增“任务级成本核算”这一竞争维度。

局限与不确定性

  • “成本降低约 82%”是 OpenAI 与 AWS 在 Terminal-Bench 2.1 上给出的结果,原文未提供完整实验设计、基线口径和复现方式,普遍性待核实。
  • 表中成本是“配置组合”的结果,不能简单归因于模型本身;框架、上下文组织和工具策略都会影响最终账单。
  • Kiro 内“扣费倍数”的基准、GPT-5.6 的具体 API 单价、隐藏思维链对实际调试的影响,原文均未给出完整信息,待核实。
  • “Fable 5”与 Claude 的具体关系及版本细节,原文未展开,待核实。

可用于图书/PPT/简报的角度

  • AI 编程成本从“token 单价”转向“任务总成本”的案例。
  • 智能体平台如何通过 spec-driven、人工闸门、自动测试、模型分工来省钱。
  • AWS 的多模型策略:平台不绑一家模型,OpenAI 与 Claude 同台竞争。
  • “降本”不只是模型降价,更多来自减少返工、绕路和无效调用。

原始材料

  • 中文标题:只降价20%,账单却少八成!GPT-5.6杀入Claude地盘重算编程账
  • 出处:新智元(AIERA 页面转载),发布于 2026-08-29
  • URL:https://aiera.com.cn/2026/08/29/other/admin/111198/%e5%8f%aa%e9%99%8d%e4%bb%b720%ef%bc%8c%e8%b4%a6%e5%8d%95%e5%8d%b4%e5%b0%91%e5%85%ab%e6%88%90%ef%bc%81gpt-5-6%e6%9d%80%e5%85%a5claude%e5%9c%b0%e7%9b%98%e9%87%8d%e7%ae%97%e7%bc%96%e7%a8%8b%e8%b4%a6
  • 原文内参考链接:https://x.com/OpenAIDevs/status/2091966982015103068 ;https://openai.com/index/gpt-5-6-in-kiro/