知识卡片:快手发布KAT-Coder-Pro V2.5,工程能力逼近Opus
一句话结论
快手旗舰级Agentic Coding模型KAT-Coder-Pro V2.5在编码智能体评测中超越Claude Opus 4.8(PinchBench 94.2分 vs Opus),SWE-Bench Pro 65.2分仅次于Opus,并通过AutoBuilder将仓库环境构建成功率从16.5%提升至57.2%,沉淀超10万个可验证环境。
事件概述
快手发布KAT-Coder-Pro V2.5,这是其旗舰级Agentic Coding模型,专注于代码生成与工程任务。实测中,该模型可在34分钟内手搓点球游戏、用约1400行代码复刻《我的世界》,并在1分20秒内闭环定位真实开源库Bug。
方法/产品要点
- 团队使用AutoBuilder将仓库环境构建成功率从16.5%大幅提升至57.2%,并沉淀了超过10万个可验证环境。
- 采用多框架强化学习(multi-framework reinforcement learning)与MOPD蒸馏(MOPD distillation)技术,融合五类专家能力(具体专家类型未在材料中详述,待核实)。
主要结果
- PinchBench得分94.2分,超过Claude Opus 4.8(待核实Opus 4.8是否为Anthropic的Claude Opus系列模型)。
- SWE-Bench Pro得分65.2分,仅次于Claude Opus 4.8,显著领先其他国产模型(具体对比模型列表待核实)。
- 实际任务表现:34分钟手搓点球游戏、1400行代码复刻《我的世界》、1分20秒内定位并修复真实开源库Bug。
为什么重要
- 验证了国产模型在Agentic Coding(智能体编码)领域已逼近国际顶尖闭源模型水平,尤其在工程化任务(如环境构建、全栈代码复刻)上取得突破。
- AutoBuilder方法为编码智能体的环境准备提供了可复用的工程范式,10万+可验证环境为后续模型迭代奠定了数据基础。
- 与已有相关卡片(如SIMA 2、Together Inference Engine编码智能体基准)相比,本条聚焦于快手自研模型在具体编码任务上的端到端表现和工程优化方法,提供了国产模型追赶闭源标杆的最新实证。
局限与不确定性
- 材料未披露模型参数量、训练数据规模、推理成本等关键参数,待核实。
- PinchBench与SWE-Bench Pro的具体评测协议和题目范围未详细说明。
- “逼近Opus”的表述仅基于两项榜单分数,实际复杂软件工程任务(如大规模重构、多仓库协作)的泛化能力尚未验证。
- Opus 4.8的具体版本号和模型来源需进一步确认(材料中简称“Opus 4.8”,推测为Claude Opus系列)。
可用于图书/PPT/简报的角度
- 专属Agentic Coding模型的工程能力量化对比(34分钟点球、1400行《我的世界》复刻)。
- AutoBuilder方法:如何通过自动化环境构建解决编码智能体的落地瓶颈。
- “国产模型 vs Opus”在编码智能体赛道的差距与追赶路径。
原始材料
- 来源:腾讯研究院AI速递 20260715(第4条)
- URL:https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
- 英文标题:KAT-Coder-Pro V2.5 from Kuaishou
- 英文关键词:KAT-Coder-Pro V2.5; Agentic Coding; SWE-Bench Pro; PinchBench; AutoBuilder