知识卡片:阿里首次开源2.4万亿参数旗舰模型Qwen3.8
English Title: Qwen3.8: Alibaba's First Open-Source Max-Level Flagship Model with 2.4 Trillion Parameters
English Keywords: Qwen3.8; open-source; agent foundation model; 2.4T parameters; long-horizon agentic tasks
一句话结论: 阿里首次开源Max级旗舰模型Qwen3.8-2.4T-A95B权重,总参数2.4万亿、每Token激活950亿,主打长周期自主智能体任务;在PaperBench、OSWorld-Verified、CAD基准上超过Fable 5,但在TerminalBench、SWE-bench Pro等任务上仍落后于GPT-5.6 Sol与Fable 5。
事件概述
- 腾讯研究院AI速递(20260814)报道,阿里首次开源Max级旗舰模型,开放Qwen3.8-2.4T-A95B权重。
- 该模型与Grok 4.6、DeepSeek V4 Pro同夜发布,当晚的大模型发布均突出Agent能力。
- 命名中的“2.4T-A95B”表示总参数2.4万亿、每Token激活950亿;材料未明确说明具体架构细节。
方法/产品要点
- 总参数:2.4万亿;每Token激活:950亿(A95B)。
- 上下文长度:原生支持26万Token,可扩展至101万。
- 产品定位:主打长周期自主智能体(agent)任务。
- 开源形式:开放权重。
- 国内API价格:每百万Token输入12元、输出36元。
- 量化生态:Unsloth AI用1-bit量化将模型从4.9TB压缩至397GB,缩减约91%。
主要结果或产业意义
- 基准领先项:PaperBench 93.0分、OSWorld-Verified 86.1分居首、CAD基准91.5分,均超过Fable 5。
- 相对短板:TerminalBench、SWE-bench Pro等复杂软件工程任务仍落后于GPT-5.6 Sol与Fable 5。
- 产业意义:首次将Max级旗舰模型开源,配合国内API定价和量化压缩,为大规模Agent底座模型提供新的获取方式;与Grok 4.6、DeepSeek V4 Pro同夜发布,显示头部模型厂商在Agent能力上进入密集竞争期。
为什么重要
- 这是阿里首次开源“Max级”旗舰模型,开放权重意味着研究者和开发者可以在2.4T规模模型上做微调、推理和二次开发。
- Agent能力不能只看单一基准:Qwen3.8在PaperBench、OSWorld-Verified、CAD等任务上领先,却在终端操作和软件工程基准上落后,说明需要分场景评估。
- 1-bit量化将模型从4.9TB压缩至397GB,若可用性可控,可能大幅降低超大模型部署门槛。
与既有脉络的关系
- 已有相关卡片覆盖SIMA 2、Together Inference Engine、Cursor Design Mode等Agent应用和推理优化;本卡片的增量信息是阿里开源大规模旗舰模型本身,标志着Agent能力竞赛正在从产品端延伸到底层模型权重层面。
局限与不确定性
- 本材料为腾讯研究院AI速递的转述摘要,未附官方技术报告、评测配置或模型卡;“Fable 5”“GPT-5.6 Sol”等对标模型的具体版本和评测环境待核实。
- 1-bit量化后模型的实际精度、推理速度、任务表现变化未披露;397GB部署所需硬件配置待核实。
- 开源许可证、商用范围、权重下载渠道、API服务区域与稳定性待核实。
- 国内API价格可能为发布初期定价,后续是否调整及限流条件待核实。
可用于图书/PPT/简报的角度
- 大模型“同夜军备竞赛”:Grok 4.6、DeepSeek V4 Pro、Qwen3.8同日发布,共同指向Agent能力。
- 开源旗舰路线:阿里选择开放2.4T权重,对比闭源商业模型的差异化策略。
- Agent评测分化:GUI/文档/CAD类任务领先,但终端/软件工程任务落后,说明Agent需分维度讨论。
- 超大模型压缩:1-bit量化把4.9TB压到397GB,为本地化部署和成本讨论提供案例素材。
原始材料
- 原始来源:腾讯研究院AI速递 20260814
- 原文标题:腾讯研究院AI速递 20260814
- URL: https://m.sohu.com/a/1062532068_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334