AI消息速览

DeepSeek开源V4首个多模态模型,DeepSWE登顶第一

事件日期 2026-09-01 · 产业观察 · 已接受

事件日期2026-09-01
信息日期2026-09-01
入库日期2026-09-01
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:DeepSeek开源V4首个多模态模型,DeepSWE登顶第一

一句话结论

DeepSeek正式开源其V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp;该模型在真实软件工程测试DeepSWE上以59.3%反超Opus-4.8登顶第一,但在部分其他基准上仍落后约10%。

事件概述

腾讯研究院AI速递(2026-09-01)报道,DeepSeek开源了V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp。该模型基于V4-Flash架构,集成视觉模块后持续训练而成;V4系列一个月内更新6次,Harness开发者预览版同步开源迭代。

方法/产品要点

  • 模型名称:DeepSeek-V4-Flash-Vision-Exp,定位为实验性多模态模型。
  • 架构基础:基于V4-Flash架构,集成视觉模块并持续训练(具体训练细节材料未披露)。
  • 开源情况:已正式开源;V4系列一月内更新6次;Harness开发者预览版同步开源迭代(Harness具体功能待核实)。

主要结果

  • 真实软件工程测试DeepSWE:得分59.3%,反超Opus-4.8,登顶第一。
  • 工具调用评测Toolathlon-Verified:得分75.9%,材料称“仅落后0.3%”(对比对象待核实)。
  • 纯文本智能体任务:材料称“5胜1平1负”(具体对比模型与任务集待核实)。
  • 其他基准:在NL2Repo与DSBench-Hard上仍落后约10%(对比对象待核实)。

为什么重要

  • 这是DeepSeek V4系列首次加入视觉能力的开源多模态模型。
  • 开源模型在真实软件工程测试DeepSWE上登顶,显示其在多模态智能体任务上已达领先梯队。
  • 与既有相关卡片相比,本条增量信息在于:DeepSeek V4系列推出首个多模态模型,并提供了DeepSWE、Toolathlon-Verified等基准的具体排名与差距数据。

局限与不确定性

  • 材料未说明DeepSWE、Toolathlon-Verified、NL2Repo、DSBench-Hard的评测集规模、任务环境及对比模型。
  • “纯文本智能体任务5胜1平1负”未列出具体对比对象和任务清单。
  • “落后约10%”和“落后0.3%”的具体对比方不明确,待核实。
  • 模型参数量、训练数据、许可证细节、推理成本等信息均未在材料中提及,待核实。

可用于图书/PPT/简报的角度

  • 开源多模态模型的进度:DeepSeek-V4-Flash-Vision-Exp发布与基准表现。
  • 从DeepSWE登顶看多模态智能体评测:真实软件工程能力成为新焦点。
  • 智能体竞赛格局:DeepSeek、OpenAI、Anthropic等参与者对照快照。

与既有脉络的关系

已有相关卡片包括SIMA 2(通用AI代理)、Cursor Design Mode(视觉提示代理)和Together推理引擎(编码智能体性能)。本条为DeepSeek V4多模态模型的独立新增事实,可补充“多模态智能体在真实软件工程测试中的排名变化”这一时间线节点。

原始材料

  • 来源标题:腾讯研究院AI速递 20260901
  • 原文链接:https://m.sohu.com/a/1070192038_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=3
  • 抓取标题:腾讯研究院AI速递 20260901
  • 英文标题:原文未提供
  • 英文关键词:DeepSeek-V4-Flash-Vision-Exp, DeepSWE, Toolathlon-Verified, NL2Repo, DSBench-Hard, multimodal model, open-source