知识卡片:DeepSeek上线V4-Flash-Vision-Exp多模态API
英文标题:DeepSeek Launches V4-Flash-Vision-Exp Multimodal API(中文暂译)
英文关键词:DeepSeek; V4-Flash-Vision-Exp; Multimodal API; Vision Agent; Files API
一句话结论
DeepSeek推出实验性多模态视觉理解模型V4-Flash-Vision-Exp:纯文本能力与V4-Flash正式版持平,视觉Agent能力大幅提升、接近Opus-4.8;API按token计费,单张图片最多384 tokens,价格与V4-Flash一致,并开放免费Files API。
事件概述
据“腾讯研究院AI速递 20260824”报道,DeepSeek上线了实验性多模态视觉理解模型V4-Flash-Vision-Exp。该模型属于V4-Flash的视觉扩展版本,重点提升视觉Agent能力,而非替代V4-Flash正式版。
产品要点
- 定位:实验性多模态视觉理解模型,名称含“Exp”。
- 文本能力:纯文本能力与V4-Flash正式版持平。
- 视觉Agent能力:据称大幅跃升,接近Opus-4.8,但原文未说明具体评测基准。
- Agent框架适配:在多种Agent框架下展现良好多模态适配能力。
- 示例场景:定制西藏自驾游PPT生成、开发者网站二次创作、黏土怪物动态特效Demo。
- 计费与输入:API按token计费;单张图片最多384 tokens;价格与V4-Flash一致;支持图文混合输入和三种调用格式。
- Files API:开放免费Files API,支持图片先上传后引用。
主要结果或产业意义
- DeepSeek在V4系列中提供了一条“低切换成本”的多模态Agent路径:开发者可以沿用V4-Flash定价,获得视觉理解和Agent调用能力。
- 单张图片的token最高为384 tokens,便于估算图片输入成本。
- 免费Files API降低了“先上传图片、再在请求中引用”这一工作流的使用门槛。
- 多个实用Demo显示,多模态模型不只用于看图问答,还可被接入Agent流程完成PPT、网页二次创作、动态特效等任务。
为什么重要
这是对已有“DeepSeek上线V4 Pro正式版,强Agent能力”卡片的增量更新:本条不是V4 Pro,而是V4-Flash的视觉实验版本。新增信息主要是视觉能力侧重、图片token成本、价格持平、免费Files API,以及多Agent框架下的实际场景表现。它说明DeepSeek的多模态迭代开始强调“视觉Agent”能力,而非单纯的图文理解。
局限与不确定性
- “接近Opus-4.8”未说明具体基准、测试集和版本,待核实。
- “三种调用格式”具体是什么,原文未展开,待核实。
- “免费Files API”是否有限流、存储期限或文件大小限制,原文未说明,待核实。
- “单张图片最多384 tokens”是计费规则还是模型内部处理规则,原文表述简要,待核实。
- 该模型为实验性版本,后续可能有调整或变化,需以DeepSeek官方文档为准。
与既有脉络的关系
- 已有卡片“DeepSeek上线V4 Pro正式版,强Agent能力”对应的是V4 Pro正式版;本条对应的是V4-Flash-Vision-Exp实验性多模态API,二者不是同一事实。
- 本条可视作DeepSeek V4系列在“视觉Agent”方向上的补充:在正式版之外,用实验性接口快速开放多模态能力。
可用于图书/PPT/简报的角度
- 大模型厂商的“实验性API”策略:正式版与探索版并行。
- 多模态Agent的token经济学:一张图片最高384 tokens。
- 从文本到视觉Agent:DeepSeek V4系列的能力演进。
- 免费Files API的产品设计:先上传、后引用,降低开发者接入成本。
原始材料
- 来源标题:腾讯研究院AI速递 20260824
- URL:https://m.sohu.com/a/1066618305_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4
- Parent digest:腾讯研究院AI速递 20260824
- Parent URL:https://m.sohu.com/a/1066618305_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4