知识卡片:谷歌发布Gemini 3.6 Flash遭差评,Gemini 3.5 Pro宣布延期
英文标题:Google Releases Worst-Ever AI Model? Gemini 3.6 Flash Panned, Gemini 3.5 Pro Delayed
英文关键词:Google DeepMind, Gemini 3.6 Flash, Gemini 3.5 Pro, model delay, AI quality
原始来源:https://aiera.com.cn/2026/07/23/other/admin/105508/%e8%b0%b7%e6%ad%8c%e3%80%8c%e5%8f%b2%e4%b8%8a%e6%9c%80%e5%b7%ae%e3%80%8dai%e6%a8%a1%e5%9e%8b%e5%8f%91%e5%b8%83%ef%bc%81-gemini-3-5-pro%e5%bb%b6%e6%9c%9f
一句话结论
谷歌DeepMind于2026年7月23日发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款模型,其中3.6 Flash因前端生成和空间推理表现极差被用户评为“史上最差”;同时谷歌宣布Gemini 3.5 Pro延期,并已启动“有史以来规模最大的预训练项目”Gemini 4。
事件概述
2026年7月23日,谷歌DeepMind在Vertex AI上线了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。早期实测显示,Gemini 3.6 Flash在前端界面代码生成和空间关系理解方面表现严重退步,被开发者社区戏称为“史上最差”。用户发现该模型实际知识截止日期仅到2025年1月,远低于声称的2026年3月。同时,谷歌正式确认原计划发布的Gemini 3.5 Pro尚未准备好,已转向启动Gemini 4的预训练,据CNBC报道这是谷歌“有史以来规模最大的预训练项目”。
方法/产品要点
- Gemini 3.6 Flash:定位“性价比”模型,但实测前端代码能力在CursorBench上甚至不如Cursor Composer 2.5,在第三方综合测评Artificial Analysis上与Gemini 3.5 Flash得分相同,被其他竞品(如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5等)超越。
- Gemini 3.5 Flash-Lite:主打高速,每秒输出350个token,但成本高于竞品且效果更差,被批评“快速给出错误答案等于浪费用户时间”。
- Gemini 3.5 Flash Cyber:面向网络安全场景发布,具体性能表现待核实。
- Gemini 3.5 Pro:延期,未给出具体发布时间线。
- Gemini 4:已开始预训练,谷歌声称“对取得的进展非常振奋”,规模为“有史以来最大”。
主要结果或产业意义
- 口碑崩塌:Gemini 3.6 Flash在开发者社区引发严重负面反馈,测评显示其界面生成代码逻辑混乱、空间推理准确率较3.5 Flash退步,被部分用户视为“未完成的模型”。
- 竞争失利:在代码、综合评测等多个维度上,Gemini 3.6 Flash不敌Claude Fable 5、GPT-5.6 Sol、Meta Muse Spark 1.1、GLM-5.2等竞品,仅在视觉和上下文基准测试中仍保持领先。
- 战略转向:谷歌放弃按原计划发布3.5 Pro,转而全力投入规模更大的Gemini 4预训练,反映出内部资源重新分配和对下一代模型的急切布局。
为什么重要
- 这是谷歌AI模型历史上罕见的公开口碑事故,暴露了“版本号游戏”和“官僚主义指标狂热”可能牺牲模型真实效用的风险。
- Gemini 3.5 Pro延期标志着谷歌在该产品线上遭遇重大开发瓶颈,与其数月前泄露的“绝密”(参考2026-07-07相关卡片)形成鲜明反差,增量信息是谷歌实际并未准备好该模型,已经跳过它直接预训练下一代。
- 引发行业对AI大模型“赶超 vs 质量”平衡的讨论:在算力紧缺背景下发布逻辑混乱的模型是否属于资源浪费。
局限与不确定性
- 报告中关于Gemini 3.6 Flash的负面评价主要来自早期用户测试和社交媒体截图,官方未公布完整第三方评测数据,部分批评可能因未开启“high thinking”模式而产生偏差。
- Gemini 3.5 Flash-Lite和Cyber版本的具体性能指标、成本对比、实际部署案例尚未披露。
- Gemini 4的预训练进展、目标参数、预计发布时间均未公布,仅能从第三方报道中确认其规模为“有史以来最大”。
- 谷歌官方博客中是否承认3.6 Flash的缺陷以及是否计划快速修复,原文未提及。
可用于图书/PPT/简报的角度
- 案例研究:AI产品发布节奏与质量控制的冲突——以谷歌Gemini 3.6 Flash为例。
- 行业趋势:大模型竞赛进入“幸存者偏差”阶段?版本号升级与实际能力脱节的警示。
- 企业战略:当“预训练下一代”成为掩盖当前产品失败的借口时,组织官僚主义如何影响模型开发。
- PPT标题建议:“版本号游戏”的代价:谷歌“史上最差”模型背后的战略转向