Google 一次性更新了三款 Gemini Flash 模型:面向日常和开发者任务的 3.6 Flash、追求吞吐和低成本的 3.5 Flash-Lite,以及专门找漏洞、补漏洞的 3.5 Flash Cyber。
简单说:主力模型要少花 Token,批量任务要压成本,安全模型则必须控制开放边界。

三块拼图,各管一段
- Gemini 3.6 Flash:新的"主力模型",继续做编码、知识工作、多模态和 Agent 任务,重点优化输出长度、推理步骤和工具调用次数。API 价格:输入 1.50 美元/输出 7.50 美元(每百万 Token)。
- Gemini 3.5 Flash-Lite:面向文档处理、搜索、翻译、分类等高频任务,约 350 输出 Token/秒。API 价格:输入 0.30 美元/输出 2.50 美元。
- Gemini 3.5 Flash Cyber:安全专项模型,配合 CodeMender 用多个安全 Agent 协作发现、验证并修复软件漏洞。仅通过 CodeMender 向政府和可信伙伴做限量试点。
两款主力模型都支持文本、图片、音频和视频输入,上下文窗口最高 100 万 Token,输出最高 64K Token。API 模型名分别为 gemini-3.6-flash 和 gemini-3.5-flash-lite。
3.6 Flash 先把冗余步骤砍掉
完成同一件事,尽量少走弯路。根据 Artificial Analysis 数据,3.6 Flash 比 3.5 Flash 平均少用 17% 的输出 Token,在 DeepSWE 中最高能少 65%。同时减少不必要的推理步骤、工具调用和代码修改循环。
- DeepSWE v1.1:从 37% → 49%
- MLE-Bench:从 49.7% → 63.9%
- OSWorld-Verified:从 78.4% → 83.0%
- GDPval-AA v2:从 1349 → 1421

Google 的卖点其实很朴素:单价降一点(输出从 9 美元降到 7.50 美元),Token 再少一点。对长期运行 Agent 的团队来说,这两者叠加,账单变化会很明显。
Flash-Lite 管吞吐,Cyber 管安全
3.5 Flash-Lite 适合跑几十万次的高频任务。官方基准里,Terminal-Bench 2.1 从 31% 提到 54%,长上下文 GDM-MRCR v2 从 60.1% 提到 72.2%,OSWorld-Verified 达到 74%。

3.5 Flash Cyber 基于 3.5 Flash 做安全专项训练。Big Sleep 评测从普通 3.5 Flash 的 36%、3.6 Flash 的 42%,提升到 72%。它被限制在政府和可信伙伴的 CodeMender 试点里,不对外开放——一个会自动找漏洞、写补丁的模型,同样具有明显的双重用途风险。


早期实测:亮眼但分歧并存
发布后几小时,已经有人把 3.6 Flash 接进工作流:
- Gordon Cassie:Token 减少 37%,整体耗时减少 60%
- Michael Guo:延迟从 73 秒降到 34 秒,Token 从 112,421 降到 68,483,任务准确率保持 10/10
负面反馈也很具体。计算生物学研究者 Serafim Batzoglou 在 induction benchmark 上测到,3.6 Flash 正确率略低于 3.5 Flash。开发者 Gatien 的几组测试也显示,新版在部分任务中不如 Flash Preview。社区评测图中,3.6 Flash 在这项特定推理任务上得到 7.8% 的正确率,低于 3.5 Flash 的 10.9%。
苏米注:官方基准和社区测试都不等于你自己的工作负载。迁移前先用自己的 Prompt、工具和数据跑一遍,再决定分多少流量。

迁移建议
如果你主要做编码 Agent、计算机操作、多模态文档分析,3.6 Flash 值得拿现有任务做一轮 A/B 测试,重点记录四项数据:
- 成功率
- 总 Token
- 工具调用次数
- 端到端耗时
批量抽取、翻译、分类、搜索优先试 Flash-Lite。Cyber 版和绝大多数开发者无关,短期内不用等 API。