Google 一次性发布了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及面向网络安全的 Gemini 3.5 Flash Cyber。其中 Gemini 3.6 Flash 已全面开放,普通用户和开发者都可以直接使用。
这次升级的核心不是"参数更大",而是让 Agent 少绕路、少调用工具、少消耗 Token,同时把代码生成、文档处理和电脑操作做得更稳。如果你用 AI 写代码、跑自动化,或者在做需要频繁调用 API 的产品,这次更新会直接影响使用成本。
17% 的 Token 节省意味着什么
根据 Google 公布的数据,在 Artificial Analysis Index 测试中,Gemini 3.6 Flash 比上一代 3.5 Flash 少用了 17% 的输出 Token;在 DeepSWE 等部分测试中,降幅最高达到 65%。
多步骤任务中需要的推理步骤、对话轮次和工具调用也更少,Agent 执行复杂任务时来回试错和陷入循环的概率会降低。
价格变化同样直接:
- 输入:每百万 Token 1.5 美元,与 3.5 Flash 持平
- 输出:每百万 Token 7.5 美元,上一代为 9 美元
输入价格不变,输出价格降了约 16.7%。加上模型本身少输出 Token,长期跑 Agent 或批量任务时,单次任务总成本会进一步下降。

跑分提升:集中在能直接干活的场景
Gemini 3.6 Flash 的升级方向很明确:写代码、操作电脑、处理长文档和理解图表。具体数据如下:
- DeepSWE v1.1(长周期软件工程):从 37% 提升到 49%
- MLE-Bench(机器学习工程):从 49.7% 提升到 63.9%
- GDPVal-AA v2(知识工作):从 1349 分提高到 1421 分
- OSWorld-Verified(Computer Use 成功率):从 78.4% 提高到 83%
- 100 万 Token 长上下文测试:从 26.6% 提升到 54.0%
苏米注:Computer Use 现已成为 Gemini API 和 Gemini Enterprise 的内置工具,可用于网页和软件界面的自动化操作。83% 的成功率还做不到完全放手,但已经能承担规则明确、失败后可复核的重复操作。
长上下文仍然支持约 100 万 Token 输入和 6.5 万 Token 输出。面对大型项目代码、合同、财报或大量会议资料,新模型保留和调用关键信息的能力有明显提升。
不过 Google 也提醒:在人工评测中,旧模型在部分视觉布局和 UI 风格上更受偏爱。如果用它生成网页,提示词里需要写清楚配色、字体、间距和参考风格。

另外两款模型
Gemini 3.5 Flash-Lite面向高并发、低成本任务,每秒可输出约 350 个 Token,API 价格为每百万输入 0.3 美元、输出 2.5 美元。文档提取、票据识别、批量分类、结构化 JSON 生成等任务适合交给它跑。复杂判断由 3.6 Flash 负责,重复且量大的子任务交给 Flash-Lite,是一种更经济的搭配。
Gemini 3.5 Flash Cyber是专门寻找和修复代码漏洞的安全模型,配合 CodeMender 使用,目前仅向政府和可信合作伙伴开放试点。
Google 确认 Gemini 3.5 Pro 正在与合作伙伴测试,Gemini 4 也已开始预训练。
职场人的四个提效场景
- 代码维护:老项目迁移、跨框架重构、排查 Bug。3.6 Flash 在这类测试中循环次数和无关修改更少。
- 文档工作:合同审阅、财报分析、图表解读和报告起草,可以一次放入更多资料。
- 电脑自动化:配合 Computer Use 读取界面、点击按钮、填写表单、跨网页执行任务。
- 多 Agent 工作流:主 Agent 拆任务,子 Agent 分别搜索、提取、生成和检查。3.6 Flash 与 Flash-Lite 组合可把判断任务和跑量任务拆开计费。
做 AI 产品的人,先算这三笔账
如果你在做知识库、报告生成、内容工具或轻量 SaaS,这次更新值得重新测一次成本:
- 单次任务成本:记录同一任务在旧模型和 3.6 Flash 上的输入/输出 Token、工具调用次数和成功率。只比较 API 单价容易忽略反复重试产生的费用。
- 人工复核时间:模型写得快却需要人花半小时改错,省下的 Token 没有意义。挑 20 个真实任务盲测,记录哪些结果能直接使用。
- 任务分层:需要判断、编码和多模态分析的步骤交给 3.6 Flash;分类、提取、格式转换等高频任务交给 3.5 Flash-Lite。
很多 AI 小产品的利润,最后就是从这种模型路由里抠出来的。
现在怎么用
普通用户可以在 Gemini App 中体验。开发者可以在 Google AI Studio、Gemini API 和 Android Studio 中调用,模型代码为:gemini-3.6-flash。
踩坑记录:不建议上线后直接全量切换。先用一组真实任务做 A/B 测试,至少记录四项数据:完成率、总 Token、执行时间和人工修改时间。
Gemini 3.6 Flash 最有吸引力的地方很清晰:输出单价下降 16.7%,执行任务时又少消耗一部分 Token。调用次数越多,这个变化越容易反映在成本和利润里。