Gemini 3.6 Flash:基准测试、定价、可用性和变化
Google 于 2026 年 7 月 21 日发布了 Gemini 3.6 Flash,这是其 Flash 系列中新的通用之星。该模型针对编码、多模态分析、计算机使用代理和多步骤工具工作流,同时与 Gemini 3.5 Flash 相比,减少了输出 token 的消耗并降低了输出 token 的价格。
醒目指标非常可观:Google 在 DeepSWE 上报告了 49%,在 MLE-Bench 上报告了 63.9%,在 OSWorld-Verified 上报告了 83.0%。标准 API 定价为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。本指南将解释基准测试、定价层级、可用性、API 更改、支持的工具以及迁移的实际原因。
主要收获
- 发布: Gemini 3.6 Flash 于 2026 年 7 月 21 日全面上市。
- 模型 ID: 稳定的 Gemini API 模型代码是
gemini-3.6-flash。 - 定价: 标准定价为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。
- 效率: Google 报告称,在 Artificial Analysis Index 上,Gemini 3.6 Flash 的输出 token 比 Gemini 3.5 Flash 少 17%,在 DeepSWE 上则少 65%。
- 上下文: 该模型可接受高达 1,048,576 个输入 token,并产生高达 65,536 个输出 token。
- 可用性: 可通过 Gemini API、Google AI Studio、Android Studio、Google Antigravity、Gemini Enterprise 和 Gemini 应用程序使用。
Gemini 3.6 Flash 概览
| 类别 | Gemini 3.6 Flash |
|---|---|
| 主要角色 | 用于代理和多模态工作流的快速通用推理模型 |
| 稳定的 API 标识符 | gemini-3.6-flash |
| 默认思考级别 | 中等 |
| 输入模态 | 文本、图像、视频、音频和 PDF |
| 输出模态 | 文本 |
| 生产状态 | 普遍可用 |
什么是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是 Google 专注于速度和效率的 Flash 系列中的专有模型。Google 将其定位为面向实际的代理工作流:代码生成、函数调用、计算机使用、空间推理、文档分析以及可能需要多步才能生成最终响应的工作流。
该模型不仅仅是一个重命名的 3.5 版本。Google 表示,它根据开发人员关于冗长、不必要的代码编辑和消耗额外推理 token 及工具调用的执行循环的反馈进行了调整。因此,预期的改进是双重的:提高任务质量并减少实现结果所需的工作。
For developers starting with Google’s platform, Zerlo’s 获取 Gemini API 密钥指南 解释了账户和 Google AI Studio 的设置。API 请求中要选择的模型名称是 gemini-3.6-flash。
与 Gemini 3.5 Flash 有何不同?
| 领域 | Gemini 3.6 Flash 变化 | 实际效果 |
|---|---|---|
| 编码 | 更高的精度,更少的意外文件更改和更少的调试循环 | 更适合迁移和迭代代理开发 |
| Token 效率 | 输出 token、推理步骤、轮次和工具调用更少 | 每完成一项任务的成本可能更低,而不仅仅是按 token 计算 |
| 多模态推理 | 改进了图表解释、蓝图转换和多元素布局理解 | 更强的文档、视觉和空间工作流 |
| 计算机使用 | 原生工具支持,目前在模型文档中标记为预览版 | 可为支持的浏览器和界面自动化工作流提供支持 |
| 输出定价 | 每百万 token 7.50 美元,而 Gemini 3.5 Flash 为 9.00 美元 | 标准输出 token 率降低了 16.7% |
| API 配置 | temperature、top_p 和 top_k 等采样参数已弃用 |
现有集成需要进行配置审查,而不仅仅是更改模型 ID |
前端工作有一个细微之处。Google 的迁移文档称,Gemini 3.6 Flash 在执行更改之前倾向于以编程方式检查项目。这可以提高复杂任务的正确性,但对于简单的视觉编辑可能会增加探索性步骤。Google 还指出,人类评估员有时更喜欢早期版本的模型在样式方面,因此明确的设计说明仍然很有价值。
Gemini 3.6 Flash 基准测试
Google 的发布数据显示,在编码、机器学习工程、知识工作和计算机使用任务方面,与 Gemini 3.5 Flash 相比有所提高。这些基准测试使用不同的评分方法,因此其值不应平均计算为一个总体百分比。每个结果都证明了特定类型的工作负载。
| 基准测试 | 测试内容 | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 | 长期软件工程代理 | 37% | 49% |
| MLE-Bench | 机器学习工程和研究任务 | 49.7% | 63.9% |
| OSWorld-Verified | 真实桌面环境中的计算机使用 | 78.4% | 83.0% |
| GDPval-AA v2 | 知识工作任务质量 | 1349 | 1421 |

来源: blog.google
发布数据中增长最显著的是长期软件工程和机器学习工程,同时计算机使用性能也有所提高。
如何解读这些基准测试结果
- DeepSWE 对自主编码很重要: 它比简短的独立编码问题与存储库级别的代码相关的程度更高。
- MLE-Bench 衡量的是专家工作流: 该结果对数据科学和机器学习代理有用,但不是通用聊天机器人分数。
- OSWorld-Verified 测试操作: 更高的分数支持了计算机使用的说法,尽管相关的 API 功能仍被标记为预览版。
- GDPval-AA 不是百分比: 它是一个比较性知识工作评估,应在其基准测试方法论的框架内解读。
Token 效率是基准测试故事的一部分
原始任务分数并未显示达到结果所需的 token 或工具调用数量。Google 表示,在 Artificial Analysis Intelligence Index 上,Gemini 3.6 Flash 生成的输出 token 比 Gemini 3.5 Flash 少 17%。在 DeepSWE 上,该公司报告的减少幅度更大:每项任务的平均输出 token 从约 276,000 个减少到 97,000 个,约减少 65%。
Artificial Analysis 独立列出了 Gemini 3.6 Flash 的高思考配置,其智能指数得分为 50,上下文窗口为一百万 token。评估人员更新提示、工具和模型版本时,基准测试结果可能会发生变化,因此使用代表性任务进行生产测试仍然比排行榜位置更重要。

来源: blog.google
减少输出 token 的使用可以降低长期代理循环的成本,尤其是在模型在完成之前反复进行推理、编辑文件和调用工具时。
Gemini 3.6 Flash 定价
Google 的标准发布价格为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。输入价格与 Gemini 3.5 Flash 相同,而输出价格从 9.00 美元降至 7.50 美元。Google Cloud 的 Agent Platform 定价页面显示,缓存输入价格为每百万 token 0.15 美元。
| 消费选项 | 每 100 万个输入 token | 每 100 万个输出 token | 典型用途 |
|---|---|---|---|
| 标准 | $1.50 | $7.50 | 常规交互式和生产 API 流量 |
| 优先 | $2.70 | $13.50 | 为优先推理容量支付更多费用的工作负载 |
| Flex 或 Batch | $0.75 | $3.75 | 容忍延迟或异步处理 |
标准价格计算示例
| 月度使用量示例 | 输入成本 | 输出成本 | 估算总计 |
|---|---|---|---|
| 1000 万个输入 token 和 100 万个输出 token | $15.00 | $7.50 | $22.50 |
| 5000 万个输入 token 和 500 万个输出 token | $75.00 | $37.50 | $112.50 |
| 1 亿个输入 token 和 2000 万个输出 token | $150.00 | $150.00 | $300.00 |
这些示例仅涵盖模型 token。搜索 grounding、计算机使用、代码执行、外部服务和其他平台组件可能会增加成本或延迟。因此,最有用的内部指标是每成功完成一项任务的成本(包括重试和工具调用),而不是仅列出的 token 率。
可用性:在哪里可以使用 Gemini 3.6 Flash?
Gemini 3.6 Flash 从发布之日起即可在 Google 的消费者、开发者和企业服务中使用。具体使用限制、区域访问和模型选择控制因产品、订阅和账户而异。
| 用户组 | 可用渠道 | 重要细节 |
|---|---|---|
| 开发者 | Gemini API、Google AI Studio 和 Android Studio | 使用稳定的模型 ID gemini-3.6-flash |
| 代理开发者 | Google Antigravity 和 Gemini Managed Agents | Google 将 3.6 Flash 设置为 Antigravity 管理代理的默认模型 |
| 企业 | Gemini Enterprise Agent Platform 和 Gemini Enterprise app | 适用企业计费、治理和区域设置 |
| 普通用户 | Gemini 应用程序 | 访问和使用限制可能取决于账户和订阅级别 |

来源: blog.google
AI Studio 的日志和数据集可以帮助团队在更改生产部署之前比较模型行为、检查失败的请求并构建可重复的评估集。
Gemini 3.6 Flash 不应与 Gemini 3.5 Flash-Lite 或 Gemini 3.5 Flash Cyber 混淆。Flash-Lite 是成本较低、吞吐量较高的选项。Flash Cyber 是专为政府和受信任的合作伙伴设计的专用安全模型,通过有限访问的 CodeMender 试点提供,而不是 3.6 Flash 的通用替代品。
上下文窗口、输入和支持的工具
| 规格 | Gemini 3.6 Flash |
|---|---|
| 输入类型 | 文本、图像、视频、音频和 PDF |
| 输出类型 | 文本 |
| 输入 token 限制 | 1,048,576 token |
| 输出 token 限制 | 65,536 token |
| 支持的功能 | 缓存、代码执行、文件搜索、函数调用、搜索 grounding、地图 grounding、结构化输出、思考和 URL 上下文 |
| 计算机使用 | 支持(预览版) |
| 消费选项 | 标准、Batch API、Flex 推理和 Priority 推理 |
| 不支持 | 图像生成、音频生成和 Live API |
一百万 token 的上下文窗口对于大型文档集、代码库、转录稿和多模态记录非常有用。它不能保证在长 prompt 的每个位置都能完美回忆,发送最大上下文可能会增加成本和延迟。检索、文件搜索和 prompt 分段可能仍能产生更可靠的生产系统。

来源: blog.google
文件搜索是 Gemini 3.6 Flash 支持的内置工具之一,它可以将响应 grounding 在索引的项目文档中,而不是将每个文件直接放入每个 prompt 中。
哪些内置工具最重要?
- 文件搜索: 可用于检索内部文档、手册和知识库。
- 代码执行: 允许模型通过编程方式计算、转换数据并验证答案的一部分。
- 函数调用: 将模型连接到应用程序特定的操作和数据源。
- Google 搜索和地图 grounding: 在支持的区域添加当前或位置感知信息。
- 计算机使用: 支持界面自动化,但仍是预览功能,需要谨慎的权限和验证。
Gemini 3.6 Flash 迁移清单
- 在测试环境中将目标模型 ID 更改为
gemini-3.6-flash。 - 删除已弃用的采样字段,例如
temperature、top_p和top_k。 - 用适当的
thinking_level替换旧的思考预算设置。 - 删除预填的模型轮次并审查多轮状态处理。
- 重新测试函数调用、工具响应和结构化输出模式。
- 将任务成功率、延迟、输入 token、输出 token、轮次和工具调用与当前生产模型进行比较。
- 使用分阶段推出,并保留回滚路径,直到代表性工作负载稳定。
是否应从 Gemini 3.5 Flash 迁移?
当应用程序依赖于编码代理、多步工具使用、计算机交互、文档分析或视觉和空间推理时,Gemini 3.6 Flash 是逻辑的迁移目标。较低的输出价格和减少的循环倾向对于可能在完成一项用户请求之前反复调用模型的代理尤其重要。
| 工作负载 | 当前最佳方向 | 原因 |
|---|---|---|
| 存储库级别编码代理 | 测试 Gemini 3.6 Flash | 提高编码精度并减少执行循环 |
| 多模态文档和图表分析 | 测试 Gemini 3.6 Flash | 更强的多模态和知识工作发布结果 |
| 高吞吐量分类或提取 | 与 Gemini 3.5 Flash-Lite 比较 | Flash-Lite 专为更低成本的吞吐量而设计 |
| 图像生成 | 选择其他 Gemini 模型 | Gemini 3.6 Flash 仅生成文本输出 |
| 实时语音应用程序 | 使用兼容 Live API 的模型 | Gemini 3.6 Flash 不支持 Live API |
| 稳定的遗留管道,没有质量问题 | 迁移前进行基准测试 | 更改仅在实际工作负载的质量、延迟或成本得到改善时才有意义 |
有关更广泛的模型选择视角,Zerlo 的 Gemini 与 Claude 技术比较 解释了 Google 生态系统与 Anthropic 模型之间的不同权衡。关注可重用助手而非 API 部署的用户也可能发现 Gemini Gems 指南 很有用。
常见问题解答
Gemini 3.6 Flash 何时发布?
Google 于 2026 年 7 月 21 日宣布并发布了 Gemini 3.6 Flash。它已通过开发者、企业和消费者 Gemini 产品全面上市。
Gemini 3.6 Flash API 模型名称是什么?
稳定的模型 ID 是 gemini-3.6-flash。Google 的模型文档将其列为稳定版本,而不是仅限预览的别名。
Gemini 3.6 Flash 的成本是多少?
标准定价为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。Google Cloud 还列出了更低的 Flex 或 Batch 费率和更高的 Priority 费率。工具和其他平台服务可能会收取额外费用。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 便宜吗?
是的,对于标准输出 token 而言。输入价格仍为每百万 token 1.50 美元,而输出价格从每百万 token 9.00 美元降至 7.50 美元。Google 在其评估中还报告了输出 token 使用量的减少。
Gemini 3.6 Flash 支持图像、音频和视频吗?
它接受文本、图像、视频、音频和 PDF 文档作为输入。其输出是文本。它不支持图像生成、音频生成或 Live API。
Gemini 3.6 Flash 在 Gemini 应用程序中可用吗?
是的。Google 将 Gemini 应用程序列为发布渠道之一。特定于账户的限制、区域部署详情和模型选择控制可能仍会因情况而异。
Gemini 3.6 Flash 支持计算机使用吗?
是的,但 Google 在模型文档中将计算机使用标记为预览功能。生产系统应限制权限,验证操作,并为重要操作保留人工确认。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更好吗?
Google 的已发布评估显示,在编码、机器学习工程、知识工作和计算机使用方面得分更高,同时输出 token 用量更低。实际优势取决于工作负载,因此团队应在更改生产流量之前运行代表性测试。
底线
Gemini 3.6 Flash 是一项有意义的、以效率为重点的升级,而不是一次性的版本更改。它提高了 Google 在代理编码、机器学习工程、知识工作和计算机使用方面的已发布结果,同时将标准输出 token 价格从每百万 token 9.00 美元降至 7.50 美元。其最强大的论据不仅仅是每个 token 的成本更低,而是许多多步任务可能需要更少的 token、轮次和工具调用。
开发者应将其视为 Gemini 3.5 Flash 工作负载的主要迁移候选者,特别是那些依赖代码、工具或多模态推理的工作负载。Flash-Lite 仍然更适合成本最低的大吞吐量执行,而 Gemini 3.6 Flash 不适合图像生成、原生音频输出或 Live API 使用。基准测试的改进前景广阔,但生产决策仍应基于任务特定的准确性、延迟、安全性和总成本。