产品发布 · 小互解读

Google 一口气发布三款 Gemini 模型,唯独没有等了很久的 3.5 Pro

三款全在 Flash 线上:主力款少写三分之二的字,最便宜那档的文本输出价反而涨了三分之二,第三款只给政府和可信伙伴。
一分钟速览
  • Google 7 月 21 日一次发三款 Gemini,全在 Flash 这条线上:主力款 3.6 Flash、3.5 系列里最快最省的 3.5 Flash-Lite、专门找漏洞的 3.5 Flash Cyber
  • 等了很久的 3.5 Pro 没来。旗舰 Pro 线至今停在 3.1 Pro Preview,发布页只给了一句「正在与合作伙伴测试」,同时宣布 Gemini 4 已经开始预训练。
  • 主力款 3.6 Flash 的卖点是少说话:同一批软件工程任务,输出从 27.6 万 token 降到 9.7 万,做对率反而从 37% 升到 49%,输出价还从 9 美元降到 7.5 美元。
  • 3.5 Flash-Lite 每秒吐 350 个 token,是 3.5 系列里最快的,但输出价比上一代涨了 66.7%,发布页只说「性价比强」。
  • 3.5 Flash Cyber 不公开卖,只给政府和可信伙伴。它在 CyberGym 上拿 83.2%,在图里五个方案中排第四。
本文数据来自 Google 自家发布页与 DeepMind 博客,跑分为官方自测;CyberGym 的竞品成绩据 DeepMind 博客脚注取自各厂商自报。价格与版本状态经 Gemini API 官方定价页核对。
这次发布了什么

一口气发了三款,大家等的那款没来

Google 在 2026 年 7 月 21 日一次发布了三款 Gemini 模型。三款全部属于 Flash 这条便宜快速的产品线,一款旗舰都没有。

主力款 · 今天可用
Gemini 3.6 Flash
日常干活的那一档换代。编程、知识工作、多模态全面提升,主打的是把输出的字数砍下来。
输入 $1.50输出 $7.50API / AI Studio / Gemini 应用
3.5 系列最快 · 今天可用
Gemini 3.5 Flash-Lite
低延迟和高吞吐那一档,发布页点名的场景是 agentic 搜索和文档处理。
输入 $0.30输出 $2.50每秒 350 个 token
专用款 · 买不到
Gemini 3.5 Flash Cyber
基于 3.5 Flash 微调,只做一件事:找出软件漏洞、验证、写补丁。不公开发售。
即将限量试点仅政府与可信伙伴经 CodeMender(Google 的代码安全 Agent)提供
缺席
Gemini 3.5 Pro
发布页提了它两次:开头说正在与合作伙伴测试、准备好就广泛提供,结尾说期待很快发布。没有日期,没有跑分,没有价格。
合作伙伴测试中

Pro 线目前最新的还是 3.1 Pro Preview

查 Gemini API 官方定价页,Pro 线挂着的最新型号是 gemini-3.1-pro-preview,还是预览版。这次上新的 3.6 Flash 与 3.5 Flash-Lite 都是正式版。

Flash 线 · 主力档
3 Flash Preview 3.5 Flash 3.6 Flash · 今天
Flash-Lite 线 · 最便宜档
2.5 Flash-Lite 3.1 Flash-Lite 3.5 Flash-Lite · 今天
Pro 线 · 旗舰档
3.1 Pro Preview · 至今最新 3.5 Pro · 缺席
Pro 线最新的公开型号仍是 3.1 Pro Preview,处于预览状态。3.5 Pro 未随本次发布推出。
下一代
Gemini 4 · 已开始预训练

发布页在末尾还提了下一代的进度:

我们已经启动了迄今为止最雄心勃勃的一次预训练,目标是 Gemini 4,进展令人兴奋。 Google Blog,2026-07-21(原文:We have started our most ambitious pre-training run yet, for Gemini 4)
官方演示

八段 Demo Lab 演示,两款可用模型实际跑起来的样子

发布页在正文之外挂了一组 Demo Lab 演示视频,展示两款可用模型在真实工具里跑出来的效果。

3.6 Flash 的四段

解析财务数据和会议记录
在 AI Studio 上用 Managed Agents,比 3.5 Flash 更高效也更准确地解析和分析财务数据与转录文本。
Google AI Studio
代码迁移,两个模型并排跑
在 Antigravity 上用多 Agent 编排执行代码迁移,比 3.5 Flash 延迟更低、质量更高。
Google Antigravity
现做一个自己的创作工具
在 Gemini 应用的 canvas 里,从零做出一个给 3D 工作流用的照片纹理提取器。
Gemini 应用 · canvas
从概念到可交互原型
在 Antigravity 上配合 tldraw 离线编辑器做出可交互的主题工作室,凭的是它很强的视觉理解能力。
Google Antigravity

3.5 Flash-Lite 的四段

从海量电商数据里提取产品特征
从一个庞大的电商数据集里提取产品特征并做综合。
高吞吐批处理
一口气出 25 个网页设计方案
3.6 Flash 当主 Agent 派活,3.5 Flash-Lite 负责量产,瞬间生成 25 个各不相同、可以直接点进去看的设计方案。
两款模型协同
大批量的收据识别与翻译
大规模地做收据分析与翻译。
高吞吐批处理
快速做一个能玩的游戏
一次生成多个玩法方案,再一轮轮迭代,直接把游戏做出来。
快速迭代
这八段演示由 Google 拍摄发布,属于官方展示素材。中文说明按官方给每段视频标注的原始说明翻译;其中「收据分析与翻译」一段官方只给了标题、没有说明文字。
主力款

3.6 Flash 的卖点是少说话,同一批任务少写三分之二的字

跑同一批长周期软件工程任务,上一代 3.5 Flash 平均要吐 27.6 万个 token 才收工,3.6 Flash 只吐 9.7 万。少说了近三分之二的话,做对的比例反而从 37% 升到 49%。

这两组数字来自官方发布的两张图,考的是同一个评测 DeepSWE v1.1。它测的是那种需要模型连续干很久的软件工程活:读懂一个真实代码库、定位问题、改代码、跑测试、再根据结果继续改。

DeepSWE v1.1 · 同一个评测的两个指标
单个任务的平均输出量 (越短越省)
3.5 Flash
276K
3.6 Flash
97K
砍掉 64.9%,剩下三分之一多一点。
同一批任务的通过率 (越高越好)
3.5 Flash
37%
3.6 Flash
49%
涨了 12 个百分点。
在一个 OSWorld verified 任务(走 API)里,3.6 Flash 比 3.5 Flash 的 token 效率更好、话更少。来源:Google Blog 视频原始说明
3.6 Flash 平均输出 token 对比图
左:DeepSWE v1.1 上平均输出 token 从 276K 降到 97K。右:Artificial Analysis 智能指数那批题上从 28K 降到 23K。来源:Google Blog

Google 给出的两个降幅口径不一样:按 Artificial Analysis 指数是减少 17%,在「某些评测上,比如 Datacurve 出品的 DeepSWE」写的是「最高可达 65%」。官方对机制给了两句说明:完成多步任务用的推理步数和工具调用次数都变少了;精度更高,多余的代码改动更少、执行循环也更少。

输出比输入贵五倍,所以少写等于省钱

你发给模型的内容算输入,模型吐回来的内容算输出,两边分开计价。Gemini API 定价页上,3.6 Flash 两边的价差是这样:

输入
$1.50
每百万 token
你发给它的内容
输出
$7.50
每百万 token
它吐回来的内容(是输入价的 5 倍)

定价页在输出价那一栏标了「including thinking tokens」,模型的思考过程也按输出计费。而 agentic 工作流要让模型自己分步骤干活:读文件、调工具、看返回结果、再决定下一步,多步下来累积的输出量就是账单。

同一个任务,token 是这样一步步累积出来的 每一格 = 模型自己走完一步:想一遍、写一遍计划、调一次工具 3.5 Flash 276K 推理步数与工具调用次数更多 3.6 Flash 97K Google 称步数与工具调用都变少 格数与长度为示意,用于说明累积方式,不代表实际步数。

价格:输出降了 16.7%,另有两档没写进发布页

发布页写的是「每个输出 token 的成本更低」,并给出 3.6 Flash 的价格:输入 1.50 美元、输出 7.50 美元。对照 Gemini API 定价页,3.5 Flash 的输入价同样是 1.50 美元,输出价是 9.00 美元,也就是输出端降了 16.7%。

另外两档发布页没提:不着急要结果的任务可以走批处理,价格减半;重复发送的长上下文命中缓存后,按每百万 token 0.15 美元计费,是输入价的十分之一。

$9.0 → $7.5
每百万输出 token,3.5 Flash → 3.6 Flash(输入价 1.50 不变)
$0.75 / $3.75
批处理档的输入 / 输出价,正常价的一半
$0.15
缓存命中价,每百万 token
$1.00
缓存存储费,每百万 token 每小时
为 Figma Make 评估模型时,我们要的是质量、速度和成本之间的平衡。Gemini 3.6 Flash 正好落在那个最佳平衡点上,让我们能快得多地探索和迭代原型,同时保住设计的质量。 Matt Colyer,Figma 产品总监(Google Blog 引用)

Hebbia 和 Harvey 这两家客户也被点名,说它在文档解析、图表与数据分析、报告起草这类多模态知识工作上尤其能打。

成绩

3.6 Flash 在四项评测上都越过了上一代旗舰 3.1 Pro

官方那张四联柱状图里,最左边浅色那根是 Gemini 3.1 Pro,也就是上面提到的、Pro 线至今最新的那个预览版。发布页正文没有展开这一列。

Gemini 3.6 Flash 四项 agentic 评测柱状图
四项 agentic 评测,每组三根柱子分别是 3.1 Pro、3.5 Flash、3.6 Flash。最右边深蓝的 3.6 Flash 四项全部最高。来源:Google Blog
评测考什么3.1 Pro3.5 Flash3.6 Flash
DeepSWE v1.1长周期软件工程:读真实代码库、改代码、跑测试12%37%49%
MLE-Bench机器学习研究(原文口径 ML Research)42.6%49.7%63.9%
GDPVal-AA v2真实职业里的日常工作任务,算的是 Elo 分不是百分比96513491421
OSWorld-Verified电脑操作:在真实系统里点界面、开软件、完成任务76.2%78.4%83.0%

GDPVal-AA v2 那一行是 Elo 分,不是百分比。Artificial Analysis 对这一项的说明是「agentic 真实工作任务,(Elo−500)/2000」。

Artificial Analysis 给 3.6 Flash(high 思考档)的智能指数是 50 分,这套指数由 9 项评测构成。

最便宜那档

3.5 Flash-Lite 是 3.5 系列里最快的,但价格比上一代涨了

第二款 Gemini 3.5 Flash-Lite 的定位是低延迟和高吞吐,发布页点名的场景是 agentic 搜索和文档处理。Google 引用 Artificial Analysis 的数据称,它每秒吐 350 个输出 token,是 3.5 系列里最快的。

官方录的延迟对比:同一个高频任务,3.5 Flash-Lite 明显比 3.5 Flash 先出结果。来源:Google Blog
3.5 Flash-Lite 对比 3.1 Flash-Lite 的两项评测
对比上一代 3.1 Flash-Lite。左:Terminal-bench 2.1 从 31.0% 涨到 54.0%,考的是在终端里靠命令行完成任务。右:GDPVal-AA v2 从 642 涨到 1140(Elo 分)。来源:Google Blog

官方还提了一项图上没有的:长上下文检索 GDM-MRCR v2 从 60.1% 涨到 72.2%,考的是能不能在极长的材料里准确翻出被问到的那几处。

3.5 Flash-Lite 对比 3 Flash 的两项评测
对比更早的 3 Flash。左:SWE-Bench Pro(Public)49.6% 对 54.2%。右:OSWorld-Verified 65.1% 对 74.0%。官方据此说,原本跑在 2.5 Flash 和 3 Flash 上的活都可以换成它。来源:Google Blog

发布页没提的那件事:它比上一代贵

发布页对价格的说法是「定价 0.3 / 2.5 美元,质量显著优于 3.1 Flash-Lite,性价比很强」。这句话里少了一个对照:3.1 Flash-Lite 卖多少钱。查官方定价页补上:

3.1 Flash-Lite3.5 Flash-Lite变化
输入价(文本 / 图像 / 视频)$0.25$0.30涨 20%
输出价$1.50$2.50涨 66.7%
输入价(音频)$0.50$0.30降 40%
Terminal-bench 2.131.0%54.0%涨 23 个百分点
GDPVal-AA v2(Elo)6421140涨 498 分
价格对照

文本输出价涨了三分之二,音频输入价反过来降了四成。发布页全程用的说法是「性价比强」,没有提绝对价格的变化。

它另一个卖点是同一个模型能调思考档位。跑高频任务时挂到 minimal 或 low 档,追求低延迟低成本;碰上要多步拆解的子 Agent 负载再调高档位。在所有思考档位上,它都显著优于 3.1 Flash-Lite。computer use 也成了它的内置工具。

……(前略)Ashler 的 agentic 检索和工具调用任务所需的速度与成本效率。它擅长分析零散的基础设施记录,同时在几百份交付物之间保持上下文,支撑我们的用户去建设下一代电网、交通网络和数据中心。 Connor Goggins,Ashler 联合创始人兼 CTO(Google Blog 引用)

3.5 Flash-Lite 同时在往 Google 搜索里推。

专用款

3.5 Flash Cyber 专门找漏洞,而且不公开卖

第三款 Gemini 3.5 Flash Cyber 基于 3.5 Flash 微调而来,专门做一件事:找出软件里的安全漏洞、验证它真的能被利用、然后写补丁。它每个 token 的价格低于更大的安全模型,且不公开发售。

DeepMind 那篇配套博客给出的背景是:AI 找漏洞的速度已经超过现有系统修补的速度,防守方需要一个高能力、低成本、能大规模铺开的办法。Google 说 Flash Cyber 的每 token 价格低于更大的安全模型。

思路是把一次昂贵调用换成多次便宜调用

找深层漏洞要在巨大的执行路径空间里搜索:同一个函数在不同输入、不同调用顺序下会走出成千上万条路径。DeepMind 博客说,指望调用一次超大模型就把这些路径全想明白是个瓶颈。

Google 的做法是多调它几次。在 CodeMender 这个代码安全 Agent 里,多个 Flash Cyber Agent 各自扫一批代码路径,最后把结果合成一份报告。

输入一个大代码库
成千上万条执行路径
并行扫描多个 Flash Cyber Agent
各自分析一批代码路径
合成汇总成单独一份
高质量报告

DeepMind 博客还提到,随着调用次数往上加,Flash Cyber 仍然在持续发现新的代码路径和漏洞。因为便宜,这套东西可以塞进高频扫描、上线前检查、每次代码提交都过一遍的流水线里。

CyberGym 的完整排名

CyberGym 五个方案的成绩对比柱状图
CyberGym 成绩:深蓝那根是 Gemini 3.5 Flash Cyber in CodeMender(Max 5 model calls)83.2%,在五个方案里排第四。纵轴从 60% 起,不是 0。来源:Google Blog

CyberGym 拿数百个真实软件漏洞来考 AI Agent。发布页对这张图的说法是「达到与前沿相当的水平」,DeepMind 博客的措辞是「面对显著更大的模型时达到有竞争力的表现」。图上五根柱子按高低排出来是这样:

排名方案CyberGym
第 1 名GPT-5.5-Cyber in OpenAI Agent85.6%
第 2 名Mythos 5 in Anthropic Agent83.8%
第 3 名GPT-5.6 Sol in OpenAI Agent83.6%
第 4 名Gemini 3.5 Flash Cyber in CodeMender(最多 5 次模型调用)83.2%
第 5 名Mythos Preview in Anthropic Agent83.1%

它排第四,与第五名相差 0.1 个百分点,与第一名相差 2.4 个百分点。图上给自家这一根标了限定词:最多 5 次模型调用。DeepMind 博客说明,这一成绩是把 CodeMender 配置成对单份最终报告最多调用 5 次得到的,并在正文脚注里写明竞品成绩取自各厂商自报的分数。

站内相关解读
GPT‑5.6 发布了,但好像又没发布
榜单上排第三的 GPT-5.6 Sol,小互解读站在 2026 年 6 月 27 日解读过它那次发布。

V8 引擎那一组:55 对 47 对 36

V8 是 Chrome 的 JavaScript 引擎,DeepMind 博客称它极其复杂。在固定调用次数下,三个模型各自找到的不重复的、经过确认的问题数量:

55
3.5 Flash Cyber 找到的唯一确认问题数
47
主线 3.5 Flash 找到的数量
36
Claude Opus 4.6 找到的数量
10
只有 Flash Cyber 找到、另外两个都漏掉的数量

Google 对「不重复」这个口径的解释是:能力弱的安全模型容易卡在一个循环里,反复报同一个问题,同时漏掉真正关键的漏洞;强的模型撒网更宽,才会找到更多不重复的问题。

另外两组都按一次通过率(pass@1)计分。在 Google Big Sleep 团队独立搭的评测上(专门挑 Chrome、Safari 这种复杂代码库里最难找的严重漏洞),Flash Cyber 明显超过主线的 3.5 Flash 和 3.6 Flash。在 Chrome 生产环境的代码提交扫描流水线上,它比 3.5 Flash 有显著提升;这一组的漏洞从未公开披露过,Google 说这保证了该基准对 Gemini 和竞品都不存在数据污染。来自 Wiz 与 Cloud CISO 安全工程测试方的早期反馈,也确认了它相对主线 3.5 Flash 的能力提升。

DeepMind 博客写明了这两组测试的条件:Google 这边是在关掉安全护栏的状态下做的压力测试;另外在 Chrome 提交扫描那一组里,比 Claude Opus 4.6 更新的竞品版本因为内置的安全护栏拒绝执行任务,所以未列入该图。

实战:两小时挖出可用的攻击链

真实案例

Google Cloud 的漏洞研究团队用 Flash Cyber 排查自家系统。两小时内,它在多个公开 API 里找出了远程代码执行漏洞,又在一个敏感的生产服务里找到内存破坏漏洞。

然后它生成了一个百分之百可靠的远程代码执行利用程序,绕过了 ASLR、W^X 这类标准防护手段(前者每次运行把程序在内存里的位置随机挪动,后者禁止一块内存既可写又可执行)。

装在 CodeMender 里的 Flash Cyber,目前已经在 Google 内部的 Chrome、Android、Cloud、Ads、YouTube 代码库里找漏洞和修漏洞。Google 说它的训练数据有个别人没有的优势:OSV.dev 这个开源漏洞数据库收了超过 70 万条漏洞记录,加上 OSS-Fuzz 超过十年积累的模糊测试结果。按官方的说法,这让模型不必停留在合成出来的练习题上,而是学会操作行业标准工具、读通 Chromium 这种百万行级项目的代码,并独立完成需要连续几个小时深度分析的安全任务。

DeepMind 博客说,考虑到这项技术的攻防两用性质,Google 对部署方式做了有意的安排:不公开发售,接下来会通过 CodeMender 提供给政府和可信伙伴,作为限量试点计划,之后逐步扩大。发布页用的是将来时,目前还没开放。另一边,Google 把 CodeMender 的基础能力通过 Gemini Enterprise Agent Platform 向普通客户开放,用的是常规可用的 Gemini 模型。

怎么用上

现在在哪能用上这两款

3.6 Flash 和 3.5 Flash-Lite 从发布当天起就能用:

  • 开发者:Gemini API,可通过 Google AI Studio 和 Android Studio 接入;3.6 Flash 还进了 Google Antigravity。
  • 企业:Gemini Enterprise Agent Platform;3.6 Flash 同时在 Gemini Enterprise 应用里可选。
  • 普通用户:Gemini 应用里就能选到;3.5 Flash-Lite 正在往 Google 搜索里推。

computer use(让模型直接操作电脑界面)现在通过 Gemini API 和 Gemini Enterprise 成为内置的客户端工具,两款新模型都支持。

安全方面,3.6 Flash 加强了两个方向的防护:化学、生物、放射性、核这一类(缩写 CBRN),以及网络攻击的滥用。Google 说这让模型明显更难被越狱,同时也训练它对正当用途少拒答。两款模型各自有公开的模型卡可以查细节。

🧰 上手卡 · Gemini 3.6 Flash
价格输入 1.50 美元 / 输出 7.50 美元(每百万 token);批处理减半为 0.75 / 3.75;缓存命中 0.15;Google AI Studio 有免费额度
门槛在 Google AI Studio 网页里选中模型就能直接聊,写代码接 Gemini API;3.5 Flash-Lite 在同一处可选
来源
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash CyberGoogle·blog.google·2026-07-21
本站说明
全部图表与视频出自 Google 发布页,其中八段 Demo Lab 演示位于发布页的媒体轮播中。两处内容不来自发布页正文:①3.5 Flash 与 3.1 Flash-Lite 的历史价格、批处理与缓存价、Pro 线版本状态取自 Gemini API 官方定价页 ②Artificial Analysis 智能指数 50 分及其 9 项构成取自该站评测页。CyberGym 排名按图上标注的数字排列。