Google 一口气发布三款 Gemini 模型,唯独没有等了很久的 3.5 Pro
- Google 7 月 21 日一次发三款 Gemini,全在 Flash 这条线上:主力款 3.6 Flash、3.5 系列里最快最省的 3.5 Flash-Lite、专门找漏洞的 3.5 Flash Cyber。
- 等了很久的 3.5 Pro 没来。旗舰 Pro 线至今停在 3.1 Pro Preview,发布页只给了一句「正在与合作伙伴测试」,同时宣布 Gemini 4 已经开始预训练。
- 主力款 3.6 Flash 的卖点是少说话:同一批软件工程任务,输出从 27.6 万 token 降到 9.7 万,做对率反而从 37% 升到 49%,输出价还从 9 美元降到 7.5 美元。
- 3.5 Flash-Lite 每秒吐 350 个 token,是 3.5 系列里最快的,但输出价比上一代涨了 66.7%,发布页只说「性价比强」。
- 3.5 Flash Cyber 不公开卖,只给政府和可信伙伴。它在 CyberGym 上拿 83.2%,在图里五个方案中排第四。
一口气发了三款,大家等的那款没来
Google 在 2026 年 7 月 21 日一次发布了三款 Gemini 模型。三款全部属于 Flash 这条便宜快速的产品线,一款旗舰都没有。
Pro 线目前最新的还是 3.1 Pro Preview
查 Gemini API 官方定价页,Pro 线挂着的最新型号是 gemini-3.1-pro-preview,还是预览版。这次上新的 3.6 Flash 与 3.5 Flash-Lite 都是正式版。
发布页在末尾还提了下一代的进度:
我们已经启动了迄今为止最雄心勃勃的一次预训练,目标是 Gemini 4,进展令人兴奋。 Google Blog,2026-07-21(原文:We have started our most ambitious pre-training run yet, for Gemini 4)
八段 Demo Lab 演示,两款可用模型实际跑起来的样子
发布页在正文之外挂了一组 Demo Lab 演示视频,展示两款可用模型在真实工具里跑出来的效果。
3.6 Flash 的四段
3.5 Flash-Lite 的四段
3.6 Flash 的卖点是少说话,同一批任务少写三分之二的字
跑同一批长周期软件工程任务,上一代 3.5 Flash 平均要吐 27.6 万个 token 才收工,3.6 Flash 只吐 9.7 万。少说了近三分之二的话,做对的比例反而从 37% 升到 49%。
这两组数字来自官方发布的两张图,考的是同一个评测 DeepSWE v1.1。它测的是那种需要模型连续干很久的软件工程活:读懂一个真实代码库、定位问题、改代码、跑测试、再根据结果继续改。
Google 给出的两个降幅口径不一样:按 Artificial Analysis 指数是减少 17%,在「某些评测上,比如 Datacurve 出品的 DeepSWE」写的是「最高可达 65%」。官方对机制给了两句说明:完成多步任务用的推理步数和工具调用次数都变少了;精度更高,多余的代码改动更少、执行循环也更少。
输出比输入贵五倍,所以少写等于省钱
你发给模型的内容算输入,模型吐回来的内容算输出,两边分开计价。Gemini API 定价页上,3.6 Flash 两边的价差是这样:
你发给它的内容
它吐回来的内容(是输入价的 5 倍)
定价页在输出价那一栏标了「including thinking tokens」,模型的思考过程也按输出计费。而 agentic 工作流要让模型自己分步骤干活:读文件、调工具、看返回结果、再决定下一步,多步下来累积的输出量就是账单。
价格:输出降了 16.7%,另有两档没写进发布页
发布页写的是「每个输出 token 的成本更低」,并给出 3.6 Flash 的价格:输入 1.50 美元、输出 7.50 美元。对照 Gemini API 定价页,3.5 Flash 的输入价同样是 1.50 美元,输出价是 9.00 美元,也就是输出端降了 16.7%。
另外两档发布页没提:不着急要结果的任务可以走批处理,价格减半;重复发送的长上下文命中缓存后,按每百万 token 0.15 美元计费,是输入价的十分之一。
为 Figma Make 评估模型时,我们要的是质量、速度和成本之间的平衡。Gemini 3.6 Flash 正好落在那个最佳平衡点上,让我们能快得多地探索和迭代原型,同时保住设计的质量。 Matt Colyer,Figma 产品总监(Google Blog 引用)
Hebbia 和 Harvey 这两家客户也被点名,说它在文档解析、图表与数据分析、报告起草这类多模态知识工作上尤其能打。
3.6 Flash 在四项评测上都越过了上一代旗舰 3.1 Pro
官方那张四联柱状图里,最左边浅色那根是 Gemini 3.1 Pro,也就是上面提到的、Pro 线至今最新的那个预览版。发布页正文没有展开这一列。
| 评测 | 考什么 | 3.1 Pro | 3.5 Flash | 3.6 Flash |
|---|---|---|---|---|
| DeepSWE v1.1 | 长周期软件工程:读真实代码库、改代码、跑测试 | 12% | 37% | 49% |
| MLE-Bench | 机器学习研究(原文口径 ML Research) | 42.6% | 49.7% | 63.9% |
| GDPVal-AA v2 | 真实职业里的日常工作任务,算的是 Elo 分不是百分比 | 965 | 1349 | 1421 |
| OSWorld-Verified | 电脑操作:在真实系统里点界面、开软件、完成任务 | 76.2% | 78.4% | 83.0% |
GDPVal-AA v2 那一行是 Elo 分,不是百分比。Artificial Analysis 对这一项的说明是「agentic 真实工作任务,(Elo−500)/2000」。
Artificial Analysis 给 3.6 Flash(high 思考档)的智能指数是 50 分,这套指数由 9 项评测构成。
3.5 Flash-Lite 是 3.5 系列里最快的,但价格比上一代涨了
第二款 Gemini 3.5 Flash-Lite 的定位是低延迟和高吞吐,发布页点名的场景是 agentic 搜索和文档处理。Google 引用 Artificial Analysis 的数据称,它每秒吐 350 个输出 token,是 3.5 系列里最快的。
官方还提了一项图上没有的:长上下文检索 GDM-MRCR v2 从 60.1% 涨到 72.2%,考的是能不能在极长的材料里准确翻出被问到的那几处。
发布页没提的那件事:它比上一代贵
发布页对价格的说法是「定价 0.3 / 2.5 美元,质量显著优于 3.1 Flash-Lite,性价比很强」。这句话里少了一个对照:3.1 Flash-Lite 卖多少钱。查官方定价页补上:
| 3.1 Flash-Lite | 3.5 Flash-Lite | 变化 | |
|---|---|---|---|
| 输入价(文本 / 图像 / 视频) | $0.25 | $0.30 | 涨 20% |
| 输出价 | $1.50 | $2.50 | 涨 66.7% |
| 输入价(音频) | $0.50 | $0.30 | 降 40% |
| Terminal-bench 2.1 | 31.0% | 54.0% | 涨 23 个百分点 |
| GDPVal-AA v2(Elo) | 642 | 1140 | 涨 498 分 |
文本输出价涨了三分之二,音频输入价反过来降了四成。发布页全程用的说法是「性价比强」,没有提绝对价格的变化。
它另一个卖点是同一个模型能调思考档位。跑高频任务时挂到 minimal 或 low 档,追求低延迟低成本;碰上要多步拆解的子 Agent 负载再调高档位。在所有思考档位上,它都显著优于 3.1 Flash-Lite。computer use 也成了它的内置工具。
……(前略)Ashler 的 agentic 检索和工具调用任务所需的速度与成本效率。它擅长分析零散的基础设施记录,同时在几百份交付物之间保持上下文,支撑我们的用户去建设下一代电网、交通网络和数据中心。 Connor Goggins,Ashler 联合创始人兼 CTO(Google Blog 引用)
3.5 Flash-Lite 同时在往 Google 搜索里推。
3.5 Flash Cyber 专门找漏洞,而且不公开卖
第三款 Gemini 3.5 Flash Cyber 基于 3.5 Flash 微调而来,专门做一件事:找出软件里的安全漏洞、验证它真的能被利用、然后写补丁。它每个 token 的价格低于更大的安全模型,且不公开发售。
DeepMind 那篇配套博客给出的背景是:AI 找漏洞的速度已经超过现有系统修补的速度,防守方需要一个高能力、低成本、能大规模铺开的办法。Google 说 Flash Cyber 的每 token 价格低于更大的安全模型。
思路是把一次昂贵调用换成多次便宜调用
找深层漏洞要在巨大的执行路径空间里搜索:同一个函数在不同输入、不同调用顺序下会走出成千上万条路径。DeepMind 博客说,指望调用一次超大模型就把这些路径全想明白是个瓶颈。
Google 的做法是多调它几次。在 CodeMender 这个代码安全 Agent 里,多个 Flash Cyber Agent 各自扫一批代码路径,最后把结果合成一份报告。
成千上万条执行路径
各自分析一批代码路径
高质量报告
DeepMind 博客还提到,随着调用次数往上加,Flash Cyber 仍然在持续发现新的代码路径和漏洞。因为便宜,这套东西可以塞进高频扫描、上线前检查、每次代码提交都过一遍的流水线里。
CyberGym 的完整排名
CyberGym 拿数百个真实软件漏洞来考 AI Agent。发布页对这张图的说法是「达到与前沿相当的水平」,DeepMind 博客的措辞是「面对显著更大的模型时达到有竞争力的表现」。图上五根柱子按高低排出来是这样:
| 排名 | 方案 | CyberGym |
|---|---|---|
| 第 1 名 | GPT-5.5-Cyber in OpenAI Agent | 85.6% |
| 第 2 名 | Mythos 5 in Anthropic Agent | 83.8% |
| 第 3 名 | GPT-5.6 Sol in OpenAI Agent | 83.6% |
| 第 4 名 | Gemini 3.5 Flash Cyber in CodeMender(最多 5 次模型调用) | 83.2% |
| 第 5 名 | Mythos Preview in Anthropic Agent | 83.1% |
它排第四,与第五名相差 0.1 个百分点,与第一名相差 2.4 个百分点。图上给自家这一根标了限定词:最多 5 次模型调用。DeepMind 博客说明,这一成绩是把 CodeMender 配置成对单份最终报告最多调用 5 次得到的,并在正文脚注里写明竞品成绩取自各厂商自报的分数。
V8 引擎那一组:55 对 47 对 36
V8 是 Chrome 的 JavaScript 引擎,DeepMind 博客称它极其复杂。在固定调用次数下,三个模型各自找到的不重复的、经过确认的问题数量:
Google 对「不重复」这个口径的解释是:能力弱的安全模型容易卡在一个循环里,反复报同一个问题,同时漏掉真正关键的漏洞;强的模型撒网更宽,才会找到更多不重复的问题。
另外两组都按一次通过率(pass@1)计分。在 Google Big Sleep 团队独立搭的评测上(专门挑 Chrome、Safari 这种复杂代码库里最难找的严重漏洞),Flash Cyber 明显超过主线的 3.5 Flash 和 3.6 Flash。在 Chrome 生产环境的代码提交扫描流水线上,它比 3.5 Flash 有显著提升;这一组的漏洞从未公开披露过,Google 说这保证了该基准对 Gemini 和竞品都不存在数据污染。来自 Wiz 与 Cloud CISO 安全工程测试方的早期反馈,也确认了它相对主线 3.5 Flash 的能力提升。
实战:两小时挖出可用的攻击链
Google Cloud 的漏洞研究团队用 Flash Cyber 排查自家系统。两小时内,它在多个公开 API 里找出了远程代码执行漏洞,又在一个敏感的生产服务里找到内存破坏漏洞。
然后它生成了一个百分之百可靠的远程代码执行利用程序,绕过了 ASLR、W^X 这类标准防护手段(前者每次运行把程序在内存里的位置随机挪动,后者禁止一块内存既可写又可执行)。
装在 CodeMender 里的 Flash Cyber,目前已经在 Google 内部的 Chrome、Android、Cloud、Ads、YouTube 代码库里找漏洞和修漏洞。Google 说它的训练数据有个别人没有的优势:OSV.dev 这个开源漏洞数据库收了超过 70 万条漏洞记录,加上 OSS-Fuzz 超过十年积累的模糊测试结果。按官方的说法,这让模型不必停留在合成出来的练习题上,而是学会操作行业标准工具、读通 Chromium 这种百万行级项目的代码,并独立完成需要连续几个小时深度分析的安全任务。
DeepMind 博客说,考虑到这项技术的攻防两用性质,Google 对部署方式做了有意的安排:不公开发售,接下来会通过 CodeMender 提供给政府和可信伙伴,作为限量试点计划,之后逐步扩大。发布页用的是将来时,目前还没开放。另一边,Google 把 CodeMender 的基础能力通过 Gemini Enterprise Agent Platform 向普通客户开放,用的是常规可用的 Gemini 模型。
现在在哪能用上这两款
3.6 Flash 和 3.5 Flash-Lite 从发布当天起就能用:
- 开发者:Gemini API,可通过 Google AI Studio 和 Android Studio 接入;3.6 Flash 还进了 Google Antigravity。
- 企业:Gemini Enterprise Agent Platform;3.6 Flash 同时在 Gemini Enterprise 应用里可选。
- 普通用户:Gemini 应用里就能选到;3.5 Flash-Lite 正在往 Google 搜索里推。
computer use(让模型直接操作电脑界面)现在通过 Gemini API 和 Gemini Enterprise 成为内置的客户端工具,两款新模型都支持。
安全方面,3.6 Flash 加强了两个方向的防护:化学、生物、放射性、核这一类(缩写 CBRN),以及网络攻击的滥用。Google 说这让模型明显更难被越狱,同时也训练它对正当用途少拒答。两款模型各自有公开的模型卡可以查细节。
Google 一次发三款 Gemini,全在 Flash 线:主力款少写三分之二的字,活反而干得更好
Google 7 月 21 日一口气发布三款 Flash 模型,等了很久的旗舰 3.5 Pro 缺席;这一页带图把这次的账算清。
↓ 一页读完 · 有一张会动的图
Gemini 是 Google 的 AI 模型,按贵贱分三档:Pro 最强最贵,Flash 是日常干活那一档,Flash-Lite 最快最便宜。7 月 21 日这次一口气发了三款,全落在便宜的那两档上。
- Gemini 3.6 Flash , 主力档换代,当天就能用。
- Gemini 3.5 Flash-Lite , 3.5 系列里最快的一档,当天就能用。
- Gemini 3.5 Flash Cyber , 专门找软件漏洞,不公开卖,只给政府和可信伙伴。
- (缺席)Gemini 3.5 Pro , 旗舰档。发布页只给了一句「正在与合作伙伴测试」,没有日期、没有跑分、没有价格;Pro 线至今最新的还是 3.1 Pro Preview 这个预览版。同一页还宣布,下一代 Gemini 4 已经开始预训练。
先说主力档上一代留下的毛病。
✘ 干完一趟平均要吐 27.6 万个 token(模型吐出来的字,按个收费),最后做对的只有 37%。
你发给模型的字算输入,模型吐回来的字算输出,两边分开计价,输出价是输入价的 5 倍,模型自己的思考过程也按输出计费。它绕的圈越多、话越长,账单越长,事还不一定办成。
3.6 Flash 的卖点是少说话。跑同一批长周期软件工程任务(评测名叫 DeepSWE v1.1),它把平均输出量砍到上一代的三分之一多一点,同时输出单价也降了。两头一起降,一个任务的输出开销是这样:
输出价 $9.00 / 百万 token
───────────────
一个任务 ≈ $2.48
输出价 $7.50 / 百万 token
───────────────
一个任务 ≈ $0.73
话少了近三分之二,做对的比例反倒从 37% 升到 49%。那接下来的问题是:字数砍掉这么多,活为什么还能干得更好?
关键在于「一趟活要来回几轮」。这类任务模型得自己分步骤干:读文件、想一遍、动手改、跑测试、看结果再决定下一步。每一轮它都要吐一遍想法,字就是这么一轮轮堆出来的。
左边的圆点跑得又慢又远,右边的又快又短,这就是「少说三分之二的字」在一个任务里的样子:绕的圈少了,每圈的话也短了。
「输出量降 65%」听着没感觉,换成账单就有了。拿 1000 个这样的代码任务算,只算模型吐字这一侧的开销:
的字数
的比例
3.5 Flash-Lite 最快
3.5 Flash Cyber 只给政府
- × 没有 3.5 Pro
- × 没有日期
- × 没有跑分
- × 没有价格
吐这么多字
往上走了
Artificial Analysis 在自己那批题上,测到的输出降幅是 17%。
最便宜那档 Flash-Lite 的输出价,反倒从 1.50 涨到 2.50。