Gemini 3.6 Flash 发布:Token 效率砍 65%,多模态全面领先
Token 效率的胜利
2026 年 7 月 21 日,Google 发布 Gemini 3.6 Flash。在 DeepSWE v1.1(长程软件工程基准)上,3.6 Flash 平均每个任务输出 97K tokens,上一代 3.5 Flash 要 276K tokens。同样的任务,输出量砍掉 65%。在 Artificial Analysis Intelligence Index 上,平均输出 token 也减少了 17%。
输出 token 少了,价格也更低:每百万输入 token 1.5 美元,输出 token 7.5 美元。3.5 Flash 的输出价格是 9 美元。Google 在博客中写道,3.6 Flash 通过更少的推理步骤和工具调用来完成多步任务,减少了不必要的代码修改和执行循环。

上图来自 Google 官方数据。左图是 DeepSWE v1.1 的每任务输出 token 量,右图是 Artificial Analysis Intelligence Index。
六模型 Benchmark 横评
Google 同时公布了一份六模型对比表,将 Gemini 3.6 Flash 与 Gemini 3.5 Flash、Gemini 3.1 Pro、GPT-5.6 Luna、Grok 4.5、Claude Sonnet 5 放在一起。

数据汇总如下:
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Gemini 3.1 Pro | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| 输入价格 ($/1M tokens) | $1.50 | $1.50 | $2.00 | $1.00 | $2.00 | $3.00 |
| 输出价格 ($/1M tokens) | $7.50 | $9.00 | $12.00 | $6.00 | $6.00 | $15.00 |
| SWE-Bench Pro(编程) | 58.7% | 55.1% | 54.2% | 62.7% | 64.7% | 63.2% |
| DeepSWE v1.1(长程软件工程) | 49% | 37% | 12% | 67% | 54% | 54% |
| Terminal-bench 2.1(终端编程) | 78.0% | 76.2% | 73.8% | 84.7% | 83.3% | 80.4% |
| MLE-Bench(机器学习工程) | 63.9% | 49.7% | 42.6% | 47.6% | 43.2% | 66.9% |
| GDPVal-AA v2(知识工作 Elo) | 1421 | 1349 | 965 | 1584 | 1535 | 1607 |
| OSWorld-Verified(计算机操作) | 83.0% | 78.4% | 76.2% | 72.6% | — | 81.2% |
| CharXiv Reasoning(图表推理,无工具) | 85.2% | 84.2% | 83.3% | 82.7% | 81.6% | 77.0% |
| CharXiv Reasoning(图表推理,有工具) | 89.4% | 84.9% | 83.2% | — | — | 88.3% |
| LVBench(长视频理解) | 83.2% | 80.7% | 74.9% | 71.2% | 71.2% | 68.5% |
| GDM-MRC v2 128k(长上下文) | 91.8% | 77.3% | 84.9% | 74.8% | 81.4% | 71.6% |
| GDM-MRC v2 1M(百万级上下文) | 54.0% | 26.6% | 26.3% | — | — | — |
加粗标注每行最高分。数据来自 Google DeepMind,方法论见 deepmind.google/models/evals-methodology/gemini-3-6-flash。
各模型的优势区域
从表格数据看,六个模型各有强项:
编程类(SWE-Bench Pro / DeepSWE / Terminal-bench):Grok 4.5 和 GPT-5.6 Luna 领先。GPT-5.6 Luna 在 DeepSWE v1.1 拿到 67%,Terminal-bench 2.1 拿到 84.7%,均为全场最高。Grok 4.5 在 SWE-Bench Pro 以 64.7% 排第一。Gemini 3.6 Flash 在这三项中排第三或第四。
计算机操作与多模态(OSWorld / CharXiv / LVBench):Gemini 3.6 Flash 全面领先。OSWorld-Verified 83.0%,CharXiv 图表推理 89.4%(有工具),LVBench 长视频理解 83.2%,均为全场最高。Google 在多模态和 Agent 类任务上的积累在数据上有所体现。
长上下文(GDM-MRC v2):Gemini 3.6 Flash 在 128k 和 1M 两个档位都是最高分。128k 平均 91.8%,1M pointwise 54.0%。GPT-5.6 Luna、Grok 4.5、Claude Sonnet 5 在 1M 档位没有数据。
知识工作(MLE-Bench / GDPVal-AA v2):Claude Sonnet 5 在这两项领先,MLE-Bench 66.9%,GDPVal-AA v2 Elo 1607。Gemini 3.6 Flash 紧随其后,MLE-Bench 63.9%,GDPVal 1421。

上图为 Google 公布的代际对比,展示 3.6 Flash 相对 3.5 Flash 和 3.1 Pro 在四项 Agent 基准上的提升。DeepSWE v1.1 从 37% 提升到 49%,MLE-Bench 从 49.7% 提升到 63.9%,OSWorld-Verified 从 78.4% 提升到 83.0%。
Token 效率带来的成本差异
3.6 Flash 的竞争力集中在效率维度。以 DeepSWE v1.1 为例:
- 3.5 Flash:276K 输出 tokens/任务 × $9.00/1M = 每任务约 $2.48
- 3.6 Flash:97K 输出 tokens/任务 × $7.50/1M = 每任务约 $0.73
同样完成一道软件工程任务,3.6 Flash 的输出成本约为 3.5 Flash 的三成。token 用量减少意味着推理时间更短、上下文窗口占用更低,对需要大量 API 调用的 Agent 应用场景影响很大。
横看定价,Gemini 3.6 Flash 的输出价格($7.50)低于 GPT-5.6 Luna 和 Grok 4.5($6.00,但 token 用量更大),远低于 Claude Sonnet 5($15.00 全价)。输入价格方面,GPT-5.6 Luna 最低($1.00),Gemini 3.6 Flash 和 3.5 Flash 持平($1.50)。
另外两款模型:3.5 Flash-Lite 与 3.5 Flash Cyber
Google 同步发布了两个衍生模型。
Gemini 3.5 Flash-Lite 面向高吞吐、低延迟场景。Artificial Analysis 测得其速度为 350 输出 tokens/秒,是 3.5 系列中最快的。定价为每百万输入 token 0.3 美元、输出 2.5 美元。Terminal-Bench 2.1 得分 54%(上一代 3.1 Flash-Lite 为 31%),GDPval-AA v2 从 642 提升到 1140。在部分 Agent 和编程评测上甚至超过了 3 Flash(SWE-Bench Pro 54.2% vs 49.6%,OSWorld-Verified 74.0% vs 65.1%)。该模型同样内置了计算机操作工具。
Gemini 3.5 Flash Cyber 基于 3.5 Flash 微调,专为发现和修复代码安全漏洞设计,搭配 Google 的 CodeMender 安全 Agent 使用。在 CyberGym 基准上达到前沿竞争力。鉴于双用逞性质,该模型仅通过 CodeMender 向政府和受信任合作伙伴开放,以受限试点形式推出。
Gemini 4 已启动预训练
Google 在博客中透露,Gemini 3.5 Pro 目前正在与合作伙伴测试,计划准备就绪后广泛推出。同时,DeepMind 已启动 Gemini 4 的大规模预训练,Google 称之为"迄今最具雄心的预训练运行"。
3.6 Flash 和 3.5 Flash-Lite 已上线 Gemini 应用、Google AI Studio、Android Studio 和 Gemini Enterprise。3.6 Flash 还在 Google Antigravity 中可用。知识截止日期为 2026 年 3 月。
来源:Google Blog
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- KTransformers:单 GPU 跑 671B MoE 模型的清华方案7/21/2026
- Qwen-Image-3.0 发布:追求实用的图像生成7/21/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- 6.4 万 Star 的开源全球情报平台:World Monitor 架构与能力全景7/21/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- 马斯克:AI 和机器人将让工作变为可选,实现全民高收入7/3/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- 香港处理中国过半芯片进口创历史新高:AI贸易重塑亚洲供应链7/5/2026
- 从老鼠视皮层还原10秒视频:大脑视觉编码研究的里程碑7/13/2026