9 月 2 日,Google DeepMind 上线 Gemini 3.8 Flash 的官方模型卡。按官方描述,这是 Gemini 3 系列的又一次迭代,在软件工程和智能体知识工作流上较 3.7 Flash 有进一步性能提升,延续可调节的努力等级(effort levels),在质量、成本和延迟之间做权衡。模型通过 Gemini 应用、AI Studio 和 Gemini API 分发,输入上下文窗口最高 100 万 token,输出 64K token,知识截止 2026 年 3 月。模型卡安全评估部分写明:整体安全与语气表现和 3.7 Flash 相当,非英语语言的安全表现略有回落。
同步公布的还有一张六模型横评表,把 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 放进 13 项评测直接对分。本文把这 78 个格子逐项拆开,加上价格和评测口径,给一个可以落地到选型的版本。
价格:表里最便宜的一档
| 模型 | 输入价格(美元/百万 token) | 输出价格(美元/百万 token) |
|---|---|---|
| Gemini 3.8 Flash | 0.75 | 3.75 |
| Gemini 3.7 Flash | 0.75 | 3.75 |
| Claude Opus 5 | 5.00 | 25.00 |
| Claude Sonnet 5 | 2.00 | 10.00 |
| GPT-5.6 Sol | 4.00 | 20.00 |
| GPT-5.6 Terra | 2.00 | 12.00 |
3.8 Flash 与 3.7 Flash 同价:输入 0.75 美元、输出 3.75 美元。表格脚注注明这是介绍价,2026 年 12 月 31 日到期,2027 年 1 月 1 日起输入涨至 1.50 美元、输出涨至 7.50 美元。涨价后输出价格约为 Claude Opus 5 的三成。
对照表里最贵的 Claude Opus 5:输入价是 3.8 Flash 的约 6.7 倍,输出价同样约 6.7 倍。算一笔满载账:把 100 万 token 上下文塞满一次,3.8 Flash 花 0.75 美元,Opus 5 花 5 美元;按 64K 输出上限跑满一次,3.8 Flash 花 0.24 美元,Opus 5 花 1.60 美元。
完整横评数据
先看官方原表(分数为官方评测页口径):

逐格数据如下(价格单位为美元/百万 token,其余为得分):
| 评测项 | 3.8 Flash | 3.7 Flash | Opus 5 | Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| 输入价格 | 0.75 | 0.75 | 5.00 | 2.00 | 4.00 | 2.00 |
| 输出价格 | 3.75 | 3.75 | 25.00 | 10.00 | 20.00 | 12.00 |
| DeepSWE v1.1(软件工程) | 71.0% | 65.3% | 74.0% | 53.8% | 72.7% | 69.6% |
| GDPval-AA v2(知识工作,Elo) | 1545 | 1482 | 1824 | 1584 | 1710 | 1528 |
| Vals Finance Agent v2(金融代理) | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey's Legal Agent Benchmark(法律代理) | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| Terminal-Bench 2.1(终端编程) | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-Bench 4.0(通用 agent) | 19.1% | 11.2% | 51.8% | 12.4% | 37.3% | 23.6% |
| GDP.PDF(PDF 文档理解) | 35.0% | 34.0% | 37.0% | 28.0% | 40.0% | 29.0% |
| CharXiv Reasoning(图表推理) | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench(长视频理解) | 87.8% / 87.1% | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| HLE-Verified(科学推理) | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| OSWorld 2.0(电脑操作) | 59.0% | 50.6% | 75.4% | 42.6% | 62.6% | 50.2% |
| BioMysteryBench(生物信息研究) | 88.8% / 56.5% | 87.1% | 90.1% | 87.5% | 79.5% | 83.8% |
| LABBench2(生物研究任务) | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
LVBench 一栏中,3.8 Flash 的两个数分别为 agentic 87.8% 和 classic 87.1%;BioMysteryBench 一栏中,两个数分别为 human default 88.8% 和 none default 56.5%,与原表标注一致。
分数怎么读:三个口径注记
官方评测方法论页给了几条读表前提,跨厂商对比时要带上这些背景:
第一,所有 Gemini 分数为 pass@1,使用 API 默认采样设置;非 Gemini 模型的数字全部来自各厂商自报,Google 只在拿不到自报数字时用可得的最好成绩补位。
第二,HLE-Verified 用 1811 题验证集替代原版 Humanity's Last Exam:原集 668 道验证项加 1143 道修订项,剔除了 689 道被标为不确定的题。与其他榜单的 HLE 数字直接对比会失真。
第三,LVBench 中 Gemini 和 GPT 模型用 1024 帧,Claude 模型因 API 限制只用 300 帧;Terminal-Bench 2.1 统一使用 Terminus-2 agent 框架出分。帧数和框架差异都会影响绝对值。
3.8 Flash 的七项第一
金融代理(Vals Finance Agent v2):61.4%,比 3.7 Flash 的 59.0% 和 Opus 5 的 58.6% 高 2.4 到 2.8 个百分点。这是升级幅度最直观的一项,金融 agent 涉及多步数据核对和报表流程,正是官方描述里「智能体知识工作流」的靶心。
法律代理(Harvey's Legal Agent Benchmark):10.0%,次高是 3.7 Flash 的 8.8%。要注意这项所有模型得分都在个位数到 10% 之间,复杂法律工作流对全体模型仍是早期阶段,领先幅度参考意义大于绝对值。
终端编程(Terminal-Bench 2.1):89.4%,以 0.3 个百分点压过 Opus 5 的 89.1%。单点编码任务上,Flash 档模型已经能贴住旗舰。
图表推理(CharXiv Reasoning):86.2%,领先 GPT-5.6 Terra 的 85.9%。从图表里读数并做推理,是文档和报表自动化场景的基础能力。
长视频理解(LVBench):agentic 87.8%、classic 87.1%,比 Opus 5 的 75.4% 高出超过 12 个百分点,多模态是谷歌的传统强项。
科学推理(HLE-Verified):54.9%,六个模型中唯一上 54.5% 的,但领先幅度只有 0.4 到 1.3 个百分点,属于缠斗区间。
生物研究任务(LABBench2):86.2%,比 Opus 5 的 84.2% 高 2 个百分点。加上 BioMysteryBench 的 human default 88.8%(低于 Opus 5 的 90.1%),生物类任务整体是 Gemini 与 Claude 互有攻守。
七项第一的分布很集中:多模态(视频、图表)加垂直行业 agent(金融、法律、生物)。这与谷歌给它的定位一致:面向大规模、生产级 agent 的性价比选项。
Opus 5 拿走的四项:长程自主任务
DeepSWE v1.1:Opus 5 的 74.0% 对 3.8 Flash 的 71.0%,差 3 个百分点,全表最小的一项差距。软件工程上 3.8 Flash 较 3.7 Flash 提升了 5.7 个百分点,但顶格还有距离。
GDPval-AA v2:Elo 制,Opus 5 的 1824 对 1545,差 279 分,六模型中只有 Opus 5 上 1800。知识工作的综合深度差距比百分比类评测显示的更大。
Terminal-Bench 4.0:51.8% 对 19.1%,差 32.7 个百分点,全表最大分差。3.8 Flash 在 Terminal-Bench 2.1 拿了第一,同一家族的 4.0 版本落到第四(低于 Opus 5、GPT-5.6 Sol 的 37.3%、GPT-5.6 Terra 的 23.6%)。评测版本越新,任务链越长,Flash 的完成率掉得越快。
OSWorld 2.0:Opus 5 的 75.4% 对 3.8 Flash 的 59.0%,差 16.4 个百分点。让模型在真实操作系统里连续操作,Opus 5 仍是断层第一。
四个失守点拼出的图景:评测环境越接近「让模型自主连续干几十步」,Claude 优势越大;单点任务和垂直领域任务,3.8 Flash 已经能第一或贴住第一。
GPT-5.6 Sol 与 GDP.PDF
剩下的一项归 GPT-5.6 Sol:GDP.PDF(PDF 文档理解)40.0%,领先第二名 Opus 5 的 37.0% 和 3.8 Flash 的 35.0%。这项评测由 Google 自测,自家模型也没能拿下,OpenAI 在长文档解析上守住了独一档。
选型参考
按这张表,三类场景可以对号入座。
高频、大批量、成本敏感的垂直 agent(金融分析、法律流程、报表图表处理、音视频理解、生物信息):3.8 Flash 在这些位置同时给出七项第一和最低价,输入 0.75 美元、输出 3.75 美元的介绍价窗口到 2026 年 12 月 31 日,有批量需求可以在窗口内把用量迁过去。
长程自主任务(几十步的终端操作、电脑操作、复杂知识工作流):Opus 5 仍是标杆,Terminal-Bench 4.0 领先 32.7 个百分点、OSWorld 领先 16.4 个百分点,预算允许时这两类任务不值得为省钱降档。
长文档 PDF 解析:GPT-5.6 Sol 的 40.0% 是当前表内最优。
一句收束:3.8 Flash 把「单点任务达到旗舰水平」的价格打到了 0.75 美元档,而旗舰在长程 agent 上的领先依然清晰。选型时先分清任务是单点还是长链,再谈价格。
来源:Google DeepMind《Gemini 3.8 Flash》模型卡与评测方法论页(2026 年 9 月 2 日发布),deepmind.google