谷歌 Gemini 3.8 Flash 发布:软件工程与智能体增强

9 月 2 日,Google DeepMind 上线 Gemini 3.8 Flash 的官方模型卡。按官方描述,这是 Gemini 3 系列的又一次迭代,在软件工程和智能体知识工作流上较 3.7 Flash 有进一步性能提升,延续可调节的努力等级(effort levels),在质量、成本和延迟之间做权衡。模型通过 Gemini 应用、AI Studio 和 Gemini API 分发,输入上下文窗口最高 100 万 token,输出 64K token,知识截止 2026 年 3 月。模型卡安全评估部分写明:整体安全与语气表现和 3.7 Flash 相当,非英语语言的安全表现略有回落。

同步公布的还有一张六模型横评表,把 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 放进 13 项评测直接对分。本文把这 78 个格子逐项拆开,加上价格和评测口径,给一个可以落地到选型的版本。

价格:表里最便宜的一档

模型输入价格(美元/百万 token)输出价格(美元/百万 token)
Gemini 3.8 Flash0.753.75
Gemini 3.7 Flash0.753.75
Claude Opus 55.0025.00
Claude Sonnet 52.0010.00
GPT-5.6 Sol4.0020.00
GPT-5.6 Terra2.0012.00

3.8 Flash 与 3.7 Flash 同价:输入 0.75 美元、输出 3.75 美元。表格脚注注明这是介绍价,2026 年 12 月 31 日到期,2027 年 1 月 1 日起输入涨至 1.50 美元、输出涨至 7.50 美元。涨价后输出价格约为 Claude Opus 5 的三成。

对照表里最贵的 Claude Opus 5:输入价是 3.8 Flash 的约 6.7 倍,输出价同样约 6.7 倍。算一笔满载账:把 100 万 token 上下文塞满一次,3.8 Flash 花 0.75 美元,Opus 5 花 5 美元;按 64K 输出上限跑满一次,3.8 Flash 花 0.24 美元,Opus 5 花 1.60 美元。

完整横评数据

先看官方原表(分数为官方评测页口径):

谷歌官方六模型十三项评测对比表

逐格数据如下(价格单位为美元/百万 token,其余为得分):

评测项3.8 Flash3.7 FlashOpus 5Sonnet 5GPT-5.6 SolGPT-5.6 Terra
输入价格0.750.755.002.004.002.00
输出价格3.753.7525.0010.0020.0012.00
DeepSWE v1.1(软件工程)71.0%65.3%74.0%53.8%72.7%69.6%
GDPval-AA v2(知识工作,Elo)154514821824158417101528
Vals Finance Agent v2(金融代理)61.4%59.0%58.6%53.9%53.8%54.4%
Harvey's Legal Agent Benchmark(法律代理)10.0%8.8%6.7%5.0%2.5%0.8%
Terminal-Bench 2.1(终端编程)89.4%85.8%89.1%80.4%88.8%87.4%
Terminal-Bench 4.0(通用 agent)19.1%11.2%51.8%12.4%37.3%23.6%
GDP.PDF(PDF 文档理解)35.0%34.0%37.0%28.0%40.0%29.0%
CharXiv Reasoning(图表推理)86.2%84.5%83.7%70.1%85.8%85.9%
LVBench(长视频理解)87.8% / 87.1%85.4%75.4%68.5%82.1%78.9%
HLE-Verified(科学推理)54.9%53.6%54.4%31.0%54.5%51.1%
OSWorld 2.0(电脑操作)59.0%50.6%75.4%42.6%62.6%50.2%
BioMysteryBench(生物信息研究)88.8% / 56.5%87.1%90.1%87.5%79.5%83.8%
LABBench2(生物研究任务)86.2%82.1%84.2%80.1%82.1%81.2%

LVBench 一栏中,3.8 Flash 的两个数分别为 agentic 87.8% 和 classic 87.1%;BioMysteryBench 一栏中,两个数分别为 human default 88.8% 和 none default 56.5%,与原表标注一致。

分数怎么读:三个口径注记

官方评测方法论页给了几条读表前提,跨厂商对比时要带上这些背景:

第一,所有 Gemini 分数为 pass@1,使用 API 默认采样设置;非 Gemini 模型的数字全部来自各厂商自报,Google 只在拿不到自报数字时用可得的最好成绩补位。

第二,HLE-Verified 用 1811 题验证集替代原版 Humanity's Last Exam:原集 668 道验证项加 1143 道修订项,剔除了 689 道被标为不确定的题。与其他榜单的 HLE 数字直接对比会失真。

第三,LVBench 中 Gemini 和 GPT 模型用 1024 帧,Claude 模型因 API 限制只用 300 帧;Terminal-Bench 2.1 统一使用 Terminus-2 agent 框架出分。帧数和框架差异都会影响绝对值。

3.8 Flash 的七项第一

金融代理(Vals Finance Agent v2):61.4%,比 3.7 Flash 的 59.0% 和 Opus 5 的 58.6% 高 2.4 到 2.8 个百分点。这是升级幅度最直观的一项,金融 agent 涉及多步数据核对和报表流程,正是官方描述里「智能体知识工作流」的靶心。

法律代理(Harvey's Legal Agent Benchmark):10.0%,次高是 3.7 Flash 的 8.8%。要注意这项所有模型得分都在个位数到 10% 之间,复杂法律工作流对全体模型仍是早期阶段,领先幅度参考意义大于绝对值。

终端编程(Terminal-Bench 2.1):89.4%,以 0.3 个百分点压过 Opus 5 的 89.1%。单点编码任务上,Flash 档模型已经能贴住旗舰。

图表推理(CharXiv Reasoning):86.2%,领先 GPT-5.6 Terra 的 85.9%。从图表里读数并做推理,是文档和报表自动化场景的基础能力。

长视频理解(LVBench):agentic 87.8%、classic 87.1%,比 Opus 5 的 75.4% 高出超过 12 个百分点,多模态是谷歌的传统强项。

科学推理(HLE-Verified):54.9%,六个模型中唯一上 54.5% 的,但领先幅度只有 0.4 到 1.3 个百分点,属于缠斗区间。

生物研究任务(LABBench2):86.2%,比 Opus 5 的 84.2% 高 2 个百分点。加上 BioMysteryBench 的 human default 88.8%(低于 Opus 5 的 90.1%),生物类任务整体是 Gemini 与 Claude 互有攻守。

七项第一的分布很集中:多模态(视频、图表)加垂直行业 agent(金融、法律、生物)。这与谷歌给它的定位一致:面向大规模、生产级 agent 的性价比选项。

Opus 5 拿走的四项:长程自主任务

DeepSWE v1.1:Opus 5 的 74.0% 对 3.8 Flash 的 71.0%,差 3 个百分点,全表最小的一项差距。软件工程上 3.8 Flash 较 3.7 Flash 提升了 5.7 个百分点,但顶格还有距离。

GDPval-AA v2:Elo 制,Opus 5 的 1824 对 1545,差 279 分,六模型中只有 Opus 5 上 1800。知识工作的综合深度差距比百分比类评测显示的更大。

Terminal-Bench 4.0:51.8% 对 19.1%,差 32.7 个百分点,全表最大分差。3.8 Flash 在 Terminal-Bench 2.1 拿了第一,同一家族的 4.0 版本落到第四(低于 Opus 5、GPT-5.6 Sol 的 37.3%、GPT-5.6 Terra 的 23.6%)。评测版本越新,任务链越长,Flash 的完成率掉得越快。

OSWorld 2.0:Opus 5 的 75.4% 对 3.8 Flash 的 59.0%,差 16.4 个百分点。让模型在真实操作系统里连续操作,Opus 5 仍是断层第一。

四个失守点拼出的图景:评测环境越接近「让模型自主连续干几十步」,Claude 优势越大;单点任务和垂直领域任务,3.8 Flash 已经能第一或贴住第一。

GPT-5.6 Sol 与 GDP.PDF

剩下的一项归 GPT-5.6 Sol:GDP.PDF(PDF 文档理解)40.0%,领先第二名 Opus 5 的 37.0% 和 3.8 Flash 的 35.0%。这项评测由 Google 自测,自家模型也没能拿下,OpenAI 在长文档解析上守住了独一档。

选型参考

按这张表,三类场景可以对号入座。

高频、大批量、成本敏感的垂直 agent(金融分析、法律流程、报表图表处理、音视频理解、生物信息):3.8 Flash 在这些位置同时给出七项第一和最低价,输入 0.75 美元、输出 3.75 美元的介绍价窗口到 2026 年 12 月 31 日,有批量需求可以在窗口内把用量迁过去。

长程自主任务(几十步的终端操作、电脑操作、复杂知识工作流):Opus 5 仍是标杆,Terminal-Bench 4.0 领先 32.7 个百分点、OSWorld 领先 16.4 个百分点,预算允许时这两类任务不值得为省钱降档。

长文档 PDF 解析:GPT-5.6 Sol 的 40.0% 是当前表内最优。

一句收束:3.8 Flash 把「单点任务达到旗舰水平」的价格打到了 0.75 美元档,而旗舰在长程 agent 上的领先依然清晰。选型时先分清任务是单点还是长链,再谈价格。

来源:Google DeepMind《Gemini 3.8 Flash》模型卡与评测方法论页(2026 年 9 月 2 日发布),deepmind.google