GPT-5.6 系列正式发布:Sol/Terra/Luna 三档模型 + 成本性能比大幅优化
OpenAI 于 2026 年 7 月 9 日正式发布 GPT-5.6 系列模型,一口气推出三个版本:旗舰 Sol、中档 Terra、入门 Luna。同时推出的还有 ChatGPT Work 和 Codex 桌面端重大更新。gpt-5.6 默认指向 Sol。
三档定价体系
GPT-5.6 抛弃了 mini/nano 命名,改用三个天体名称对应三档定位。每百万 token 定价:
| 模型 | 输入 | 输出 | 定位 |
|---|---|---|---|
| Sol | $5.00 | $30.00 | 最强能力,复杂编码/安全研究 |
| Terra | $2.50 | $15.00 | 平衡性能与成本,大规模生产 |
| Luna | $1.00 | $6.00 | 高并发低成本,日常任务 |
Sol 价格与上一代 GPT-5.5($5/$30)持平,但性能有显著提升。Terra 在性能接近 GPT-5.5 的情况下,价格压到一半。对比竞品 Claude Fable 5($10/$50),Sol 大约是对方价格的一半。
TerminalBench 2.1:命令行自动化
TerminalBench 2.1 测的是真实编码工作流中的规划、迭代和工具协调能力。
| 模型 | TerminalBench 2.1 |
|---|---|
| GPT-5.6 Sol Ultra | 91.9% |
| GPT-5.6 Sol | 88.8% |
| Claude Mythos 5 | 88.0% |
| GPT-5.6 Terra | 84.3% |
| Claude Fable 5 | 84.3% |
| GPT-5.5 | 83.4% |
| GPT-5.6 Luna | 82.5% |
| Claude Opus 4.8 | 78.9% |
| Gemini 3.1 Pro Preview | 70.7% |
几个关键数字:
- Sol Ultra 模式拿下 91.9%,TerminalBench 2.1 目前最高分
- Sol 标准模式 88.8%,超过 Claude Mythos 5 的 88.0%
- Terra 与 Claude Fable 5 打平在 84.3%,但 Terra 价格只有对方一半
- Luna 82.5% 超过 Claude Opus 4.8 的 78.9%
- Gemini 3.1 Pro Preview 70.7% 垫底
Agent's Last Exam:成本效率的核心战场

Agent's Last Exam 测的是跨专业领域的长流程智能体任务。横轴是 API 花费(0 到 $4,000+),纵轴是任务完成率(30% 到 55%)。
GPT-5.6 三档模型全部聚拢在图表左下角:低成本、高完成率。GPT-5.6 Sol 在约 $750 的花费下达到约 54% 的峰值,是目前唯一跨过 50% 门槛的模型。Terra 和 Luna 分别在约 $500-700 区间达到 50-51%。
Claude Opus 4.8 和 Claude Fable 5 两个模型在图表右侧延伸,需要 $3,000-4,000 才能追到 45% 左右的水平。Claude Fable 5 在 Adaptive 模式下花费 $2,315 完成 40.5%。
Gemini 3.1 Pro Preview 作为孤立的单一数据点出现在约 $2,000 / 32% 的位置,成本效率在所有参与测试的模型中垫底。
新推理模式:max 与 ultra
GPT-5.6 引入了两种高强度推理模式:
- max 模式:单个推理链纵向深化。集中算力让一条思路想得更深,适合需要密集推理的单步骤问题。
- ultra 模式:多个子智能体横向协作。把复杂任务拆分给不同 AI 实例并行处理,再汇总结果。
Ultra 模式是 Sol 拿下 TerminalBench 91.9% 的关键。OpenAI 的方向明确:复杂问题靠多智能体协作解决。GPT-5.6 也支持自适应推理强度(Adaptive),模型自行判断任务难度选择合适的推理深度。
Programmatic Tool Calling
GPT-5.6 引入 Programmatic Tool Calling。模型可以像写代码一样批量调用外部工具,而不需要每一轮对话单独发起一次工具请求。
传统工具调用流程是:模型输出工具请求 → 等待结果 → 继续推理 → 再输出下一个工具请求。N 个工具需要 N 轮对话。Programmatic Tool Calling 允许模型在一个步骤内编排多个工具调用,大幅减少对话轮次和 token 消耗。
ChatGPT Work
ChatGPT Work 是面向复杂工作场景的新产品形态。它可以跨应用和文件执行多步骤任务,直接生成表格、幻灯片、文档和网页应用等可交付成品。核心变化是 ChatGPT 从"回答问题"扩展到"完成工作",输出的不再只是文字,还有可直接使用的结构化成品。
Codex 更新
Codex 正式并入 ChatGPT 桌面应用。主要更新:
- 应用内直接编辑代码,支持跨仓库项目
- 侧边栏审查 GitHub PR
- Computer Use 性能提升
- 支持 macOS 和 Windows 系统代理配置(包括 PAC 和 WPAD)
- MCP 工具默认使用 tool search
- Remote 插件默认开启
Prompt Caching 改进
GPT-5.6 引入更可预测的 prompt caching:
- 支持显式 cache breakpoints
- 30 分钟最小缓存生命周期
- Cache writes 按 1.25 倍未缓存输入费率计费
- Cache reads 享受 90% 的缓存输入折扣
此外,GPT-5.6 Sol 将于 7 月在 Cerebras 上线,速度可达每秒 750 tokens。
竞争格局
GPT-5.6 三档模型在 Agent's Last Exam 的成本效率图上形成了明显的技术代差。Sol 在 TerminalBench 上超过 Anthropic 旗舰 Claude Mythos 5,Terra 在半价条件下追平 Claude Fable 5,Luna 超过 Claude Opus 4.8。Gemini 3.1 Pro Preview 在两个 benchmark 上都处于落后位置。
OpenAI 的核心叙事:用更少 token、更低成本完成复杂任务,同时通过 Ultra 多智能体模式在高端性能上保持领先。
来源:OpenAI | Codex Changelog | ChatGPT Work