OpenAI发布GPT-5.5:从对话模型向智能体演进,Terminal-Bench 82.7%
OpenAI 发布 GPT-5.5 及 Pro 版。这次升级的重点不在"更聪明",而在"更能干活"——模型从单一对话能力向具备复杂规划与跨工具执行的智能体方向演进。
智能体协作与端到端任务处理
GPT-5.5 被设计为能够跨多个工具和步骤执行复杂任务,进行端到端的问题解决,在代码调试、科学研究和自动化办公场景中显著提升执行效率。这些提升是在保持 GPT-5.4 同等推理延迟的基础上实现的——更快更强,没有变慢。
性能提升的背后是推理系统与 NVIDIA GB200/GB300 硬件的深度协同优化。
基准测试
GPT-5.5 在 Terminal-Bench 2.0 任务中取得 82.7% 的准确率。Terminal-Bench 评估的是 AI 模型在终端环境中完成实际任务的能力,82.7% 意味着模型在复杂环境中的操作已经相当可靠。
此外,GPT-5.5 在长文本处理与复杂指令遵循方面表现出更高的一致性。
安全机制
OpenAI 针对网络安全与生物研究领域部署了更严格的安全分级与防御机制。前沿模型的安全投入在持续加码。
可用性与定价
模型已在 ChatGPT Plus、Pro 及企业版中上线。API 将于近期推出:
- 标准版:输入 $5 / 百万 token,输出 $30 / 百万 token
- Pro 版:输入 $30 / 百万 token,输出 $180 / 百万 token,面向高精度专业研究场景
观察
AI 模型的竞争正从"谁更聪明"转向"谁更能干活"。智能体能力、工具调用、端到端任务执行——这些才是用户真正关心的东西。Terminal-Bench 82.7% 说明 AI 操作终端已经接近实用门槛,自动化工作流的想象空间进一步打开。而 Pro 版的存在则说明 OpenAI 仍在追求高端市场的差异化,为科研和专业用户提供专门的高精度通道。
推荐阅读
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- KTransformers:单 GPU 跑 671B MoE 模型的清华方案7/21/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- 6.4 万 Star 的开源全球情报平台:World Monitor 架构与能力全景7/21/2026
- Qwen-Image-3.0 发布:追求实用的图像生成7/21/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- Gigatoken:比 HuggingFace 快 1000 倍的开源分词器7/22/2026
- Claude Record a Skill:录屏一次,永久自动化你的工作流7/22/2026
- jcode:用 Rust 重写的 AI 编码代理,内存占用仅为 Claude Code 的 1/147/22/2026
- OpenAI 模型自行越狱:从沙箱逃逸到入侵 Hugging Face 全过程7/21/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- Gemini 3.6 Flash 发布:Token 效率砍 65%,多模态全面领先7/21/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026