← Back to Blog
By GenCybers.inc

GPT-5.6 正式公开:价格、性能与 Codex 并入 ChatGPT 全解析

OpenAI 于 2026 年 7 月 9 日正式公开 GPT-5.6。本文梳理 Sol、Terra、Luna 三档价格、官方性能口径、社区真实反馈,以及 Codex app 并入 ChatGPT 的产品意义。

GPT-5.6 正式公开:价格、性能与 Codex 并入 ChatGPT 全解析

OpenAI 于 2026 年 7 月 9 日正式发布 GPT-5.6,并在随后 24 小时内逐步向全球开放。

这次更新当然是模型升级,但如果只把它理解成“GPT 又强了一点”,就会错过重点。GPT-5.6 释放出的信号主要有两个:第一,OpenAI 的主叙事已经明显从“绝对性能”转向 performance per dollar,也就是同样预算下完成更多工作;第二,ChatGPTWorkCodex 正在被整合为一个统一入口,OpenAI 试图交付的也不再只是模型本身,而是一整套工作界面和执行工作流。

GPT-5.6 到底发布了什么

这次 GPT-5.6 并不是单一模型发布,而是一整个家族:

  • GPT-5.6 Sol:旗舰档,面向复杂推理、编码和高价值任务
  • GPT-5.6 Terra:性能与成本平衡档
  • GPT-5.6 Luna:高性价比、高吞吐档

按照 OpenAI API 文档,三者都支持 FunctionsWeb searchFile searchComputer use,上下文窗口都是 1.05M tokens,知识截止时间均为 2026 年 2 月 16 日。其中 gpt-5.6 这个别名默认指向 gpt-5.6-sol

对普通用户来说,GPT-5.6 已经同时进入 ChatGPT、Codex 和 OpenAI API。对开发者来说,更重要的是 GPT-5.6 不只是“回答更强”,还带来了一套更复杂的配置与执行体系:

  • reasoning effort:从 nonemax,决定模型愿意投入多少推理预算
  • Pro mode:在同一型号上切换更重的执行模式,不是独立模型
  • Ultra:在 Codex / ChatGPT 里以多 agent 并行来换更强结果和更短完成时间
  • Programmatic Tool Calling:让模型在 Responses API 里以更程序化的方式组织工具调用,减少无意义的中间 token

这也是为什么 OpenAI 在整篇发布文里反复强调“每个 token 更值钱”,而不是只强调一个更高的 benchmark 分数。

Sol、Terra、Luna、Pro、Ultra 到底是什么

如果你最近在 API 文档、Codex 和 ChatGPT 之间来回切,很容易被一堆名字绕晕。因为 OpenAI 这次同时在讲 基础型号思考等级执行模式产品层工作模式,它们并不是一回事,但在界面上又很容易被用户看成“同一层级的选项”。

先把最基础的一层拆清楚:

  • Sol、Terra、Luna 是 GPT-5.6 的三个基础型号
  • gpt-5.6 这个别名默认指向 gpt-5.6-sol
  • 三个型号都支持同样的工具能力、1.05M 上下文窗口,以及同一组 reasoning effort 选项

在 API 文档里,三者都支持以下思考等级:

  • none
  • low
  • medium
  • high
  • xhigh
  • max

这意味着你看到的“低思考”“高思考”“max 思考”,本质上是同一个型号上的推理强度设置,而不是换了一个新模型。比如:

  • gpt-5.6-sol + low
  • gpt-5.6-sol + max
  • gpt-5.6-terra + medium

这些都是“型号 + effort”的不同组合,而不是三个完全不同的产品。

接下来是更容易混淆的 Pro

Reason Mode 来源: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode

OpenAI 在 API 文档里写得很明确:Pro 不是单独的模型 slug。 如果你要用 Pro mode,做法不是切到什么 gpt-5.6-pro,而是保留原来的 Sol / Terra / Luna 型号,再把 reasoning.mode 设为 pro。而且 reasoning.modereasoning.effort 是彼此独立的,你仍然可以单独选择 lowmediumhighmax 这些 effort。

更直白一点说,Pro 在 API 里的意思不是“第四个型号”,而是同一型号上的一种更重执行模式:模型会做更多工作,再返回单个最终答案,代价是更高延迟和更多 token 消耗。

Ultra 则又是另一层概念。OpenAI 在 GPT-5.6 发布页里把它描述成 Codex 里的默认四 agent 配置,并明确说开发者可以用 Responses API 里的 multi-agent beta 去构建“ultra-like experiences”。这说明 Ultra 更接近一种产品层多 agent 工作模式,而不是 Sol / Terra / Luna 之外的第四个底层模型。

所以如果强行把这些名词放进同一张表,最稳妥的理解是:

名称更准确的定位
Sol / Terra / LunaGPT-5.6 的三个基础型号
none / low / medium / high / xhigh / max每个型号都支持的思考等级
ProAPI 里的 reasoning mode,不是独立模型 slug
UltraCodex / ChatGPT 产品里的多 agent 工作模式,不是独立基础模型

也正因为如此,GPT-5.6 的体验虽然更强,但整个命名体系也确实变得更乱了。用户在不同入口看到的,往往不是单一“选模型”,而是在同时面对四层东西:

  1. 选基础型号:Sol、Terra、Luna
  2. 选思考等级:none 到 max
  3. 选执行模式:standard 还是 pro
  4. 在 Codex / ChatGPT 里再叠加产品层的多 agent 模式,比如 ultra

这套设计当然给了重度用户更多调优空间,但它也让“我现在到底在用哪个东西”变得没那么直观。对普通开发者来说,OpenAI 现在卖的已经不是单纯一个模型名,而是一套越来越像“运行配置矩阵”的组合系统。

价格怎么变了

如果看 OpenAI API 的 Standard 定价,GPT-5.6 三档价格如下:

模型输入价格输出价格
GPT-5.6 Sol$5 / 1M tokens$30 / 1M tokens
GPT-5.6 Terra$2.50 / 1M tokens$15 / 1M tokens
GPT-5.6 Luna$1 / 1M tokens$6 / 1M tokens

单看这个表,有两个结论很明显。

第一,Sol 的标价和 GPT-5.5 标准档相同。也就是说,OpenAI 这次没有把旗舰模型直接卖得更贵,而是试图说服开发者:在差不多的单价下,你能拿到更好的成功率、更短的延迟和更少的 token 消耗。

第二,Terra 和 Luna 把“次旗舰”和“便宜模型”的梯度拉得更清楚了。如果团队本来就在做大量 agent 调用、批量内容生成或者中等复杂度编程任务,这两个档位会比“无脑上最强模型”更有吸引力。

另外,GPT-5.6 还带来了一个很容易被忽略、但对 API 成本非常重要的变化:从 GPT-5.6 家族开始,Prompt Caching 的 cache writes 不再是“无额外费用”,而是单独计费。

按 Standard 定价看,GPT-5.6 的缓存相关价格是这样的:

  • cached input 依然按输入价的 10% 计费
  • cache writes 按未缓存输入价的 1.25 倍计费

GPT-5.6 Sol 为例,短上下文 Standard 价格里:

  • 普通输入是 $5 / 1M tokens
  • 缓存读取是 $0.50 / 1M tokens
  • 缓存写入是 $6.25 / 1M tokens

这里最需要澄清的一点是:显式断点控制的强化,不等于隐式缓存被取消。 OpenAI 官方文档写得很明确,prompt caching 仍然默认开启,符合条件的请求仍会自动尝试缓存;默认情况下,请求达到 1024 tokens 以上时就可能触发自动缓存。换句话说,GPT-5.6 之后,自动缓存依然存在,开发者只是多了更明确的显式断点控制方式。

两者区别可以简单理解为:

机制是否默认启用你能否控制缓存断点适合场景
隐式缓存基本不能,系统默认在最新消息等位置放断点普通对话、无需精细调优的请求
显式缓存否,需要你显式标记可以,开发者自己决定哪些前缀值得缓存长 system prompt、知识库前缀、多轮 agent 工作流

OpenAI 在文档里把请求模式分成了 implicitexplicit

  • implicit 是默认模式,系统会自动放置隐式断点,同时也会使用你手动添加的显式断点
  • explicit 会关闭默认的隐式断点,只使用你自己标注的断点

这个区别直接影响成本控制。对开发者来说,implicit 更像默认自动优化,explicit 则适合那些想自己定义缓存边界、把长前缀和可复用上下文拆得更稳定的场景。

同时,GPT-5.6 上的 cache write 收费规则需要单独注意。OpenAI 在 prompt caching 文档里明确写道:在 GPT-5.6 之前cache writes 没有额外费用;而从 GPT-5.6 家族开始cache writes 按未缓存输入价的 1.25 倍计费。官方文档还说明,在 implicit 模式下,系统自动放置的隐式断点也会占用 write slot。因此,更稳妥的理解是:只要请求实际产生了新的缓存写入,这部分成本就应该单独核算,而不再默认视为免费副产品。

缓存写入价格 来源: https://developers.openai.com/api/docs/guides/prompt-caching#frequently-asked-questions

另一个和 GPT-5.6 强相关的新要求是 prompt_cache_key。官方文档说明,从 GPT-5.6 及之后的模型开始,如果你想获得更可靠的隐式或显式缓存匹配,就应该主动设置 prompt_cache_key。没有这个 key,系统仍然可能命中自动缓存,但不会使用那套更稳定的精确匹配机制。

所以更准确地说,GPT-5.6 的缓存策略变化不是“开始支持缓存”,而是:

  1. 隐式缓存继续存在,默认开启
  2. 开发者可以通过显式断点更精细地控制缓存边界
  3. cache writes 从 GPT-5.6 家族开始单独收费,适用于实际发生的新缓存写入
  4. 想把缓存收益做稳定,prompt_cache_key 基本会变成生产环境里的必备参数

这意味着真正重度使用 API 的团队,接下来不能只盯着输入和输出单价,还要开始单独看三件事:缓存写入量、缓存读取命中率,以及 prompt 前缀是否足够稳定。

性能提升,OpenAI 这次最想卖的其实是“效率”

如果只看官方展示,GPT-5.6 像是在多个方向上都更强了:编码、知识工作、设计、浏览、科学和网络安全几乎都被覆盖到了。但仔细读官方文案会发现,OpenAI 这次最想强调的不是“全面领先”这样的口号,而是 更少 token、更低延迟、更高完成率

官方给出的几个代表性口径包括:

  • Artificial Analysis Coding Agent Index v1.1 上,GPT-5.6 Sol 达到 80
  • BrowseComp 上,GPT-5.6 Sol Ultra 达到 92.2%
  • OSWorld 2.0 上,GPT-5.6 Sol 为 62.6%
  • Agents' Last Exam 这类长流程专业任务评测里,OpenAI 反复强调 GPT-5.6 相比 Claude Fable 5 有更好的成本效率

但这里也值得保持一点冷静。官方页面不同区块里出现的分数,并不总是完全一致。例如正文里提到 GPT-5.6 Sol 在 Agents' Last Exam 达到 53.6,而页面后面的汇总表格又给出 52.7 这组数据。这通常意味着评测模式、推理 effort,或者是否使用更高配置存在差异。换句话说,GPT-5.6 的确在变强,但你读任何 benchmark 时都需要先看测试条件,而不是只看 headline 数字。

这也是我认为这次发布最值得注意的地方:OpenAI 不再只卖“更大更强”,而是在卖一个更接近生产环境的叙事,即:

  1. 同样预算下完成更多任务
  2. 用更少的 token 跑出接近甚至更好的结果
  3. 把复杂工作交给多 agent 和程序化工具调用去完成

对于企业和重度开发者,这个叙事其实比单纯多 2 分 benchmark 更有意义。

Codex app 并入 ChatGPT,可能比模型分数更重要

如果说 GPT-5.6 是模型层的大新闻,那么产品层的大新闻其实是另一件事:Codex app 正在并入新的 ChatGPT desktop app。

OpenAI 在另一篇官方文章里写得很直接:从当天开始,Codex app 会与新的 ChatGPT 桌面应用合并。合并之后,ChatGPT 桌面端不仅能访问本地文件和应用,还带有内置浏览器,可以把网页、在线工具和在线文件拉进同一个工作空间。与此同时,Codex 继续保留其开发者工作流能力,包括:

  • 在 diff 内联编辑
  • 在侧边栏做 PR review
  • 更快的 computer use
  • 单个项目支持多个仓库

这件事的意义,不只是“少装一个 App”。它说明 OpenAI 正在把三件原本分散的事情合并:

  • 日常聊天
  • 长流程知识工作
  • 编码与执行型 agent

过去大家会把 ChatGPT 当成聊天窗口,把 Codex 当成开发工具,把 Work 当成更重度的办公模式。现在 OpenAI 的方向已经很清楚了:它想把这些入口收敛成一个统一界面,让用户不再切产品,而是在同一个容器里切任务类型。

如果这个方向成立,那么 OpenAI 的竞争点就不再只是“模型是不是第一”,而会逐步变成“谁的工作闭环更完整”。

社区怎么评价 GPT-5.6

从 Hacker News 的讨论来看,社区对 GPT-5.6 的态度并不是一边倒吹捧,反而相当典型地分成了“认可”和“保留”两派。

比较一致的正面评价主要有三类。

第一类是 更快、更便宜、更稳定。不少开发者的直观反馈并不是“它突然比上一代聪明很多”,而是“它在差不多甚至更低成本下,表现更稳定,速度更快,一致性更好”。这和 OpenAI 官方强调的 efficiency 口径是对上的。

第二类是 Codex 的产品体验正在追上甚至反超其他 coding harness。在讨论里,可以看到有人明确表示自己已经从 Claude Code 转向 Codex,原因不是单一 benchmark,而是可靠性、价格和长任务体验。有评论甚至把 Codex 的“killer feature”直接概括成 price

第三类是 设计与前端能力终于被认真讨论。OpenAI 这次专门强调 GPT-5.6 的 design judgment 和 computer use,不少开发者也认为,如果这些能力在真实项目里站得住,它确实有机会缩小与 Claude 在 UI 和设计工作流上的口碑差距。

但保留意见同样不少。

首先是 benchmark 宣传仍然让人警惕。不少人并不完全相信发布会式对比,尤其是当官方在不同位置给出不同数字,或者用不同模式去对比不同模型时,社区自然会质疑这些结果是否真的建立在可直接对比的条件下。

其次是 额度和 token 消耗问题。HN 里已经有人反馈,GPT-5.6 Sol 在长任务里虽然产出不错,但会非常吃配额,甚至出现任务完成后又继续做额外 review、消耗大量 token 的情况。换句话说,官方说的是“每个 token 更值钱”,而部分用户的第一感受却是“它还是很能花 token,只是花得更像回事了”。

第三个争议点是 提示词习惯要变。OpenAI 官方文档明确提醒,GPT-5.6 对“Be concise”“Keep it short”这类泛化的简短指令更敏感,甚至可能因为过度压缩而省略掉本来应该输出的完整内容。这个提醒在 HN 上也引发了不少吐槽,因为它意味着一部分用户过去积累的 prompt 习惯需要重写。

最后一个现实问题是 模型选择复杂度在上升。Sol、Terra、Luna,再叠加不同 reasoning effort、maxultra、标准模式、Pro 模式,对普通开发者来说,挑模型这件事变得越来越像“调度系统”,而不是“选一个最强模型直接用”。

我对 GPT-5.6 的判断

如果只用一句话概括,我会这样评价这次发布:

GPT-5.6 的意义,不只是模型更强,而是 OpenAI 正在把“模型领先”转成“工作闭环领先”。

它的价值主要不在于某个单点 benchmark,而在于三件事情被绑在了一起:

  • 更明确的价格梯度
  • 更强调 token 效率和工具执行效率
  • ChatGPT、Work、Codex 的统一入口

从产品策略看,这比“又多了一代模型”更重要。因为当模型能力逐渐接近时,真正决定用户迁移成本和留存的,往往不是 3 分还是 5 分的分数差,而是谁能更稳定地完成一整段工作。

当然,GPT-5.6 现在也还远没到“无脑切换”的阶段。benchmark 的可比性、真实生产环境下的 token 消耗、Quota 体验,以及安全检查带来的摩擦,都还需要更多真实使用案例去验证。

但至少从 2026 年 7 月 9 日这次发布来看,OpenAI 已经把下一阶段的方向说得很清楚了:它不只是想继续训练更强模型,还想把 ChatGPT 变成一个统一的工作操作界面,把 Codex 从“独立 coding agent”变成这个界面里的核心执行层。

如果这个方向走通,GPT-5.6 可能不会因为“最强 benchmark”被记住,而会因为 OpenAI 开始系统性重组 ChatGPT 与 Codex 的关系 被记住。

相关资源

来源声明

本文来自 merchmindai.net。分享或转载本文时,请注明出处,并附上原文链接。

原文链接:https://merchmindai.net/blog/zh/post/openai-gpt-5-6-pricing-performance-codex-chatgpt