7月底 AI Coding 三连击:智谱新套餐涨价、OpenAI 降价、DeepSeek V4 Flash 预览版转正
2026年7月底,智谱新套餐涨价,OpenAI 下调 GPT-5.6 API 价格,DeepSeek V4 Flash 预览版转正。本文解析 AI Coding 的成本、额度与 Agent 竞争。

2026 年 7 月 30 日至 31 日,AI Coding 市场连续出现三条重要消息:智谱重新调整 GLM Coding Plan,OpenAI 下调 GPT-5.6 Terra 与 Luna 的 API 价格,DeepSeek 将 V4 Flash 从预览版转为正式发布并进入公开 Beta。它们看起来分别对应涨价、降价和模型升级,背后却指向同一个问题:AI 编程的竞争,正在从“谁的模型更强”转向“谁能以更低成本完成更多真实任务”。
7月底发生了什么?
这三条消息的时间非常接近,但商业动作并不相同。
| 时间 | 公司 | 主要变化 | 直接影响 |
|---|---|---|---|
| 7 月 30 日 | 智谱 | 重做 GLM Coding Plan 的价格和额度体系 | 新套餐价格明显提高,积分、时段和资源保障成为核心卖点 |
| 7 月 30 日 | OpenAI | 下调 GPT-5.6 Terra 与 Luna API 价格 | 高频调用和 Agent 工作流的 Token 成本下降 |
| 7 月 31 日 | DeepSeek | DeepSeek-V4-Flash-0731 由预览版转为正式发布(公开 Beta) | Coding、工具调用和 Agent 能力进一步增强 |
这不是三家公司的同一种竞争方式。智谱在重新定义“订阅套餐”卖什么,OpenAI 在把基础设施效率转换成更低的 Token 价格,DeepSeek 则通过后训练提升模型在真实开发任务中的表现。
智谱涨价:Coding Plan 从低价套餐走向专业开发基础设施
智谱在 7 月 30 日更新了 GLM Coding Plan。新版套餐不只是简单修改月费,也重新设计了积分额度、高峰时段和模型权益。根据官方 Coding Plan 页面,目前三个套餐的价格和定位如下:
| 套餐 | 月费 | 官方定位 | 用量与权益 |
|---|---|---|---|
| Lite | 118 元 | 小型 Repo 轻量级迭代 | 每周 10,000 积分,逐步开放最新旗舰模型和功能 |
| Pro | 538 元 | 中型 Repo 日常开发 | Lite 的 6 倍用量额度、精选 MCP 工具、更快生成速度 |
| Max | 1078 元 | 中大型 Repo 深度开发 | Lite 的 14 倍用量额度、旗舰模型首发、高峰期资源优先保障 |
三个套餐都支持 ZCode、Claude Code 等 20 多种编程工具。与官方公告中列出的旧 V2 价格相比,Lite、Pro 和 Max 分别从 49 元、149 元和 469 元提高到 118 元、538 元和 1078 元;其中 Pro 的价格升至旧价约 3.6 倍,涨幅约为 261%,是三档中最明显的一档。官方公告同时说明,老用户权益不受影响,原有用户仍按照旧套餐规则执行。
从产品设计看,智谱现在出售的已经不只是“每月可以使用多少次模型”,而是三种不同级别的开发资源:Lite 面向轻量项目,Pro 面向日常开发,Max 则把旗舰模型首发和高峰期资源保障纳入套餐价值。
套餐不是无限调用:5 小时额度、周额度和模型倍率
GLM Coding Plan 同时设置了 5 小时积分上限和每周积分上限。Lite、Pro、Max 的额度分别为每 5 小时 2,000、12,000、28,000 积分,每周额度则分别为 10,000、60,000、140,000 积分。5 小时额度采用动态刷新机制:请求消耗的额度会在经过 5 小时后恢复;周额度则从套餐下单时间开始,以 7 天为一个周期刷新。套餐额度耗尽后,用户需要等待下一个 5 小时周期,系统不会自动继续消耗其他资源包或账户余额。
积分也不是简单地按“调用一次扣多少”计算。官方用量说明给出的模型积分公式是:
模型消耗积分 =(输入 Token × Input 系数 + 缓存命中 Token × Cached Input 系数 + 输出 Token × Output 系数)÷ 10,000
目前主要模型的抵扣系数如下:
| 模型 | Input | Cached Input | Output |
|---|---|---|---|
| GLM-5.2 | 6.9 | 1.7 | 24 |
| GLM-5-Turbo | 5.7 | 1.5 | 21 |
| GLM-4.7 | 4.6 | 1.2 | 16 |
| GLM-4.6V | 1.2 | 0.3 | 2.7 |
这个规则对 Coding Agent 很重要:代码生成和调试往往会产生较多输出 Token,而反复读取同一代码库则可能带来较高的缓存命中率。以 GLM-5.2 为例,Output 系数明显高于 Input,Cached Input 系数则低得多,因此“输出多少代码”和“上下文能否有效命中缓存”,都会影响套餐的实际使用时长。
官方预估的 Token 量,实际够做什么?
时间段会改变真实额度。每周一至周五 14:00~18:00(UTC+8)属于高峰时段,非高峰时段的模型调用按基础积分消耗的 50% 抵扣。官方以全部使用 GLM-5.2、缓存命中率 90.9% 为参考,估算出以下每周 Token 区间:
| 套餐 | 官方预估用量 | 更适合的开发强度 |
|---|---|---|
| Lite | 0.43 亿~0.87 亿 Token/周 | 小型 Repo 的代码问答、局部修改、Bug 修复和少量 Agent 任务 |
| Pro | 2.63 亿~5.26 亿 Token/周 | 中型 Repo 的日常开发、多轮调试、代码审查和连续 Agent 工作流 |
| Max | 6.13 亿~12.26 亿 Token/周 | 中大型 Repo 的深度开发、长上下文任务、多文件修改和高频工具调用 |
这些数字可以帮助我们建立一个直观判断:Lite 更像是轻量开发和个人项目套餐,适合处理明确、范围较小的任务;Pro 才适合把 Coding Agent 纳入日常开发流程,但如果一个任务需要反复读取大型代码库、生成大量代码、运行测试并继续修复,消耗速度会明显加快;Max 则更适合长时间、多轮次和多项目并行使用,但它也不是无限额度,仍然受到 5 小时积分和每周积分上限约束。
上面的区间不是固定承诺,而是基于特定模型、缓存命中率和使用时段的官方估算。全部在高峰期使用时接近区间下限,充分利用非高峰时段则更接近上限。官方还表示,充分利用非高峰时段时,相比按量调用 GLM-5.2 标准 API,最高可节省约 92% 成本。
不过,这些额度只能在官方支持的指定工具和产品环境中使用。除规定工具外直接调用 API,不能享受 Coding Plan 的套餐额度;OpenClaw 虽然支持接入,但采用次级调度和尽力交付策略,高负载时可能触发排队或限流。换句话说,购买套餐前不仅要看月费,还要确认自己的工具、调用方式和工作时间是否符合套餐规则。
这也解释了为什么新版价格不应该只用“涨价”两个字概括。对于新用户来说,月费确实大幅提高;但对平台来说,更重要的变化是从低价订阅转向分级资源管理。高峰期是否能稳定调用、能否优先使用最新模型、工具生态是否完整,开始成为 Coding Plan 的一部分产品价值。
OpenAI 降价:把模型效率转换成更低的 API 成本

7 月 30 日,OpenAI 发布了《Advancing the price-performance frontier with GPT-5.6》,正式宣布 GPT-5.6 Terra 和 Luna 降价。
按照公告,Terra 的价格下降 20%,调整为每百万 Token 输入 2 美元、输出 12 美元;Luna 的价格下降 80%,调整为每百万 Token 输入 0.20 美元、输出 1.20 美元。对于需要大量调用模型的自动化脚本、代码审查和后台 Agent,这类降价会直接影响每个任务的运行成本。此外,OpenRouter 的优惠模型页目前也为 GPT-5.6 Terra 与 Luna 提供 50% 的渠道侧优惠;该优惠仅适用于 OpenAI provider。为避免请求回退到其他供应商而失去该价格,调用时需要在 provider 字段中指定 order: ["openai"] 并设置 allowFallbacks: false,具体写法可参阅 OpenRouter Provider Routing 文档。
如果你想先了解 GPT-5.6 在本月正式公开时的 Sol、Terra、Luna 三档定位、初始定价,以及 Codex 并入 ChatGPT 的产品背景,可以阅读 GPT-5.6 正式公开:价格、性能与 Codex 并入 ChatGPT 全解析。这次降价是在那套模型与产品分层已经公开之后,对 Terra 和 Luna 的进一步价格调整。
OpenAI 的重点并不是单纯打折。官方表示,GPT-5.6 的价格性能提升来自多个层面的共同优化,包括模型本身、推理系统、Agent Harness、硬件利用率和生产环境软件。换句话说,模型成本下降并不只依赖训练出一个更小的模型,也依赖模型上线之后整套服务系统的效率。
OpenAI 同时推出了 Fast mode。它面向对延迟敏感的场景,在更高价格下提供更快的处理速度;官方称 Sol 在 Fast mode 下最高可以达到约 2.5 倍的速度,价格则是标准模式的两倍。这样一来,OpenAI 的产品分层变得更加清楚:普通 API 用户追求单位成本,高并发和低延迟业务则为速度支付额外费用。
这带来了一个很重要的变化:API 降价并不代表所有模型能力都变成“免费”。OpenAI 实际上是在把模型市场分成不同维度——标准模式竞争 Token 价格,Fast mode 竞争响应速度,模型版本则继续区分任务能力。对于开发者来说,选择模型时不能只比较每百万 Token 的价格,还要计算重试次数、工具调用次数、任务完成时间以及延迟对业务的影响。
DeepSeek V4 Flash:预览版转正,不一定扩大模型也可以提升 Agent 能力

7 月 31 日,DeepSeek 在官方更新日志中宣布,DeepSeek-V4-Flash-0731 由预览版转为正式发布并进入公开 Beta。这并不是 V4 Flash 的首次推出:该系列此前已以预览版形式提供;本次更新的重点是将预览版本转正,并强化 Coding、工具调用和 Agent 工作流能力,而不是单纯增加模型规模。
关于 V4 预览阶段的时间线、Flash/Pro 双模型、1M 上下文和 API 定价,可回顾 DeepSeek V4 预览版上线:1M 上下文、Flash/Pro 双模型与最新 API 价格。
DeepSeek 表示,V4 Flash 的架构和规模与预览版本保持一致,主要通过进一步后训练提升能力。官方公布的测试结果包括:Terminal-Bench 2.1 得分 82.7,NL2Repo 得分 54.2,DeepSWE 得分 54.4,Toolathlon Verified 得分 70.3。
这些成绩说明,模型是否能完成真实的软件工程任务,越来越依赖后训练、工具使用和上下文管理,而不只是参数量。对于 Coding Agent 来说,能否理解一个陌生 Repo、拆解任务、调用工具、修改文件并根据测试结果继续迭代,往往比单轮代码生成能力更重要。
不过,Benchmark 结果不能脱离评测配置直接横向比较。Harness、提示词、工具配置和并发设置都会影响结果。因此,更准确的表述是:DeepSeek 官方测试显示 V4 Flash 在多项 Coding 和 Agent 任务上取得了明显提升,而不是据此断言它在所有开发场景中全面领先。
另外,“预览版转正”也不等于已经完成所有生产环境验证。官方目前仍使用“公开 Beta”表述,意味着开发者可以开始接入和测试,但对稳定性、长任务成功率和复杂项目兼容性的判断,还需要更多真实使用数据。
三条消息背后的共同趋势:AI Coding 正在进入效率竞争
把三件事放在一起看,可以看到三个不同方向的变化。
1. 订阅模式开始出售资源保障
智谱的 Max 套餐已经达到每月 1078 元。它的核心卖点不是单纯增加调用次数,而是旗舰模型首发、高峰期资源优先和更适合大型 Repo 的开发体验。这说明 Coding Plan 正在从普通订阅产品变成一种开发资源服务。
对于平台来说,Agent 工作流会产生大量连续调用:读取文件、搜索代码、修改内容、运行测试、分析错误,然后重复迭代。一个高频用户消耗的资源,可能远高于传统聊天用户。固定月费模式因此必须通过额度、时间段和套餐等级来控制资源分配。
2. API 价格开始体现基础设施效率
OpenAI 的做法代表另一条路线:当模型和推理系统效率提高后,平台可以把一部分收益让渡给 API 用户,以更低的单位价格扩大调用量。
这对开发者尤其重要。只要模型质量足够稳定,Token 价格下降会降低代码审查、批量迁移、自动测试和后台 Agent 的运行门槛。模型提供商之间的竞争,也会从“发布一个更强版本”转向“用同样的预算完成更多任务”。
3. 模型能力评价从单轮问答转向任务完成
DeepSeek V4 Flash 强调的不是某个单项聊天能力,而是 Coding 和 Agent 场景中的综合表现。未来开发者更关心的问题可能是:模型能否独立完成一个 Issue?能否在有限上下文中修改多个文件?能否根据测试反馈持续修复?完成任务平均需要多少次工具调用?
这些指标比单纯的榜单排名更接近真实生产力,也更能解释为什么同一个模型在不同开发者手中会产生完全不同的成本和效果。
开发者应该如何理解这轮变化?
对于个人开发者和小团队,选择 Coding 工具时可以从四个维度开始评估:
- 项目规模:小型 Repo 不一定需要 Max 级别的额度,大型 Repo 则需要关注长任务稳定性和连续调用能力。
- 使用方式:固定月费适合高频交互式开发,API 更适合自动化任务和按量计费的业务系统。
- 延迟要求:代码生成慢几秒可能不是问题,但实时补全、在线审查和高并发服务可能需要为速度付费。
- 真实完成成本:不要只看输入输出价格,还要统计重试、工具调用、上下文重复发送和最终任务成功率。
一个更可靠的测试方法,是准备一组与自己业务接近的真实任务,记录每个模型完成任务所消耗的 Token、调用次数、耗时和人工修改时间。最后比较的不是“哪个模型榜单最高”,而是:
在相同预算下,哪个模型能稳定完成更多真实工作?
结语:AI 编程的下一轮竞争是单位任务成本
7 月底的这三条消息,分别代表了 AI Coding 市场的三个方向:智谱提高订阅价格并强化资源分层,OpenAI 降低 GPT-5.6 Terra 和 Luna 的 API 单价,DeepSeek 则将 V4 Flash 预览版转为正式发布,并通过后训练提升 Coding 和 Agent 能力。
一涨、一降、一升级,看起来是三种相反的动作,背后却共同指向了“效率”二字。平台需要提高算力和模型资源的利用率,开发者需要用更少的预算完成更多任务,模型则必须从回答问题进一步走向稳定地完成复杂工作流。
因此,AI Coding 的下一阶段可能不再是简单比较“谁的模型最强”,而是比较三个更实际的指标:每个任务需要多少成本、任务完成得是否稳定、开发者最终节省了多少时间。
相关资源
来源声明
本文来自 merchmindai.net。分享或转载本文时,请注明出处,并附上原文链接。
原文链接:https://merchmindai.net/blog/zh/post/ai-coding-zhipu-openai-deepseek-v4-flash-july-2026



