2026 年 7 月 30 日,GPT-5.6 的价格具体改了什么?
2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 降价 80%、Terra 降价 20%,旗舰级 Sol 价格不变。Luna 的输入价格由每百万 token 1.00 美元降至 0.20 美元,输出由 6.00 美元降至 1.20 美元。最便宜与最贵等级之间的差距,由 5 倍拉开至 25 倍。
这些数字来自 OpenAI 官方 公告帖文,日期为 2026 年 7 月 30 日。
降价后的 GPT-5.6 API 价格(美元/每百万 token)
--- Sol:输入 5.00 美元,缓存输入 0.50 美元,输出 30.00 美元。维持不变。
--- Terra:输入 2.00 美元(原 2.50),缓存 0.20 美元(原 0.25),输出 12.00 美元(原 15.00)。
--- Luna:输入 0.20 美元(原 1.00),缓存 0.02 美元(原 0.10),输出 1.20 美元(原 6.00)。
OpenAI 同时为 Sol 推出 API 的 Fast mode:速度最高达标准处理的 2.5 倍,价格为标准的两倍,模型智能水平不变。在 API 层面,这等同于把请求的 service tier 设为 priority。
还有一项变动,即使你从不接触 API key 也值得留意。ChatGPT 应用程序与 Codex CLI 的 Auto-review 由 GPT-5.4 换成 GPT-5.6 Luna,OpenAI 预期运行成本会低约十倍。换言之,替你把关高风险动作的那一层,现在跑的是最便宜的模型。
OpenAI 为什么降价,这件事对你有什么启示?
OpenAI 把降价归因于效率提升,而效率提升来自让 GPT-5.6 优化自己的服务架构:生产环境的 GPU kernel 改良带来 20% 服务成本下降,改良的 speculative decoding 带来超过 15% 的 token 生成效率提升。这些节省直接反映在 API、Codex 与 ChatGPT 上。
这一点在实务上很关键:这是基础设施的胜利,不是能力的跃升。
Luna 在 7 月 30 日没有变聪明,它只是变便宜。三个月前你因为输出品质不足而放弃的流程,今天品质依旧不足,只是花费少了五分之四。
反过来说也成立,而且更值得留意:任何你因为量太大、成本太高而不敢做的流程,今晚就值得重新测试一次。
Sol、Terra、Luna 三个等级的分别是什么?
GPT-5.6 是同一代模型,分成三个能力等级。Sol 是旗舰,为需要跨文件、跨测试、跨后续修正而保持连贯的长程推理而设。Terra 是成本较低的日常等级,OpenAI 形容其表现与上一代 GPT-5.5 相当。Luna 是最快、最便宜的等级,为高量、低推理需求的工作而设。
这套命名是刻意设计成可延续的。数字 5.6 代表世代,Sol、Terra、Luna 代表等级,各自可以按自己的节奏升级。因此你的流程应该绑定等级名称,而不是绑定某个版本字符串。
每个等级真正适合的工作
--- Luna:摘要、贴标签、抽取字段、分类客户讯息、生成初稿骨架、翻译样板文字。这些工作的品质微差不会改变结果。
--- Terra:日常生产等级。范围明确的撰写任务、初步审阅、你之后仍会亲自读一遍的文件分析。
--- Sol:那些你原本要预留半天处理的任务。多步推理、需要在大量文件或长串决策中保持连贯的工作,以及任何答错就会影响客户关系的输出。
大多数从业者的预设做法刚好相反:挑一个等级,通常是最好的那个,然后把所有工作都丢进去,因为切换模型感觉很麻烦。
同一份工作在三个等级上分别要花多少钱?
假设一个实际的月度任务:摘要 1,000 份文件,每份约 4,000 个输入 token,输出 600 字摘要。合计 400 万输入 token、60 万输出 token。用 Luna 跑要 1.52 美元,用 Terra 要 15.20 美元,用 Sol 要 38.00 美元。
把算式摊开来看,比例比大多数人想像的更干净。
--- Luna:4 x 0.20 美元 加 0.6 x 1.20 美元 = 1.52 美元,按联系汇率约 12 港元。
--- Terra:4 x 2.00 美元 加 0.6 x 12.00 美元 = 15.20 美元,正好是 Luna 的 10 倍。
--- Sol:4 x 5.00 美元 加 0.6 x 30.00 美元 = 38.00 美元,正好是 Luna 的 25 倍。
7 月 30 日之前,同一份 Luna 工作要 7.60 美元。也就是说,便宜的那条线便宜了五倍,贵的那条线原地不动。
你应该把这视为行业走向的信号,而不是一次性折扣。同样的模式也出现在各家厂商如何为 AI 功能计费,这一点我们在 什么是 AI Credits 一文有详细讨论。
实务结论:如果一项任务确实属于例行工作,而你把它跑在 Sol 上,你就是在为自己没有用到的推理能力多付 25 倍。
不写程序,如何把工作分派到不同等级?
你不需要一个路由系统,你需要一个分流习惯,以及一个把模型名称当成变量而非固定假设的位置。实务上就是把每项重复任务拆成便宜的第一轮与昂贵的第二轮,然后只为第一轮筛不出结果的项目付第二轮的钱。
以下这套做法在真实工作中站得住脚。
第一步:把任务拆成「抽取」与「判断」。几乎每项知识工作都有机械的一半与判断的一半。从供应商报价中抽出五个关键数字是抽取;决定要不要接受这份报价是判断。前一半交给 Luna,后一半留在 Terra 或 Sol。
第二步:把便宜的模型放在前面,不是后面。让 Luna 为全部 40 封来信生成结构化摘要,你只细读被标示为需要决策的那几封。昂贵的模型从头到尾都不会看到那 33 封其实很例行的信。
第三步:让模型名称成为自动化流程中的一个字段,而不是常数。在 Zapier、Make 或 n8n 里,模型名称就在 AI 步骤的下拉选单。复制那个步骤、换一个等级、用同样的 20 笔数据各跑一次,并排比较后才决定。如果你还没建过这类流程,可以先看 不写一行程序,如何用 AI 自动化你的工作。
第四步:用规则升级,不要凭感觉。要求便宜的模型在每次输出结尾附上信心水平与理由,然后只把低信心的项目送去昂贵等级。这一个改动,就是让等级分流从琐碎变成自动的关键。
等级分流在什么情况下会失效?
等级分流会在四个可预期的地方失效:表面机械但暗藏判断的任务、便宜模型在前段出错而后续层层放大的长流程、为强模型写成却交给弱模型执行的提示,以及任何「一次错误输出的代价高于一个月 API 节省」的流程。
暗藏判断的陷阱。按主题为客服工单分类是机械工作;按紧急程度分类却不是,因为紧急程度取决于客户是谁、上星期说过什么。便宜的模型会处理好前者,然后在后者上悄悄猜答案。
错误层层放大。如果第一步把文件摘要错了,第二至第五步都建立在错误摘要之上,之后每一份输出都会看起来很有信心而且是错的。便宜等级属于流程的两端,不属于流程中段。
被继承的提示。在 Sol 上有效的提示,往往假设模型会自行补齐你没写出的结构。把它搬到 Luna,缺失的结构就会变成粗糙的输出。解法不是换更好的模型,而是写更明确的提示,这正是 情境工程 的重点。
代价不对称。如果客户报告中一个数字出错就会丢掉整个客户,那你这个月省下的 36 美元根本不算节省。面向客户的最后一轮,留在你信得过的等级,把省下的钱花在别处。
关于 Fast mode 还有一点要提醒:它用两倍价格买到的是延迟改善,对输出品质毫无影响。当有人正在画面前面等结果,就开启它;凌晨三点跑的批次任务,关掉它。
立即试用:15 分钟等级审核提示
把这段提示对着你自己的重复任务清单跑一次,大约需要 15 分钟,通常会找出两三项正跑在贵三倍等级上的任务。你可以贴进任何一个 GPT-5.6 等级、Claude 或 Gemini,因为这是关于你工作流程的推理任务,而不是绑定某个模型的技巧。
复制以下提示:
你正在协助我审核:我每项重复任务应该跑在哪一个 AI 模型等级上。我会给你一份任务清单,请对每一项做以下四件事。
1. 把任务拆成机械成分(抽取、摘要、分类、重新排版)与判断成分(决定、排优先、说服、评估取舍),各用一句话说明。如果某项任务没有判断成分,请明确指出。
2. 为机械成分与判断成分各推荐一个等级,依据以下标准:CHEAP 用于高量工作,品质微差不改变结果;MID 用于范围明确、我之后仍会亲自审阅的生产工作;TOP 用于多步推理,或任何客户会直接看到而我不会再改的输出。
3. 用一句话指出:如果我把整项任务都跑在 CHEAP 上,最可能出现的单一失效模式是什么,并描述那个失效在输出中会长成什么样子,让我能辨认出来。
4. 写一条我可以机械执行的升级规则,格式为:当〔便宜输出中可观察到的条件〕出现时,升级到较高等级。
最后用一个表格,按我可能浪费的金额由高至低排列这些任务,并说明你排序时用了哪些依据。如果某项任务描述得太模糊而无法判断,请向我提出一个厘清问题,不要凭空猜测。
我的重复 AI 任务如下:〔列出 5 至 10 项任务,并附上每项的大致月度数量〕
然后今天就只执行其中一项建议:复制那个自动化步骤、切换等级、用 20 笔真实数据各跑一次,亲自比较输出,不要只相信跑分表。
核心结论:便宜现在是设计选择,不是妥协
7 月 30 日的降价没有让任何模型变好,它改变的是「合理预设值」该放在哪里。当最便宜的等级只需旗舰的二十五分之一,把所有工作都推给旗舰就不再是谨慎,而是浪费。
真正从这次降价中获益的人,不会是把所有东西都换成 Luna 的人,而是能够针对每一项每周执行的任务,清楚说出哪一半是机械、哪一半需要判断的人。
这种拆解能力本身就是一种技能,而且不论你面前的模型来自 OpenAI、Anthropic 还是 Google,都是同一种技能。模型名称每几个星期就换一次,但看懂自己的工作真正需要什么,不会过时。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 团队审阅。
把等级审核变成真正运作的系统
知道一项任务该放在哪个等级只是第一步,把它变成每天自动运行、你不用盯着的流程才是第二步。UD 团队手把手带你完成每一步,从任务分流、模型选择,到让整个工作流自己跑起来。
UD 陪伴香港企业走过 28 年的科技变迁。