2026 年 8 月 26 日,ChatGPT 究竟改变了什么
OpenAI o3 将于 2026 年 8 月 26 日从 ChatGPT 的模型选单中移除,这是 90 天日落期的终点。此次退场仅涵盖 ChatGPT,不包括 API。你的提示词仍然可用,但从那天起,执行它们的是另一个模型,而选择权不在你手上。
大多数把 o3 固定在选单里的人,并未留意这则通知。而几乎没有人核实过,OpenAI 指向的接替模型,是否就是自己真正应该使用的那一个。
这已是 ChatGPT 今年第二次强制转移。GPT-4.5 在 2026 年 6 月 27 日以同类的日落安排退场,官方 DALL·E GPT 则排在下一个,退役日期为 2026 年 8 月 30 日。
比任何单一次退场更值得留意的是这个模式本身。模型选择曾经是一次性的设定,如今它是一项有日期的维护工作。如果你把它当成永久设定,最终会有供应商替你做决定。
为什么官方指定的接替模型不一定适合你
OpenAI 公布的 o3 接替者是旗舰级的 GPT-5.6 Sol,定价为每百万输入 token 5 美元、输出 30 美元。而定位均衡的 GPT-5.6 Terra,在 2026 年 7 月 30 日调价后为 2 美元与 12 美元。对于大多数人过去用 o3 处理的工作,Terra 才是诚实的起点。
原因很直接。o3 是一个被用于极广泛任务的推理模型,而其中绝大多数任务从来不需要旗舰级的运算成本。整理杂乱的会议记录、重组简报结构、检查一份电子表格的逻辑,这些都不是 Sol 级别的问题。
Terra 的 token 成本大约是 Sol 的四成。如果你只因为一则发行说明就把所有请求都导向 Sol,你其实接受了一次没有人要求你论证的加价。
这里还有一个时间陷阱。OpenAI 在 2026 年 8 月将 Sol 的 API 及点数定价下调超过两成,但只维持三个月。建立在促销价之上的预算,会在 11 月失效。
如果你只透过订阅使用 ChatGPT,你不按 token 付费,选单如今呈现的是 Instant、Thinking 与 Pro 而非模型名称。成本问题依然会间接影响你,只是形式变成了你的方案能用哪一层,以及它获准花多少推理资源。
在星期三之前,值得花 20 分钟做的替代测试
挑选替代模型的可靠方法,是先用你自己最常用的三个提示词去测试较便宜的候选模型,只在它明确失败的地方才升级。整个过程约需二十分钟,而你得到的是一个站得住脚的预设值,而非一份供应商建议。
打开你的 ChatGPT 对话记录,找出你真正会重复使用的三个提示词。不是最亮眼的那些,而是那些枯燥、重复、实际撑起你一周工作的提示词。
在执行任何测试之前,先为每一个提示词写下成功测试:用一句话描述你如何判断输出是错的。少了这一步,你最终会凭语气做判断,选中那个听起来最有自信的模型。
可直接复制的提示词:
--- 你正在协助我从一个已退役的 AI 模型迁移。我将贴上一个我日常使用的提示词。
--- 步骤 1:用一句话重述这个提示词实际上在要求什么。
--- 步骤 2:列出较弱的模型在回答它时,最可能出现的三种失败模式。
--- 步骤 3:写出一份成功测试:一份包含 4 个检查项目的清单,让我能在 60 秒内验证某个输出是否可接受。
--- 步骤 4:告诉我哪一个最低成本级别的模型有可能通过该测试,以及具体在什么情况下必须升级到更强的模型。
--- 不要改写我的提示词,也不要回答它,只需产出上述分析。
--- 我的提示词:[在此贴上你的提示词]
接着在较便宜的候选模型上执行原本的提示词,按照刚才产出的清单逐项评分,只在某一个具体项目失败时才升上一级。然后把结果记录在你日后找得到的地方。
每个目的地各自适合什么工作
o3 没有单一的替代品,因为 o3 同时承担了几种不同的工作。请按任务配对目的地:日常分析用中阶模型,真正困难的推理用旗舰模型,交付成果本身很长时,则用长上下文模型。以下是影响这个选择的公开事实。
公开的 token 定价,截至 2026 年 8 月 25 日
--- GPT-5.6 Terra:每百万 token 输入 2 美元、输出 12 美元,于 2026 年 7 月 30 日由 2.5 美元与 15 美元下调。
--- GPT-5.6 Sol:输入 5 美元、输出 30 美元。API 及点数定价自 2026 年 8 月起下调超过两成,为期三个月。
--- GPT-5.6 Luna:最快且最便宜的一层,推出时为输入 1 美元、输出 6 美元,同样在 2026 年 7 月调降。
--- Claude Sonnet 5:输入 2 美元、输出 10 美元。Anthropic 于 2026 年 8 月 10 日将此价格永久化,取消了原定 9 月 1 日调升至 3 美元与 15 美元的安排。
--- Claude Opus 5:自 2026 年 7 月 24 日起提供,具备 100 万 token 上下文视窗,输出上限达 128K token。
哪一类工作该去哪里
--- 日常分析、撰写初稿、重组结构、数据合理性检查:从 Terra 或 Claude Sonnet 5 开始,两者输入价同在 2 美元一线。
--- 真正困难的多步推理,且答错代价高昂:用 Sol,但仅在 Terra 于该项具体任务上未能通过你的清单之后。
--- 文件庞大、交付成果本身很长:用 Claude Opus 5,其上下文与输出上限约为多数对手的两倍。
--- 快速、大量、低风险的呼叫,例如分类或标签:用 Luna。
推理强度如今是一项设定,而不是你写在提示词里的一句话。我们在这篇关于推理模型提示方式的文章中谈过它如何改变提示词的写法,而这对你最终选择的任何目的地都同样适用。
那些在你不知不觉间耗掉金钱的陷阱
拖垮模型迁移的通常是三件事:在你脚下改变的 token 计算方式、你没有纳入预算的延迟,以及误以为 ChatGPT 的公告同样涵盖你的整合流程。每一项都有具体的应对方法。
表面价格较低,帐单不一定较低。Anthropic 较新的分词器可能使计费 token 数增加最多 35%,这足以吃掉 2 美元与 2.5 美元输入价之间的差距。请用你自己的文本实测,而不是看比较表。
ChatGPT 退场不等于 API 退场。o3 的快照 o3-2025-04-16 与 o3-pro-2025-06-10,其 API 移除日期定于 2026 年 12 月 11 日,这是 2026 年 6 月 11 日一则开发者通知所订。如果你的 Zapier、Make 或 n8n 步骤指名了某个 o3 快照,它现在仍会运行,然后在 12 月断掉。今天就把这个日期放进日历。
关于旧模型存取的说法并不一致。有来源指 o3-pro 仍可透过旧版模型设定供较高付费层使用,也有来源说它已从标准选单消失。请打开你自己的设定查看,而不是相信一份为另一种方案而写的摘要。
更多推理不是免费的。较高的推理层级会增加延迟与成本,而在直白的任务上,它经常没有带来其他好处。升级要有证据,而不是凭不安。
还有一项必须诚实说明的限制:以上成本表是公开定价,不是你的帐单。快取输入、批次折扣与各方案的点数配额都会移动实际数字,任何忽略你自身使用结构的比较,都只是装饰。
把模型选择变成一项有维护的设定,而不是靠记忆
退场公告只会持续出现,因此耐用的解法是一份写下来的预设值,而非一个习惯。一份简短的档案,能把下一次强制迁移从整天救火,变成二十分钟重跑一次你早已写好的测试。
在纯文字笔记中保留四栏:任务类型、模型、原因、最后测试日期。对大多数人来说四行就够了。真正救你的是「原因」那一栏,因为三个月后你不会记得。
把你的三个黄金提示词及其预期输出格式,放在那份笔记旁边。这就是你的基准测试集,它比任何排行榜都值钱,因为它由你的实际工作构成。
在可行的情况下,避免在提示词与范本的文字中指名特定模型。提示词里的模型名称,正是一次退场会演变成几十份文件编辑工作的原因。
然后按固定节奏重跑这一组测试,每季一次已相当足够,并在任何退场通知出现时立即执行。转换的成本不在价差,而在于没有人写下「好」是什么样子,因而白白损失的那个下午。
星期三之前的结论
o3 于 2026 年 8 月 26 日离开 ChatGPT。官方指定的接替者是旗舰层,但较便宜的中阶层已能覆盖你过去大部分的工作,而唯一的判断方法,是先写好清单,再用你自己的三个提示词去测试。
模型更替不会慢下来。你能控制的是:下一则退场通知找上你时,你手上有的是一份写好的预设值,还是一个从去年起就没再看过的模型选单。
这正是伙伴比排行榜更有用的地方。懂AI的冷,更懂你的难,UD 同行28年,让科技成为有温度的陪伴。
本文由 UD AI 团队审阅。
想知道你的 AI 能力实际处于哪个水平?
知道该换用哪个模型是一种能力,知道你的哪些工作流程仍值得动用旗舰模型是另一种。做一次 UD 免费的 AI IQ 测试,为自己的 AI 水平定位。若你想把工作流程好好建起来,UD 团队手把手带你完成每一步,从模型选择、提示词范本,到实际部署。