2026 年,一项 AI 任务的真实成本是多少?
把一份 40 页报告做成摘要,成本介乎 0.02 至 0.13 美元,约合 0.15 至 1.00 港元,差别只在于你把它送去哪一个模型。同一项工作,最便宜与最昂贵的选项相差约七倍,而对大多数例行工作而言,昂贵的那个并不会好上七倍。
只通过月费订阅使用 AI 的人,通常会对这个数字感到意外,因为订阅制把每项任务的成本完全隐藏起来。一旦你把 AI 放进自动化流程、试算表脚本,或 Make、n8n 这类工具,你就开始按 token 付费,帐目也随之浮现。
本文就是这笔帐。截至 2026 年 8 月 19 日的官方公布价格、一个完整计算示例,以及这些数字何时会失效的诚实说明。
GPT-5.6、Gemini 3.7 Flash 与 Claude Sonnet 5 每百万 tokens 收费多少?
以下为截至 2026 年 8 月 19 日的 API 公布价格,单位为每一百万 tokens 的输入与输出。一百万 tokens 约相当于 75 万个英文本。价格全部来自各供应商本身的公告,而非第三方追踪网站。
现行公布价格
--- Gemini 3.7 Flash:输入 0.75 美元 / 输出 3.75 美元。2026 年 8 月 13 日公布的优惠价,有效至 2026 年 12 月 31 日。按 Google 官方注脚,2027 年 1 月 1 日起将调整为 1.50 / 7.50 美元。
--- GPT-5.6 Luna:输入 1 美元 / 输出 6 美元。OpenAI 速度最快、成本最低的一级。
--- Claude Sonnet 5:输入 2 美元 / 输出 10 美元。Anthropic 于 2026 年 8 月 10 日宣布此优惠价正式成为长期价格,取消原定 9 月 1 日起实施的 3 / 15 美元收费。
--- GPT-5.6 Terra:输入 2.50 美元 / 输出 15 美元。OpenAI 定位为日常工作的均衡一级,官方形容其表现可与 GPT-5.5 竞争,价格则为一半。
--- GPT-5.6 Sol:输入 5 美元 / 输出 30 美元。旗舰一级,为长时程代理式工作而设。
五个价格之中,有两个附带到期日。对于任何打算在 2027 年仍然运行的工作流程,这是本文最重要的一项事实。
一项真实任务要多少钱:一份 40 页报告的摘要
一份 40 页报告约 15,000 字,换算约 20,000 个输入 tokens;一份 800 字摘要约 1,100 个输出 tokens。把这两个数字乘以各自价格,就得出单次运行的真实成本。
单次 40 页摘要的成本
--- Gemini 3.7 Flash:0.019 美元,约 0.15 港元
--- GPT-5.6 Luna:0.027 美元,约 0.21 港元
--- Claude Sonnet 5:0.051 美元,约 0.40 港元
--- GPT-5.6 Terra:0.067 美元,约 0.52 港元
--- GPT-5.6 Sol:0.133 美元,约 1.04 港元
港元数字以约 7.8 汇率换算,并不包括支付手续费,以及自动化工具本身另行收取的平台费用。
值得留意哪一项主导成本。输入是 20,000 tokens,输出只有 1,100,所以在摘要类任务中,是输入价格决定帐单。若换成产出长篇内容的任务,例如把一份演示文稿扩写成十页,主导的就变成输出价格,比例会完全不同。
用量到达什么水平,API 帐单才比月费订阅划算?
每月 100 份报告摘要,API 成本由 Gemini 3.7 Flash 的约 1.91 美元,到 GPT-5.6 Sol 的约 13.30 美元,即约 15 至 104 港元。而一个 20 美元的消费者订阅席位,无论你一个月运行一次还是 400 次,都是约 156 港元。
每月 100 份摘要,按模型计算
--- Gemini 3.7 Flash:约 1.91 美元,15 港元
--- GPT-5.6 Luna:约 2.66 美元,21 港元
--- Claude Sonnet 5:约 5.10 美元,40 港元
--- GPT-5.6 Terra:约 6.65 美元,52 港元
--- GPT-5.6 Sol:约 13.30 美元,104 港元
诚实的结论并不是「取消你的订阅」。订阅买到的是应用程序、文件处理、图像生成、语音,以及一张你不会在凌晨两点意外爆掉的固定帐单。API 买到的是按任务计算的单位经济,以及把模型放进无人看管流程的能力。
判断点在于工作是否重复而且有调度。一次性的思考工作,留在你已经付费的对话应用程序里;每月重复一百次的同一项任务,才属于按 token 计费的自动化流程。
提示缓存(prompt caching)如何改变帐单?
提示缓存会以大幅折扣计算重复的上下文。对于每次运行都重新发送同一份品牌指南、价目表或系统提示的流程来说,这通常是最大的一笔可节省开支。OpenAI 说明,由 GPT-5.6 及之后的模型起,缓存读取享有输入价格 90% 折扣,而缓存写入则按未缓存输入费率的 1.25 倍计算。
GPT-5.6 同时引入明确的缓存断点,以及 30 分钟的最短缓存存活时间。实际后果是:每 20 分钟触发一次的流程可以维持缓存有效,而每小时才触发一次的流程,每次都要重新支付写入溢价。
由此得出的设计原则很简单:把稳定不变的内容放在提示前段,包括品牌指南、范例与规则,把会变动的内容放在最后。缓存针对的是未改变的前缀,所以单是调整提示的次序,就能在一字未改的情况下降低输入帐单。
一个实例:一份 4,000 tokens 的风格指南,每月在 GPT-5.6 Luna 上重新发送 500 次,未缓存为 2 美元,走缓存读取则约 0.20 美元。绝对金额细小,比例却极大,而这正是这类帐单在无人察觉下膨胀的方式。
每项工作应该分派给哪个模型?
按「出错的后果」分派,而不是按名气分派。分类、标签、例行摘要与初稿,交给有能力完成的最便宜一级;任何未经编辑就送到客户眼前的内容,或需要跨多个步骤无人看管运行的流程,才值得旗舰价格。
按用户类型的建议
--- 运行调度内容工作的独立市场推广人员或自由工作者:Gemini 3.7 Flash 或 GPT-5.6 Luna。在这种用量下每月帐单维持在 50 港元以下,而例行文本的质素差距很小。
--- 产出由客户直接阅读的长篇文本者:Claude Sonnet 5。它的价格处于中段,也是实务工作者最常提及、行文需要较少后期修饰的模型。
--- 把多步骤业务流程自动化的营运负责人:以 GPT-5.6 Terra 作缺省,只在答错代价高昂的步骤才升级到 Sol。
--- 需要处理复杂 PDF 与结构化文档者:Gemini 3.7 Flash。Google 公布它在 GDP.pdf 文档理解基准上取得 34.0%,而 3.6 Flash 为 22.0%。
--- 跨大量工具调用的长时程代理工作:GPT-5.6 Sol。这是 OpenAI 专为持续性任务打造的一级,也是唯一一个在例行工作上仍能为溢价辩护的选择。
这些数字在什么情况下不再成立?
本文每一个数字,都是标准级别、纯文本 tokens 的公开牌价,而不少真实成本落在这个范围之外。请把这张表当作下限,而不是预测。
--- 五个价格中有两个会到期。按 Google 自己公布的时间表,Gemini 3.7 Flash 于 2027 年 1 月 1 日起价格翻倍。Claude Sonnet 5 的价格虽已成为长期价格,但「长期」是一项企业声明,不是合约。
--- 推理 tokens 按输出计费。把推理强度设为高或最高时,模型产生的计费 tokens 可以是可见答案的数倍。GPT-5.6 添加了最高等级的推理设置,而它并不免费。
--- 图像、音频与视频另有计费方式。本文内容完全不适用于图像生成或多模态输入,两者使用独立费率,并且往往按件计费。
--- 你的自动化平台会另外收费。Make、Zapier 与 n8n 按操作数或运行次数收费,与底层 token 成本无关。在小型任务上,平台费用经常高于模型费用。
--- 消费者订阅层级是另一种产品。对话方案的速率限制、模型访问权与功能,与 API 访问并不相同,你无法从其中一个价格推算另一个。
如果你根本不想管理模型呢?
那么按 token 计价的表格就不是适合你的工具,而诚实的替代方案,是一套已经由别人替你选好模型的现成配置。UD 的 AI 员工招聘处正是其中之一:8 位预先建置的 AI 员工,涵盖 24 项专业技能,月费 0 港元,免费提供予香港企业使用。
这些角色相当具体,而非笼统的助手。Amy 负责社交媒体,David 负责 SEO 与内容,Eva 处理日程、文档与会议纪录,Frank 创建数据仪表板,Henry 则负责安全审计,包括 PDPO 合规与漏洞扫描。
请清楚了解取舍。招聘处不会让你选择底层模型,不会给你一张可供优化的 token 帐单,也不会帮你在 Luna 与 Terra 之间作决定。如果按成本分派模型才是你真正的问题,招聘处解决不了,本文那张表才可以。
它解决的是相反的问题:你要的是产出,而不是基础设施上的决策。如果你为了一项每星期只运行两次的工作,花了两个晚上比较 token 价格,那正是你在优化错误层次的信号。
简短版本
2026 年,一项 AI 任务的成本是以「仙」计算而非以「元」计算,而在例行工作上,不同模型之间的差距是每月数十港元,而不是数百港元。真正昂贵的失误都是结构性的:一份未经缓存、被重复发送数千次的系统提示、一个长期停留在最高等级的推理设置,又或者用旗舰模型去做分类工作。
在创建任何你预期明年仍在运行的流程之前,先确认那两个附带到期日的价格。然后按后果分派模型、为稳定内容激活缓存,并停止为从来不需要旗舰规格的任务支付旗舰价格。
如果你想在输出质素而非成本上再深入一层,我们关于验证链提示法的指南,讲解了一个四分钟流程,用来揪出较便宜模型答错的事实。懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
由 UD AI 团队审阅。
直接跳过模型比较
如果你想要的是能立即上工的 AI 员工,而不是一张 token 价格试算表,不如由 8 位月费 0 港元的现成 AI 员工开始。UD 团队手把手带你完成每一步,由挑选合适角色,到在你现有工具中完成安装。