Anthropic 在 2026 年 9 月 1 日推出 Claude Fable 5.1。不到一天,惯例的比较文章便涌现,内容全是基准测试,却没有一张帐单。所以以下是真正付钱的人需要的版本:三大旗舰模型目前每百万 token 的实际收费,以及哪一个值得你把预算投在哪一类工作上。
这是一个支出决策,而非排行榜。以下是实际公布的费率、其中一个会在毫无预警下翻倍的陷阱,以及一条你本周就能套用的决策规则。
三大旗舰模型每百万 token 的实际收费
截至 2026 年 9 月,Claude Fable 5.1 为每百万输入 token 10 美元、每百万输出 token 50 美元。GPT-5.5 为输入 5 美元、输出 30 美元。Gemini 3.1 Pro 在标准提示下为输入 2 美元、输出 12 美元。在同一级别的模型之间,输入成本相差五倍,输出成本相差四倍。
另有两个数字并不在这张表内,却比台面上的费率更能左右决策。
Claude Fable 5.1 的缓存读取为每百万 token 0.25 美元。这比 Fable 5 便宜 75%,也是 Anthropic 形容典型工作负载约便宜 25%、高度代理式工作负载最多约便宜 45% 的原因。如果你的流程在每一轮都重复读取同一份长文档、风格指南或程序库,那么缓存费率才是你的实际费率,而非输入费率。
GPT-5.5 Pro 为输入 30 美元、输出 180 美元。这是独立的研究级层级,并非缺省选项。它的输入与输出成本都是标准版 GPT-5.5 的六倍。如果你曾对 OpenAI 的帐单感到意外,请先确认你实际调用的是哪一个。
令 Gemini 帐单翻倍的 20 万 token 悬崖
Gemini 3.1 Pro 的 2 美元输入费率,只适用於单次提示的上下文低于 20 万 token 的情况。一旦越过这条线,输入约翻倍至每百万 4 美元,输出则由 12 美元升至 18 美元。名单上最便宜的模型,恰好在你开始使用当初选它的长上下文时,不再是最便宜的。
这一点之所以令人措手不及,是因为长上下文窗口正是 Gemini 的招牌功能。宣传的是一百万 token,价格分界却设在其五分之一处。如果你的流程是「把整份季度报告丢进去然后提问」,你已经站在悬崖的另一边,付的是 4 美元与 18 美元,与 GPT-5.5 的差距因而大幅收窄。
务实的应对方式并非避开长上下文,而是弄清楚你哪些提示会越过 20 万 token,并把不必要越线的拆开。把一份 30 万 token 的文档切成两次 15 万 token 的处理,能让你留在便宜的一边,代价是失去跨文档推理能力。这个交换是否值得,完全取决于任务本身,而这正是没有人想听的诚实答案。
作为个人用户,你实际付的是多少
如果你是市场人员、文案或营运经理而非开发者,每 token 费率只是背景信息。真正扣你信用卡的是消费者订阅层级,而它们已收敛至每月约 20 美元:ChatGPT Plus 为 20 美元、Claude Pro 为 20 美元、Gemini 付费层为 19.99 美元。换算成港币,每个订阅约为每月 155 港元。
这种收敛本身才是重点。由于订阅价格实际上相同,价格在个人层面并非决胜因素,「每项任务的能力」才是。这与 API 的情况恰好相反,在那里五倍的成本落差令价格成为主导变量。许多实践者把 API 层面的成本焦虑,硬套进一个根本不适用的订阅决策上。
两个订阅约为每月 310 港元。这对自由工作者是一个真实的数字,对公司却是零头。如果你正靠这些工具向客户收费,同时运行两个通常是更好的决定,至于是哪两个,稍后会回到这一点。
决策规则:把模型对应任务,而不是对应基准分数
请忽略综合排行榜分数。它们把你并不运行的任务类型平均在一起。真正有用的规则,是把你自己的工作分成三类,并为每一类指派一个模型:长篇文本输出、高量低成本吞吐,以及大上下文分析。
长篇文本输出。Claude 在自然长篇文本上声誉最强,而以每百万输出 token 50 美元计,它同时也是产出大量文本最昂贵的地方。这个组合指向一个特定用途:定稿与高风险写作,而非初稿与大量内容。昂贵的模型应该用在输出本身就是交付物的地方。
高量低成本吞吐。分类、标签、摘要一百张客服工单、撰写多个版本。只要每次提示都维持在 20 万 token 以下,Gemini 3.1 Pro 的 2 美元与 12 美元便毫无疑问胜出,而这类工作几乎总是如此。
大上下文分析。这正是悬崖与缓存费率相撞的地方。如果你反复针对同一份大型文档提问,Claude Fable 5.1 的 0.25 美元缓存读取,即使台面费率较高,仍可胜过 Gemini 越线后的 4 美元输入。如果你每次读的都是不同的大型文档,缓存毫无作用,Gemini 再次胜出。问题不在于哪个模型较便宜,而在于你的上下文是否重复。
每个模型在什么情况下是错的选择
以下是诚实的限制,因为一份每一项都由同一个选项胜出的比较,是销售页而非分析。
Claude Fable 5.1 不适合大量生成。每百万输出 token 50 美元,是 Gemini 输出费率的五倍。任何价值来自产出数量而非产出品质的流程,都在被过度收费。缓存折扣改善的是输入成本而非输出成本,而大量生成正是输出密集型的工作负载。
当你在两端都对价格敏感时,GPT-5.5 是错的选择。它在输入与输出上都位居中间,意味着它很少是最便宜的,也很少是专项首选。它的理由在于广度、生态系统,以及在单一订阅中同时涵盖图像生成,这是一个真实的理由,只是不属于成本理由。
当你的提示确实庞大且不重复时,Gemini 3.1 Pro 是错的选择。越线后的 4 美元与 18 美元抹去了大部分优势,而你选择这个模型的理由,是一个已不再适用于你工作负载的价格。
而如果你从未量度过,三者都是错的选择。大多数实践者无法说出自己每月的 token 用量,或输入对输出的比例,这使本文所有成本比较对他们而言都无法使用。那才是真正的第一个问题,而非模型选择。我们关于AI FinOps 与 AI 预算背后的纪律一文,说明了如何取得这个数字。
价格会变动,所以要留意已公布的调整
以上每一个数字都是 2026 年 9 月的快照,而其中至少一个已排定变动。Google 已公布 Gemini Flash 的价格调整将于 2027 年 1 月 1 日生效,我们在2027 年 1 月 1 日有什么会翻倍一文中另行处理。创建成本模型时,应设计成可以重跑,而不是只求一次正确。
实务上,这意味着三个习惯。在你产出的每一份成本估算旁边,记下模型名称与版本,因为没有版本的费率报价在六个月后毫无价值。每季重新查核官方公布的价格页面,而不是相信比较文章,包括本文。以及避免把流程架构得过度贴合某一供应商的当前费率,以致 30% 的涨价就迫使你重写。
立即试用:两周成本审计提示词
在切换任何东西之前,先取得你自己的数字。导出你过去两周的 AI 使用记录,或诚实地估算,然后在你已经付费的模型中运行以下提示词。
提示词:
You are helping me choose which AI model to pay for. Here is my actual usage over the last two weeks: [paste or describe your tasks, roughly how many per week, typical input length, typical output length, and whether the same source document is reused across prompts]. Using these September 2026 published rates, Claude Fable 5.1 at US$10 input and US$50 output per million tokens with cache reads at US$0.25 per million, GPT-5.5 at US$5 input and US$30 output, and Gemini 3.1 Pro at US$2 input and US$12 output rising to US$4 and US$18 above 200,000 tokens of context, do the following. First, estimate my monthly token volume split into input and output. Second, calculate my monthly cost on each of the three models and show the arithmetic. Third, tell me which single model is cheapest for my mix and by how much. Fourth, tell me whether splitting my work across two models would save more than it costs in workflow complexity, and name which tasks go where. State every assumption you make and flag anything you had to guess.
输出会很粗略,因为你的输入本身就粗略。但它仍然比看着基准测试图表做选择更准确,而且只需十分钟。
结论:按你的身份对号入座
以下是可直接引用的摘要,依据 2026 年 9 月费率。
只用一个订阅的个人实践者:价格几乎一致,都是每月约 20 美元,因此应依你最常做的工作来选。长篇写作指向 Claude Pro;在 Google Workspace 内做研究与数据处理指向 Gemini;单一工具涵盖面最广、包含图像的则指向 ChatGPT Plus。
能同时运行两个的个人实践者:合计约每月 310 港元。应搭配一个强写作工具与一个强数据研究工具,而不是两个通用型。
做大量工作的 API 用户:Gemini 3.1 Pro 的 2 美元与 12 美元,并订立一条硬规则:提示须维持在 20 万 token 以下。
反复分析同一批数据的 API 用户:Claude Fable 5.1,理由在于 0.25 美元的缓存读取,而非台面费率。
任何说不出自己每月 token 用量的人:先量度。未经量度的工作负载,最便宜的模型是不可知的,而基于猜测所作的切换,令你多花钱的机会与省钱的机会一样大。
如果你想在把预算投向某一个模型之前,更快看清现有模型在不同任务类型上的排序,UD 的 AI Rank 工具以工作职能而非综合分数来铺陈比较,而这正是与你实际支出方式相符的轴线。
模型定价将持续变动,十二月适合你的模型,未必是今天适合你的那一个。不变的是决策底下的习惯:量度自己的工作负载、对照官方费率计价、每季重新查核。懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴
本文由 UD AI 团队审阅。
为你的 AI 支出定出一个数字
选模型只是其中一个决策。真正能回本的,是弄清楚团队实际花了多少、以及那些支出浪费在哪里。UD 团队手把手带你完成每一步,由用量量度、模型选型,到流程设计与实际部署。