Google 现时 Gemini 3.7 Flash 的定价,是每百万输入代币 0.75 美元、每百万输出代币 3.75 美元。2027年1月1日,两个数字同时翻倍。若你的 AI 代理跑在这个模型上,推理成本会在一个早已写进日历的日子翻一倍。
决策就是这么一句。以下要处理的,是如何计价、何时投入,以及在哪些情况下这个模型根本不是正确答案。
Gemini 3.7 Flash 现在收费多少?
直至2026年12月31日,Gemini 3.7 Flash 定价为每百万输入代币 0.75 美元、每百万输出代币 3.75 美元,脉络快取为每百万代币 0.075 美元。Google 于2026年8月13日推出此模型时,明确表明这是相对标准价的五折推广优惠。
这并非营销意义上的推广。Google 在发布当日已公布结束日期,因此这是一次已排程的价格调整,而非可能悄悄延长的优惠。你应把它当作已知的未来成本,而非风险。
为何代币价格今日比从前重要:自主代理会把一个用户请求,展开成一长串模型呼叫、推理代币与工具互动。每代币成本的复合效应,是纯聊天介面时代不会出现的,因为当时人只输入一次、阅读一次。
2027年1月1日究竟改变了什么?
2027年1月1日起,输入由每百万代币 0.75 美元升至 1.50 美元,输出由 3.75 美元升至 7.50 美元,脉络快取由 0.075 美元升至 0.15 美元。模型本身没有任何改变,改变的只有帐单。
优惠结束后的价格并非惩罚性定价。它与 Gemini 3.6 Flash 的标准 API 价格 1.50 美元及 7.50 美元一致,这本来就是 Google 为此模型级别所设定的价格层级。你手上直至12月的,是折扣,不是基准。
规划上的含意十分具体。任何以今日帐单为基础编定的2027年预算,在推理成本一项上大约会短缺一半,而缺口出现的月份,正是财务团队结算年度的时候。请以1月的数字编预算,而非12月的。
Gemini 3.7 Flash 价格一览
以下每项均为 Google 公布的 API 标价。请以你自己的财资汇率换算;本文的港元说明数字采用 1 美元兑 7.80 港元。
--- 输入代币,2026年12月31日前:每百万 0.75 美元。
--- 输入代币,2027年1月1日起:每百万 1.50 美元。
--- 输出代币,2026年12月31日前:每百万 3.75 美元。
--- 输出代币,2027年1月1日起:每百万 7.50 美元。
--- 脉络快取,2026年12月31日前:每百万代币 0.075 美元。
--- 脉络快取,2027年1月1日起:每百万代币 0.15 美元。
--- 2027年1月1日的实际变动:输入、输出及快取全部上升100%。
--- 推出日期:2026年8月13日,距离 Gemini 3.6 Flash 仅三星期。
--- 企业取用途径:透过 Google AI Studio 的 Gemini API、Gemini Enterprise Agent Platform,以及 Gemini Enterprise 应用程式。
与 Claude Sonnet 5 及 GPT-5.6 Terra 相比如何?
在 Google 自行公布的比较表中,Claude Sonnet 5 标价为每百万输入代币 2 美元、输出 10 美元;GPT-5.6 Terra 为输入 2 美元、输出 12 美元。以此对照,Gemini 3.7 Flash 今日大约是三分之一价格,2027年起则约为四分之三。
差距收窄,比表面数字更值得注意。今日的价格差足以支持你在部分任务上接受一个能力稍逊的模型。到2027年,以 1.50 及 7.50 对 2 及 10,这个论点会薄弱得多,决定权会由价格转回能力。
在用这三组数字建试算表之前,有两点须留意。竞争对手的价格引自 Google 自家的比较表,投入前应向各供应商核对其现行公布定价。另外,标价不等于实际支出。一个要试三次才成功的便宜模型,并不便宜。
真正决定结果的指标,是每项成功完成任务的成本,而非每百万代币的价格。这是一项量度纪律,应与你其余的 AI FinOps 工作放在同一套实践之内。
对一间香港企业而言,实际成本是多少?
假设一间300人的香港专业服务公司,其客户服务代理每月处理40,000段对话,计入检索、工具呼叫与多轮脉络后,平均每段对话输入12,000代币、输出2,000代币。以今日价格计算,每月成本为660美元。
计算过程如下,方便你代入自己的用量:
--- 输入:40,000段对话 x 12,000代币 = 4.8亿代币。以 0.75 美元计,为 360 美元。
--- 输出:40,000段对话 x 2,000代币 = 8,000万代币。以 3.75 美元计,为 300 美元。
--- 2026年每月合计:660美元,约港币5,150元。
--- 2027年1月起每月合计:1,320美元,约港币10,300元。
--- 全年差额:7,920美元,单一工作负载约港币61,800元。
以上为根据 Google 标价及既定假设所作的说明性数字,并非报价。你的代币结构会有所不同,而较长的检索脉络,最快推高的是输入一项。
请留意这个结果的形态。单一代理每年6.2万港元,不是董事会级别的数字。但乘以四至五个生产环境代理,再加上第二、第三年,它就会变成。这正是价格调整属于规划问题而非危机的原因:它完全可预测,也完全可以被忽略,直到不能为止。
值得在内部作的比较,是与你的按席位 AI 授权费用对照。代币定价随用量增长,席位定价随人数增长。大多数香港企业目前两者兼有,而随着应用扩大,两者的行为差异极大。按席位的 Copilot 成本结构,是同一场预算对话的另一半。
Gemini 3.7 Flash 在哪些地方确实输了?
Google 自家的基准表并未显示 Gemini 3.7 Flash 全面压过价格更高的对手。GPT-5.6 Terra 在 Terminal-bench 2.1 以 87.4% 对 85.8% 领先,在 DeepSWE v1.1 以 69.6% 对 65.3% 领先,并在 Terminal-bench 3.0 及 OSWorld-2.0 占优。Claude Sonnet 5 则在 Agent's Last Exam 以 33.3% 对 26.3% 领先。
而它赢的地方,赢得相当明确。FrontierCode 1.1 Main 取得 43.6%,高于 Claude Sonnet 5 的 42.7% 及 GPT-5.6 Terra 的 41.3%。Code Arena 的 Elo 分数为 1588。在 Google 用以量度企业工作流程自动化的 AutomationBench 上取得 30.4%,高于 Terra 的 23.6% 与 Sonnet 5 的 10.7%。复杂 PDF 理解方面取得 34.0%,高于 28.0% 及 24.7%。
请诚实解读这个分野。Gemini 3.7 Flash 在文件密集的企业流程自动化与生产级程式码品质上表现强劲,在长周期终端机与桌面操作任务上则落后。若你的代理活在文件与业务系统之内,价格论据极为充分;若它活在终端机内或需操控桌面,便宜的代币可能会在重试次数上把成本还给你。
另有两项限制应予记录。Artificial Analysis 的智能指数上,Claude Opus 5 为63分,而 Google 就 Gemini 3.7 Flash 报称56分,因此这并非前沿级模型。此外,Google 至今未推出 Gemini 3.5 Pro,其最新正式发布的通用 Pro 模型,仍是2026年2月的 Gemini 3.1 Pro。若你的路线图假设 Google 旗舰模型会如期到位,这项假设目前并无日期支持。
应该现在迁移工作负载,还是再等?
若工作负载属文件密集、用量高且已稳定,应现在迁移,因为你可取得四个月的半价推理,并在价格变动前建立可量度的基准。若工作负载以终端机为主、属桌面代理类型,或仍每星期在变动,则应再等,因为迁移工作量将超过你尚可收回的折扣。
2026年余下月份的实务次序:
--- 先做量度。若你无法按工作负载报告「每项完成任务所耗代币」,以上一切都无法评估。
--- 选一个生产环境工作负载,在 3.7 Flash 上跑两星期,量度重试次数而非基准分数。
--- 以 1.50 及 7.50 美元重建2027年推理预算,再检视该工作负载是否仍能通过回报门槛。
--- 有意识地使用脉络快取。今日 0.075 美元是可用杠杆中成本最低的一项,而它在1月同样会翻倍。
--- 保持至少一个竞争模型处于可用状态。单一供应商推理是一个议价位置,而非一个架构。
我们这一方的诚实说明:若你具备内部工程能力,直接购买代币并自行管理工作负载,永远比任何托管安排便宜。UD 的 AI Staff Solution 与 Cloud AI Staff,是为没有这种能力、或不愿把这种能力花在模型选型与成本工程上的机构而设。若你具备,请留在内部处理,并使用以上框架。
下一步应该做什么?
调出过去三个月的推理帐单,按工作负载拆分,再以双倍价格重算总数。若有任何工作负载在2027年价格下不再合理,你尚有四个月可以重新设计、加入快取、迁移,或直接停用。这是一段舒适的时间,以及一份不太舒适的工作量。
唯一不应该做的,是到1月才发现这件事。一项提前五个月公布的价格调整,是最容易解决的预算问题,也是最尴尬的意外。
无论你选择内部处理还是引入协助,要做的事都一样:按任务量度、把2027年的数字模型化,然后逐个工作负载作决定。懂AI,更懂你。UD相伴,AI不冷。
本文由 UD 企业人工智能团队审阅。
与我们一起推算你的2027年AI成本
掌握了数字,下一步是把它套用到你自己的工作负载上。UD 团队手把手带你完成每一步,由代币量度、每任务成本模型化,到工作负载选型与部署上线,28年香港企业服务经验全程陪你走。