Gartner 的最新预测揭示了一个让许多财务团队意外的事实:AI 的每个 Token 越来越便宜,每项任务却越来越贵。Gartner 在 2026 年 8 月发布的报告中指出,尽管单价持续下降,到 2028 年每个智能体流程的推理成本仍将增长五倍以上。
这正是不少企业最近在账单上看到的现象:试点阶段成本看起来可控,一旦进入规模化运营就明显超支。本文将定义 AI FinOps,解释 AI 开支为何与传统云开支不同,并给出一个可以直接带进预算评审会的四层框架。
什么是 AI FinOps?
AI FinOps 是一套让 AI 开支可见、可归属、可问责的管理方法。它把云端财务管理的做法延伸到 Token、模型调用、GPU 算力与 AI 订阅,让每一元 AI 成本都能追溯到具体团队、流程和业务成果,再按成果进行优化。
这个概念脱胎于云 FinOps。十年前,企业发现没人能说清楚云账单的构成,于是形成了一套财务与技术协同的管理方法。AI 以更快、更分散的形式重演了这个问题。
如今,AI 成本同时从几个口子流出:
--- 模型 API 调用:按每百万输入和输出 Token 计费,重复内容可享缓存折扣。
--- 席位订阅:各类 AI 助手按用户按月收费。
--- 基础设施:GPU 算力、向量数据库、向量化、编排和日志。
--- 内嵌 AI:SaaS 工具里的 AI 功能,多以点数或增值模块形式计入部门预算。
根据 FinOps Foundation 发布的 State of FinOps 2026 报告,98% 的从业者已在主动管理 AI 成本,这一比例在 2025 年为 63%,2024 年仅为 31%。AI 成本管理也是这些团队未来 12 个月最想补齐的能力。
为什么 Token 越来越便宜,AI 账单却越来越贵?
单价在降,用量涨得更快。Gartner 称之为“推理悖论”:更便宜的 Token 催生了更复杂的智能体流程,AI 需要反复推理、调用工具、自我校验。Gartner 预计到 2028 年,每个智能体流程的推理成本将增长五倍以上。
单价确实在下降。2026 年 9 月发布的多款前沿模型,都延续了下调 Token 价格和缓存读取价格的趋势。Gartner 还预测,到 2030 年,服务商运行万亿参数模型的推理成本将比 2025 年低 90% 以上。
变量在于用量。聊天机器人读完问题、给出答案就结束了;智能体则要规划、调用工具、读取结果、检查自己的输出,必要时还会重试。Gartner 2026 年 8 月的分析指出,把任务交给智能体推理模型,推理成本至少是普通聊天交互的五倍,任务越复杂,倍数越高。
对运营负责人来说,结论很直接:价目表下调,不等于账单会变小。
企业内部应该由谁负责 AI 成本?
应当由一位具名高管统一问责,技术团队掌握模型选型和路由等杠杆,财务团队掌握可视性和单位经济。Harness 调研显示 52% 的机构没有明确的 AI 成本负责人,账单暴涨时无人能解释,制度也难以落地。
Harness《2026 State of AI in FinOps》调研了五个国家的 700 位工程和 FinOps 负责人,揭示了缺乏问责的代价:
--- 72% 在过去一年遭遇过意外的 AI 账单暴涨,33% 不止一次。
--- 如果开支一夜翻倍,只有 20% 能在几小时内找到原因。
--- 受访者估计 26% 的 AI 开支属于浪费。
--- 只有 26% 拥有可靠的方法衡量 AI 开支的业务价值。
实践中行之有效的分工是:技术或平台团队负责模型网关、路由规则和预算上限;财务团队负责统一视图和单位经济;再由一位高管,通常是运营负责人或数字化转型负责人,就两方面向董事会负责。
AI 成本看板应该衡量什么?
核心是单位业务成果成本,而不是总开支。例如每张已解决工单、每份已处理单据、每个已完成流程的成本,同时跟踪每项任务的 Token 用量、模型组合、缓存命中率,并与被替代的人工流程成本对比。
Token 账单翻倍而处理量增长三倍,是好消息;账单持平而处理量下滑,才是坏消息。只有单位成本能告诉你眼前属于哪一种。
值得放到管理层面前的指标包括:
--- 单位成果成本:每张已解决工单、每张已处理发票、每份已起草报告。
--- 每项任务 Token 用量:持续上升往往意味着提示词膨胀或智能体陷入循环。
--- 模型组合:前沿、中档和小模型各自承担的工作占比。
--- 缓存命中率:重复内容只按正常输入价格的一小部分计费。
--- 人工基线:AI 接手之前,该流程的全部人工成本。
AI FinOps 四层框架是什么?
四层分别是:看得见、分得清、管得住、用得精。先建立统一的 AI 开支视图,再把成本归属到团队和流程,然后在花钱之前设定预算、阈值和审批规则,最后把任务分配给满足质量要求的最低成本模型。四层层层递进,顺序不能颠倒。
第一层:看得见。把 API 发票、席位授权、云端 GPU 费用和 SaaS 内的 AI 增值模块汇总到一个视图。大多数机构都会在意想不到的预算科目里发现 AI 开支,从营销工具到人力资源系统都有。
第二层:分得清。所有模型调用都经过统一网关,并为每个请求打上团队、应用和流程标签。没有标签,任何关于优化的讨论都会变成“这笔钱该算谁的”的争论。
第三层:管得住。为每个流程设定月度上限、为每项任务设定 Token 阈值,在预算用到 70% 和 90% 时触发告警,并规定智能体在超出开支上限前必须转交人工审批。治理的目标是在账单出来之前拦住问题,而不是事后解释。
第四层:用得精。建立三级模型策略:前沿模型负责复杂推理,中档模型负责常规工作,小模型或开源模型负责高频例行任务,再配合提示词缓存、精简上下文和输出长度限制。Gartner 称之为“推理分层”,并认为这是守住利润的关键。
企业实际上怎样落地 AI FinOps?
从一个高频流程起步,例如理赔分拣或客服咨询,先算出“单位成果成本”。然后与人工基线对比,设定月度上限,把常规请求交给小模型,只在例外场景调用前沿模型。一个流程跑通后,再复制到下一个。
以一家用 AI 辅助理赔分拣的保险公司为例。第一个月,它只知道总账单金额。完成打标签后,才发现八成开支来自同一个智能体,而它每一步都会重新读取整份保单。把保单内容放入缓存、把简单案件交给小模型后,单件理赔成本明显下降,节省的金额也能直接与人工处理基线对比。
再看一家专业服务机构:各合伙人团队各自采购 AI 助手订阅。第一层“看得见”暴露了三家供应商之间的重复席位。合并订阅并明确负责人后,零散的成本变成了财务总监可以规划的一个科目。
成本管控之外,数据治理同样关键。每份供应商合同里,成本条款都与数据留存和隐私条款并列。如果你正在与模型供应商谈判,可以参考我们的零数据留存企业采购指南。
企业管控 AI 成本最常见的错误有哪些?
常见错误包括:先定制度、后建可视性;只看总开支、不看单位成本;所有任务默认用最贵的模型;把成本当成财务部门一家的事。Harness 发现 73% 的机构已有 AI 成本制度,但只有 13% 具备基本可视性。
--- 先定制度、后建数据。无法衡量的规则,就无法执行。
--- 默认使用前沿模型。所有请求都交给最强的模型,是账单膨胀最快的方式。
--- 奖励用量而不是成果。Harness 发现 57% 的工程师表示公司鼓励尽量多用 AI,而不看价值。
--- 忽视隐性成本。向量数据库、向量化、日志和数据传输费用,很少出现在模型账单上。
--- 一刀切压缩。全面冻结只会拖慢落地。单位经济能让你在有回报的地方加码,在没有回报的地方收手。
怎样向财务总监或董事会汇报 AI 成本?
用单位经济加趋势线来汇报。展示单位成果成本、被替代的人工基线、月度上限,以及防止失控的护栏机制。董事会关心的是有没有明确负责人、开支是否可预测、每多花一元能否换来可量化的产出。
一页纸的 AI 成本简报,应当回答五个问题:谁对这笔开支负责、月度上限是多少、当前单位产出成本是多少、与人工基线相比如何、有哪些护栏防止意外。能把这五个问题讲清楚,你已经领先大多数同行。
结语:先让 AI 开支可预测,再让它规模化
AI FinOps 的目的不是少花钱,而是清楚每一元换来了什么,从而在回报已被验证的地方更有底气地投入。2027 年能成功规模化 AI 的企业,一定是在 2026 年就把成本可视性当作基础设施来建设的企业。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企业 AI 团队审阅。数据来源已于 2026 年 9 月 28 日核实。
不确定 AI 开支花在了哪里?
掌握了框架,下一步是找到最先产生回报的流程。UD 团队手把手带你完成每一步,从 AI 准备度评估、成本基线测算、模型选型,到部署上线与成效追踪,28 年企业服务经验,全程陪你走。