先看一个数字。Gartner 的 AI Gateway 市场指南预测,到 2028 年,构建多模型应用的软件工程团队中将有 70% 通过 AI Gateway 运作,2025 年这个比例是 25%。值得注意的不是增速,而是它揭示的事实:绝大多数企业从未主动决定要走多模型路线,它们是被一个个部门的独立选择推到这一步的,然后才发现整间公司没有一个统一的控制点。
Dataiku 与 Harris Poll 对全球 600 位企业 CIO 的调查显示,81% 预期在 2026 年需要同时依赖两家或以上的大型语言模型供应商,93% 认为不同模型各有擅长的场景。这就是企业 AI 的真实处境:不是一家供应商、一份合约、一个仪表板,而是多家供应商分别计费,并以各自不同的条款持有你的数据。
这篇文章说明 AI Gateway 是什么、它究竟控制什么、如何判断你的机构现在是否需要它,以及决策失误时会付出什么代价。
什么是 AI Gateway?
AI Gateway 是一个统一控制点,位于你的应用系统与所有 AI 模型之间。Gartner 将它定义为简化并管理 AI 能力访问的中介层,提供单一位置来执行安全、治理与可观测性。所有请求在抵达模型之前都要经过它。
最贴切的类比是企业防火墙。没有人会争论一间 300 人的公司该不该把互联网流量集中经过一个受控边界。AI Gateway 只是把同样的原则套用到模型流量上。
没有它,每个应用各自持有 API 密钥、各自挑选模型、各自计入不同预算科目。结果是董事会一条最简单的问题无人能答:这个月我们在 AI 上花了多少,花在哪里。
为什么 AI Gateway 在 2026 年变得关键?
因为多模型的现实来得比治理能力更快。当 81% 的 CIO 同时使用两家或以上供应商,实际后果就是支出分散、安全政策不统一,而且没有任何统一记录能说明某个模型被问过什么、答过什么。Gateway 正是把这种扩散重新收拢的那一层。
过去十八个月有三股力量同时到位。
--- 模型更替成为常态。 供应商淘汰与发布模型的周期以月计而非以年计。任何写死单一模型标识的应用,在该模型退役时都会失效。
--- 价格不再稳定。 主要供应商的每 token 成本大幅下降,这意味着某项任务上「最便宜且足够准确」的模型,一年之内会换好几次。
--- 监管开始索取记录。 香港个人资料私隐专员公署已明确表示,机构在个人资料上部署 AI,必须能说明处理了什么、依据是什么。
三者分开都能应付。叠加起来,逐个应用各自对接 AI 就变成一项负债。
AI Gateway 实际怎么运作?
AI Gateway 只向开发人员与应用暴露一个内部端点。请求到达后,Gateway 执行策略,再把请求转发给策略选定的模型供应商。响应沿同一路径返回,途中被记录、过滤与计量,然后才交回调用方。
实际效果是,你的应用不再知道自己在跟哪个模型对话。它只调用一个内部地址,其余交给 Gateway 决定。
这层间接正是全部价值所在。当供应商涨价、下线模型或发生故障,需要改的是 Gateway 配置,而不是每一个接触 AI 的应用的源代码。
差别在事故时最明显。一间零售连锁若有三个应用各自持有供应商密钥来做客户查询摘要,供应商一旦降级,就要同时排查三宗独立故障。同一间公司若在 Gateway 之后,只需改一次配置,外加一个备用模型。
部署形态通常有两种。自托管 Gateway 运行在你自己的网络内,提示词与响应留在你可控的基础设施上,适合受监管的工作负载。托管式 Gateway 上线更快,但流量会经过第三方,这就变成一个数据处理问题,需要你的隐私团队在采购之前而不是之后回答。
AI Gateway 承担哪四项工作?
AI Gateway 执行四项不同功能:路由、安全、成本控制与可观测性。多数供应商会谈都集中在路由,因为它最好演示。但真正的运营价值在其余三项,这也是财务与风险团队最终会关心一项他们从未提出过的基础设施的原因。
路由。 Gateway 按策略把每个请求导向最合适的模型,依据可以是成本、延迟、准确度或数据敏感度分级。摘要任务交给便宜的小模型,合约分析交给前沿模型。
安全。 API 密钥存放在 Gateway,而不是应用代码或开发人员的笔记本电脑里。密钥轮换变成一次配置更改。输入输出护栏,包括提示注入检测与个人资料外流检查,可以统一生效,无需每个团队各自重写一遍。
成本控制。 Gateway 按团队、按应用、按用途计量 token 消耗,执行配额,并缓存重复调用。对大多数机构来说,这是第一次能把 AI 支出归属到成本中心。
可观测性。 每次请求与响应都连同足以事后重建决策的元数据一起记录。缺了这一层,内部审计就 AI 影响过的决策提问时,根本无从作答。
AI Gateway 和 API Gateway 有什么区别?
API Gateway 按端点、方法与速率限制来路由和保护流量。AI Gateway 做完这些之后,还要加上只有模型流量才需要的东西:token 计费、语义缓存、提示词与响应检查、模型故障转移,以及逐请求的成本归属。根本差别在于 AI 流量按内容量计价,而不是按调用次数计价。
仅这一项计价差异,就推翻了传统 API 管理的大部分假设。当一次调用的成本可以是另一次的两百倍,「每小时 1,000 次调用」这种限制其实毫无意义。
AI Gateway 也不同于编排框架。编排框架帮开发人员构建代理逻辑;Gateway 治理的是流量本身,无论流量由什么工具产生,包括 IT 部门从未采购过的工具。
对香港企业来说,AI Gateway 改变了什么?
对香港机构而言,Gateway 把三个反复出现的合规问题变成配置项。它提供私隐专员公署期望的处理记录,它执行哪些类别的数据可以离开本地司法管辖区,并让受监管企业在监管人员追问「这个受 AI 影响的决定是怎么得出的」时,有一个站得住脚的答案。
本地采用情况让这件事变得紧迫而非理论。生产力促进局发布的《渣打香港中小企领先营商指数》2026 年第一季报告显示,55% 受访中小企已使用或计划在未来一年使用 AI 工具,其中「信息及通讯业」达 92%,「专业及商用服务业」72%,「金融及保险业」62%。
在一间 300 人的公司里,这种程度的采用不会来自一次采购决策,而是来自数十次个人注册。这正是 AI Gateway 存在的理由。关于这类风险,可参考我们的影子 AI 与治理缺口一文。
怎么判断你现在是否需要 AI Gateway?
五个问题就能定案。三个或以上答「是」,说明 Gateway 已经该有了。答「是」少于两个,说明你仍在早期,此时引入只会增加运营成本而消除不了实质风险,诚实的建议是先等。
--- 你的月度账单上是否出现两家或以上模型供应商?
--- 你能否在不做人工对账的情况下,把 AI 支出归属到具体部门?
--- 如果供应商明天下线某个模型,需要改动多少套代码?
--- 你能否在一个工作日内,交出上月所有触及客户数据的 AI 请求记录?
--- IT 部门以外的团队,是否持有自己的 API 密钥?
第四个问题最能改变董事会的对话。大多数机构会发现答案是否定的,而原因属于架构层面,不是流程疏忽。没有人决定过不保留记录,只是记录从未被集中,因为每个团队都用了当时最快的方式接上 AI。
一条实用的时序原则:Gateway 应该出现在你第一个真正投入生产的 AI 工作负载之后、第三个之前。太早,你只是在治理一个实验;太迟,你是在已经承载客户流量的系统上补装控制,成本明显更高,而且通常需要一次没人愿意排期的变更冻结。
做错的时候,通常错在哪里?
五种失败模式解释了大部分令人失望的 AI Gateway 部署。五者都源于把 Gateway 当作一件采购品,而不是一项运营决策:谁控制模型访问,谁为它揭示出来的支出负责。
当成省钱项目来立项。 路由优化通常能削减可观比例的推理支出,但持久价值在治理。要以控制与审计立案,否则第一季省下的钱不达预期时,整个商业方案就会垮掉。
部署了却不强制使用。 团队可以绕过的 Gateway,等于什么都没治理。只要直连供应商的通道还开着,影子流量就会继续。
增加了没人预算的延迟。 每个 Gateway 都会多一跳。对批处理无关痛痒,但对面向客户的语音应用,必须在承诺之前实测。
还没有策略就先买 Gateway。 Gateway 执行规则,但不会替你写规则。在决定「哪些数据分级可以送到哪些模型」之前就先装,最终只会得到一个昂贵的代理服务器。
无视可观测性的产出。 日志本身就是资产。从不查看日志的团队,既保留了风险,又付了基础设施的钱。关于一条可用的追踪记录应该包含什么,可参考我们的代理可观测性指南。
策略要点
AI Gateway 不是一项令人兴奋的技术,它是管道工程。但它恰恰是那一段管道,能把散落在各部门的 AI 实验,变成董事会拿得出数字、监管机构拿得到记录的东西。
这个决策的本质不在软件,而在于你的机构是否愿意宣告:AI 模型访问权是一项受治理的资源,而不是个人资源。大多数企业最终都会得出这个结论。那些在第一个审计问题出现之前就想明白的企业,付出的代价明显更低。
技术周期永远奖励那些提早把枯燥那一层建好的机构。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企业 AI 团队(香港)审阅。
下一步从哪里开始
掌握了框架之后,下一步是找出你的机构内部哪些模型访问仍然无人治理。UD 团队手把手带你完成每一步,从盘点现有 AI 使用情况、设计策略,到部署上线与持续成本申报,28 年香港企业服务经验,全程陪你走。