Gartner 的研究揭示:失败的 AI 项目,问题很少出在模型上,而是出在数据上。Gartner 预测,到 2026 年底,缺乏“AI 就绪数据”支撑的 AI 项目中,有 60% 将被放弃。
过去两年,企业习惯把数据搬进 AI 平台。如今另一种做法正在成为主流,叫做“零复制”(Zero-Copy)。2026 年 10 月,Google 把它定为 Gemini Enterprise 连接 BigQuery 的推荐方式。
什么是零复制 AI?
零复制 AI 是一种架构:AI 智能体直接在数据原本所在的数据库、数据仓库和业务系统里查询,而不是先把数据复制到单独的 AI 数据存储。智能体只取回需要的答案,源系统始终是唯一可信版本。
它通常由三部分组成:
--- 联邦查询:一个请求拆到多个系统执行,再合并结果。
--- 元数据层:说明有哪些表、字段含义以及谁有权查看。
--- 标准连接器:越来越多采用模型上下文协议(MCP)。
为什么零复制在 2026 年成为企业议题?
因为主流平台在几个月内相继采用了它。Google、Salesforce 和 SAP 都已提供让 AI 原地读取实时业务数据的方式,而 AI 智能体对新鲜、受权限管控的数据,需求远高于聊天机器人。
2026 年 10 月,Google Gemini Enterprise 官方文档推出联邦查询模式(预览版),支持 BigQuery、Spanner、Cloud SQL 和 AlloyDB,用每位用户自己的凭证原地查询,不把数据导入 Gemini。Salesforce 首席技术官也撰文指出零复制是智能体战略的关键。
Gartner 调查 248 位数据管理负责人,发现 63% 的组织没有、或不确定自己具备适合 AI 的数据管理实践。复制更多数据,只会让差距更大。
零复制数据访问具体怎样运作?
零复制智能体分三步工作:先查找有哪些数据及其含义,再据此编写查询,最后以提问用户的权限,在实时源系统上执行。传回 AI 的只是结果,而不是整套数据。
--- 以用户身份认证:连接器用提问者的 IAM 或 OAuth 凭证执行查询。
--- 用元数据发现:知识目录返回相关表、业务术语和查询模式。
--- 实时查询:智能体生成 SQL,返回受管控的结果。
这与文档 AI 常用的导入模式不同,可参考我们的企业 AI 知识库对比。导入适合每月更新的制度文件,却不适合每分钟都在变化的库存或资金头寸。
零复制比复制数据更安全吗?
在数据扩散方面,零复制通常更安全,因为没有第二份副本需要保护或删除。但在访问权限上并不天然更安全:如果智能体继承了用户过宽的权限,用户能看到的一切,智能体同样能看到。
无论是香港的私隐条例还是内地的《个人信息保护法》,都要求采取合理措施防止个人信息被未经授权访问。副本越少,越容易证明已经尽责。
但 Google 文档也写明,连接器并不限定于特定资源,可以访问用户有权查看的全部数据。所以零复制和AI 智能体身份管理其实是同一个议题。
什么情况下应该复制数据,而不是原地查询?
内容是非结构化、更新缓慢或需要整理才能保证准确时,应该复制;数据是结构化、更新频繁、比较敏感或体量庞大时,应该原地查询。多数企业会两者并用,关键是为每个工作负载选对模式。
--- 需要多实时?以分钟计倾向零复制,以周计倾向导入。
--- 是否结构化?表格适合实时查询,PDF 和邮件仍需索引。
--- 有多敏感?个人信息和定价数据最好留在源系统。
--- 能接受多少误差?Google 指出,复杂交易型结构上的联邦查询准确度可能波动,高风险指标应使用经过验证的查询。
零复制在企业中落地是什么样子?
落地效果是:营运或财务问题可以在几秒内由实时系统回答,而不需要新建数据管道。制造和零售连锁尤其适合,因为这些行业依赖变化快速、复制起来既昂贵又有风险的结构化数据。
场景一:制造企业的供应链团队
一家约 500 人的电子元件制造商,采购经理想让智能体回答“哪三种物料两周内会低于安全库存?”。每晚同步的数据白天已经过时,原地查询实时表则下午依然准确,生产数据也从未离开数据仓库。
场景二:零售连锁的营运总部
营运总监查询过去七天退货率比上月同期高出 30% 以上的门店。以总监自己的权限原地查询,没有新副本,现有访问日志依然适用,合规处理更简单。
零复制最常见的陷阱有哪些?
最常见的陷阱包括元数据缺失、权限过宽、查询成本失控,以及过度相信复杂结构上得出的答案。这些都是治理缺口,以前复制数据时被掩盖,零复制则让它们全部暴露。
--- 数据缺乏说明:智能体无法理解名为 FLD_07 的字段。
--- 继承过宽权限:多年批出的访问权一夜变成智能体的能力。
--- 查询费用失控:上线前要设定计费项目和预算告警。
--- 指标未经验证:“收入”在不同系统里可能有三种口径。
企业管理者应该怎样评估供应商的零复制承诺?
要追问查询在哪里执行、使用谁的身份、访问范围怎样限定、记录了什么,以及成本如何控制。如果供应商无法书面回答全部五点,它卖的只是连接器,而不是受治理的零复制架构。
--- 是否有原始数据离开源系统或所在地区?
--- 智能体使用最终用户凭证,还是共用服务账号?
--- 能否只开放指定数据集?
--- 生成的查询和用户是否被记录,保留多久?
--- 能否按用户、按月设定成本上限?
要求供应商用你自己的数据结构演示。真正的考验,是你那套用了 15 年的 ERP。
结语:别再搬数据,先管好访问权
零复制并不意味着数据就绪可以跳过,反而让它成为成败关键。第一笔投资应该是数据目录和权限梳理,而不是又一条数据管道。
懂AI,更懂你 UD相伴,AI不冷。
由 UD 企业 AI 团队审阅。信息已于 2026 年 10 月 8 日对照 Google Cloud 官方文档及上文所引来源核实,预览功能或有变化。
看看你的数据是否已为 AI 智能体做好准备
了解了框架,下一步是找出哪些流程的数据今天就可以让 AI 智能体安全使用。从免费的 AI 准备度评估开始,UD 团队手把手带你完成每一步,从数据就绪、权限梳理、试点设计到成效追踪,28 年企业服务经验,全程陪你走。