2026 年最快把 AI 推上生产环境的企业,并不是采用了最强模型的那一批。真正的分别在于:他们在写下第一句提示词之前,就已经界定清楚什么算是错误答案,以及由谁有权签署放行。
这个机制有一个名字,叫做 eval(评测)。而几乎每一个停滞不前的企业 AI 项目,跳过的正是这一步。
如果你的机构曾经跑过一个看似成功、却始终无法正式上线的 AI 试点,真正的障碍多数不是模型。而是没有人能拿出证据,证明系统的表现足够好。而任何委员会都不会批准一个无法量度的系统。
什么是 AI Evals?
AI eval 是一套可重复执行的测试:以一组已知正确答案的固定输入,按既定标准为 AI 系统的输出评分。与演示不同,eval 产出的是一个数字,可以跨版本追踪、可以用来比较供应商,也可以直接呈交风险委员会。
对决策者而言,关键分别在于:基准测试(benchmark)告诉你模型在别人的问题上表现如何,eval 告诉你它在「你的」问题上表现如何。
公开排行榜的分数最多只是采购信号。它完全无法说明模型能否正确读懂你的租赁合约、你的索偿表格,或你客户的粤语通话记录。
为什么没有 eval 的企业 AI 试点会卡住?
试点卡住,是因为审批需要证据,而演示不是证据。缺少 eval,唯一可用的质量信号就只是传闻:某人试过,感觉不错。这足以支持一次实验,却永远不足以授权一个接触客户、金钱或受监管记录的系统。
麻省理工学院(MIT)的《The GenAI Divide: State of AI in Business 2025》研究,基于 52 场高层访谈、153 位管理者问卷,以及 300 个公开部署案例的分析,发现 95% 的生成式 AI 试点没有带来可量度的损益影响。这句话真正的关键词是「可量度」。
我们在 为什么 95% 企业 AI 试点会失败 一文中讨论过更宏观的失败模式。Evals 正是把试点的个别经验,转化为董事会可以据以行动的数字的具体机制。
还有一项较少被提及的代价。没有 eval,每一次模型升级都变成一次风险事件。当供应商推出新版本,你无从判断你的流程是变好了,还是悄悄变差了。
AI eval 实际上如何运作?
Eval 把一组固定的测试输入送进你的 AI 系统,按预期结果或质量评分表为每个输出评分,再汇报整体通过率。它会在每次提示词修改、模型升级或资料更新时自动执行,就像软件测试套件在代码发布前执行一样。
其运作可拆成四个部分,而管理者必须有能力在供应商会议上逐一点名。
资料集。一组真实输入,配上已经取得共识的正确输出。2026 年的实务指引大致收敛在 200 至 500 个范例,而且应该来自真实的生产失误,而非虚构个案。
评分器。判定通过或失败的机制。可以是精确比对、规则、程序检查、人工审核,或由另一个模型担任裁判。
指标。最终被汇报的那个数字。准确率是最直觉的选择,但更成熟的做法是针对成本最高的那一种失误评分,例如捏造数字、遗漏法定披露字句,或泄露个人资料。
关卡。低于此门槛就不得放行的界线。没有约束力的关卡,只是一块仪表板,不是控制。
什么是 LLM-as-a-judge?可以信任吗?
LLM-as-a-judge 是以第二个 AI 模型,按书面评分表为第一个模型的输出评分。它是唯一能够大量评估语气、完整度、忠实度等主观质量的方法。它只有在经过人工判断校准之后才值得信任,校准之前并不值得。
2026 年公开的实务指引,把校准门槛设在裁判与人工标注参考集之间约 85% 至 90% 的一致率,达标后才容许裁判无人监督地运行。部分团队偏好采用与专家判断相关系数高于 0.7 的量度方式,理由是单纯的一致率会过度美化一个懒惰的裁判。
最后这一点值得你在供应商会议上原句提出。若一个资料集中只有十分之一的输出理应被判失败,那么一个把所有输出都判为通过的裁判,一致率高达 90%,却毫无用处。任何供应商向你报出一致率数字,请追问底层资料集的失败比率是多少。
这也是 eval 与监控的分别所在。观察生产环境流量,即我们在 Agent 可观测性 一文中谈过的做法,告诉你已经发生了什么。而 eval 在发布之前,告诉你即将发生什么。
如何为你的机构建立黄金资料集?
黄金资料集,是你的机构共同认可、代表正确行为的一组测试个案。它应该建立在真实失误而非人工虚构的例子之上:收集试点期间出错的输出,由一位领域专家逐项判定通过或失败并写下理由,然后把这位专家的判断视为标准。
能够把这件事做成的团队,实务步骤其实很短。
从 50 个真实失误开始。而不是 500 个虚构个案。来自你自己试点的失误,价值远高于任何公开基准测试,因为它们编码了你的业务认为什么是不可接受的。
用一位专家,而非一个委员会。在这个阶段,一致性比共识更重要。两位互相矛盾的审核者,只会产出一份无法用来校准任何东西的资料集。
写下理由,而不只是判决。那段书面评语,日后会成为裁判的评分表。一份只有通过或失败标签的资料集,无法转化为自动评分器。
让它从生产环境持续生长。每一个在实际使用中出现的新失误,都成为一个永久测试案例。这是会复利累积的资产。一年之后,这份资料集就是一份没有任何供应商能够复制的、属于你机构的质量标准说明书。
一项提醒:检索质量与答案质量是两个独立问题,需要各自的测试案例。如果你的助理之所以自信地答错,是因为它从未找到正确文件,那是接地(grounding)失误,而不是推理失误。两者的分别,我们在 什么是 AI 接地 一文中已有详述。
2026 年,受监管的香港企业面对了什么改变?
两项发展把 eval 从工程实务推向治理要求。欧洲高风险 AI 系统的义务,涵盖风险管理、质量管理与上市后监察,原定合规日期为 2026 年 8 月 2 日。其后的 Digital Omnibus 程序提议把独立的 Annex III 系统延后至 2027 年 12 月 2 日,但「必须提出证据」这项要求本身并未改变。
日期押后不是重点。无论哪一个版本的制度,都要求一套有文件记录、持续进行的流程,用以证明系统的表现与宣称一致。那就是一套 eval 机制,不论日历怎样写。
更贴近本地的是,个人资料私隐专员公署于 2026 年完成第二轮 AI 循规审查,涵盖 60 间香港机构。其中 57 间在日常营运中使用 AI,约 79% 使用超过一年,约 51% 同时运行三套或以上的 AI 系统。是次审查并未发现违反《个人资料(私隐)条例》的情况。
请仔细读这项发现。香港大多数企业,如今已是多系统 AI 营运者。如果你同时运行三套或以上 AI 系统,却对其中任何一套都拿不出质量记录,那个缺口就不是技术问题,而是一项摆在部门主管桌面上的审计风险。
建立一套 eval 机制要花多少成本?
Eval 机制的成本主要是专家时间,而非软件。第一套可运作的测试套件,通常需要一位领域专家花两至三天,为初始失误集评分,再加上把评分接入发布流程的工程时间。经常性成本很低:每次改动执行数百个测试案例所需的运算资源而已。
这对预算讨论很重要,因为直觉总是先买平台。平台是便宜的部分。昂贵而且无法转让的,是你机构内部那位知道正确答案应该长成什么样子的人的判断力。
面对财务总监,可以这样表述:eval 机制决定了你手上的 AI 系统,是一套可以安全修订的系统,还是一套只能整个换掉的系统。没有它的代价,最终会以「一个无法升级、因此必须重建的项目」的形式出现。
企业的 eval 机制通常错在哪里?
多数失败属于组织问题而非技术问题。四种反覆出现的模式分别是:资料集建立在想像而非真实的失误之上、没有人校准过裁判、指标量度了错的东西,以及一道任何项目经理在死线压力下都能推翻的关卡。
风险不在准确率,却只量度准确率。一个准确率 96% 的合约助理,如果每 25 份文件就捏造一次条款,那不是 96% 的成功,而是一个法律审查问题。请为成本最高的失误评分,而不是为最容易计算的失误评分。
让供应商拥有 eval。同时提供系统与系统测试的供应商,等于在批改自己的功课。资料集必须留在你手上,而且必须能在更换供应商之后继续存活。
只在采购时做一次 eval。一次性的验收测试,只能告诉你模型在你购买当日的状态。模型会更新、提示词会漂移、你的文件会改变。价值在于重复执行。
设了关卡却没有负责人。如果没有指名谁有权叫停发布,那么第一次遇上发布日期压力时,门槛就会被豁免。
策略重点
Evals 不是一项可以下放给技术团队的测试细节。它是把 AI 投资转化为「董事会可以监督、监管机构可以查阅、继任者可以承接」的资产的机制。
本季度值得向团队提出的问题很窄,也很可答:对我们运行的每一套 AI 系统而言,测试集是什么?谁校准了评分器?哪一个门槛可以阻止发布?谁拥有那个门槛?如果这四个答案并不存在,你手上就还不是一套已经上线的 AI 系统,而是一个刚好在承接实际流量的试点。
在一间已经有既有系统、既有记录、既有监管要求的机构内建立这套能力,比任何供应商简报所描述的都要慢,也更牵涉内部政治。这正是一个做过同样事情的伙伴能够发挥价值的地方。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企业 AI 团队(香港)审阅。2026 年 8 月 13 日发表。
准备好找出你的起点?
知道要量度什么是第一步,知道你的机构实际站在哪个位置是下一步。UD 团队手把手带你完成每一步,由 AI 准备度评估、应用场景选型,到部署上线、质量关卡设定与成效汇报,28 年服务香港企业的经验,全程陪你走。