Gartner 預期,到 2026 年底,40% 的企業應用程式將內建針對特定任務的 AI 代理,而 2025 年這個比例還不足 5%。同一家機構亦預測,超過 40% 的代理式 AI 項目將在 2027 年前被取消。
這兩個數字描述的是同一批企業。代理部署的速度,已經超過了企業看清它們在做什麼的能力。
填補這個落差的那一層技術有正式名稱。在 2026 年,它從工程師的方便工具,變成董事會層級的控制機制。它叫做代理可觀測性(Agent Observability),而它往往就是試點項目能否轉為正式營運的分水嶺。
什麼是 AI Agent 可觀測性?
AI Agent 可觀測性,是指記錄並評估代理執行的每一個步驟,包括推理路徑、工具呼叫、資料檢索與最終輸出,令任何失誤都能追溯到某一個具體決策,而不是靠猜測。它把代理由黑盒,變成可稽核的業務流程。
量度單位是追蹤紀錄(trace)。一筆追蹤紀錄,就是代理一次完整執行的全部紀錄,並按每個動作拆分為若干區段。
聊天機械人產生一個你能讀到的答案。代理產生的是十二個甚至三十個動作組成的鏈條,而使用者絕大部分都看不見。
企業風險如今就藏在這條鏈上。若你無法重播它,你便無法向稽核人員、監管機構,或收到錯誤答案的客戶解釋清楚。
為什麼可觀測性在 2026 年成為企業優先事項?
原因在於代理真正進入生產環境,而工具市場亦圍繞這個轉變完成整合。New Relic 於 2026 年 2 月推出 Agentic Platform;思科(Cisco)於 2026 年 4 月 9 日宣布有意收購評估與護欄初創公司 Galileo,並將其納入 Splunk Agent Observability。
當這種規模的基礎設施供應商在八星期內先後押注同一個範疇,這個範疇已經離開研究階段。
背後的商業壓力同樣具體。麥肯錫估算,AI 代理每年可為各類業務場景帶來 2.6 萬億至 4.4 萬億美元的價值。
然而交付紀錄相對單薄。2026 年的採用數據分析顯示,約三分之二企業已試用過代理,但成功規模化並產生可量度價值的不足 10%。
New Relic 的平台正好說明企業現在買的是什麼:多代理系統視覺化、涵蓋每個代理階段的完整請求生命週期瀑布圖,以及橫跨模型、向量資料庫與協作框架的五十多項整合。
可觀測性與傳統應用監控有何不同?
傳統監控回答系統是否運作正常、是否夠快、有沒有報錯。可觀測性則回答另一個問題:一個運作正常、速度夠快、沒有報錯的系統,是否在做正確的事。代理可以在 900 毫秒內回傳一個乾淨的 HTTP 200,同時引用了一份早已被取代的政策文件。
對掌握科技預算的管理層而言,有四項差異值得注意。
--- 傳統監控量度可用性與延遲;可觀測性把準確性、根據性與政策合規度視為一級指標。
--- 傳統監控把一次請求視為單一事件;可觀測性把它視為由推理步驟、工具呼叫與檢索構成的樹狀結構。
--- 傳統監控有明確的通過或失敗狀態;可觀測性要為機率性輸出評分,因此你需要先有評估準則,才需要儀表板。
--- 傳統監控甚少牽涉業務部門;可觀測性必須由業務專家定義什麼才算好答案。
最後一點最常被低估。可觀測性並非純粹的工程採購,把它當作工程採購,結果就是做出一堆業務同事看不懂的漂亮圖表。
一套完整的可觀測性堆疊會記錄什麼?
達到生產級別的堆疊,會記錄對話中每一個推理步驟、工具呼叫、知識檢索與決策點的追蹤細節,並把品質分數、成本、延遲與安全發現放在同一條時間軸上。建基於 Galileo 收購案的 Splunk Agent Observability,正是明確地把這些資訊整合在同一視圖。
企業應該期望看到以下清單。
--- 每次代理執行的完整追蹤與區段紀錄,保留期需符合你的稽核窗口。
--- 工具呼叫紀錄,顯示代理接觸了哪個系統、傳入什麼參數、回傳什麼結果。
--- 檢索紀錄,顯示調取了哪些文件,以及當中哪些真正被寫入答案。
--- 自動化評估,就準確性、根據性、語氣與政策遵循度評分。
--- 人工回饋迴路,把被標記的追蹤紀錄轉化為下一個版本的測試案例。
--- 按執行次數、按流程、按業務單位劃分的成本與代幣用量帳目。
有一項能力區分成熟與不成熟的平台:部署前的多輪模擬。2026 年發表的比較評測指出,只有少數平台(例如 Latitude 與 Maxim AI)支援部署前多輪模擬,而這正好能捕捉單輪評估套件無法察覺的失效。
可觀測性如何支援香港的 AI 管治與《私隱條例》合規?
香港目前沒有專門的 AI 法例,因此《個人資料(私隱)條例》完整適用於任何處理個人資料的 AI 系統。可觀測性提供合規審查所需的證據:代理存取了什麼資料、為何存取,以及該存取對於既定目的是否必要。
個人資料私隱專員公署於 2026 年完成第三輪 AI 合規審查,涵蓋 60 間機構。根據公署資料,60 間機構中有 57 間(約 95%)在日常營運中使用 AI,約 79% 已使用超過一年,約 51% 同時運行三個或以上的 AI 系統。
該輪審查未發現違反《私隱條例》的情況,這是好消息。但真正值得董事會關注的,是走向。
公署把 2026 年的審查範圍,由銀行、金融、保險及教育,擴展至會計、餐飲、創新科技、物流與物業管理等行業。
公署的建議幾乎與可觀測性的能力一一對應:管治架構、私隱影響評估、AI 稽核、員工培訓、事故應變計劃,以及針對代理式 AI 的審慎管控。2026 年 3 月,公署另行發出提示,把代理式 AI 界定為獨立且較高的私隱風險。
沒有追蹤紀錄的 AI 稽核,只是一場訪談。有追蹤紀錄的 AI 稽核,才是一次檢查,而兩者之中只有一種能撐過追問。
在香港企業內部,這會是什麼樣子?
以下三個場景,反映代理在 200 至 500 人規模的香港機構中實際的部署方式。三個場景的共通點是:代理在技術上運作正常,但若沒有追蹤級別的證據,問題根本看不見。
一家零售連鎖企業部署代理處理會員查詢。它解決了 71% 的個案。追蹤紀錄顯示,其中 9% 的「已解決」個案,引用的是六小時未更新的快取存貨數據。
一家保險公司為核保團隊部署內部條款查詢代理。同事反映好用。檢索紀錄卻顯示,它 60% 的引用來自同一個 2023 年的資料夾,原因是那個資料夾的標籤最整齊,而不是內容最準確。
一家物業管理公司為客戶服務中心部署代理。第六個月的採用率只有 12%。追蹤紀錄顯示,代理在 44% 的對話中都先提出澄清問題。以合規角度而言這是正確行為,但對於兩個會議之間的前線同事而言,這是無法忍受的。
這三項發現,每一項都會改變一個決定。而它們都不會出現在系統可用率的儀表板上。
企業若跳過可觀測性,會出現什麼問題?
跳過可觀測性的企業,通常不會遇上戲劇性事故,而是陷入證據真空:沒有人能證明代理有效,也沒有人能證明它無效,於是預算討論自動傾向會議室中最懷疑的那一位。Gartner 把 2027 年前超過 40% 代理式 AI 項目被取消的預測,歸因於回報不明確與管治薄弱。
量度落差非常明顯。2026 年多份分析引用的調查數據顯示,企業平均預期代理式 AI 帶來 171% 回報,但只有 39% 能把任何 EBIT 影響歸因於 AI。
另一項相關數據更能說明問題:約 80% 的 AI 使用者表示個人生產力提升,但只有 37% 匯報有 EBIT 影響。無法反映在損益表上的生產力,通常是從未在流程層面被量度過的生產力。
管治成熟度令問題加劇。綜合 Gartner、德勤與 IBM 的分析指出,只有約五分之一企業對自主代理擁有成熟的管治模式,換言之約 80% 部署代理的機構,並不具備安全規模化所需的基礎。
隨之而來的四種失效模式相當可預測。
--- 靜默劣化:模型或提示詞改動令答案品質下降,卻數星期無人察覺。
--- 成本無法歸屬:每月代幣帳單無法拆分到業務單位,於是沒有單位願意為它辯護。
--- 價值無法驗證:試點無法被證明有效,續期變成意見之爭。
--- 稽核風險:監管機構詢問代理曾存取哪些資料,而誠實的答案是紀錄沒有保留。
管理層應該如何安排首個 90 天?
次序應該是先建可觀測性,再談規模,而不是倒過來。可行的做法由定義「什麼才算正確答案」開始,接著把一條流程完整儀表化,然後才擴展。在定義評估準則之前就先買平台,只會得到有數據而無判斷的結果。
一套適用於香港企業的 90 天次序如下。
--- 第 1 至 15 天:挑選一條有指定業務負責人、有可量度成果的代理流程。一條,不是一個組合。
--- 第 16 至 30 天:由業務專家撰寫 30 至 50 條參考問題及公認的正確答案。這就是你的評估集,也是整個過程中最有價值的資產。
--- 第 31 至 50 天:為追蹤、工具呼叫與檢索建立紀錄。在產生大量數據之前,先確認保留期符合稽核與《私隱條例》要求。
--- 第 51 至 70 天:每次改動都對參考集執行自動化評估,並每星期把被標記的追蹤紀錄交回業務負責人。
--- 第 71 至 90 天:加上每次執行成本與每宗已解決個案成本,然後用一頁向財務部門同時呈現品質、成本與覆蓋率。
另有兩個相關決策與這項工作並行。第一,你如何在一開始就把正確資訊餵給代理,這正是情境工程要處理的問題。第二,你如何在不讓全部使用者同時受影響的情況下發布改動,這就是分階段推出背後的邏輯。
把可觀測性與嵌入式交付模式結合的機構,推進速度通常更快,這也是前線部署工程師這個角色今年在企業 AI 項目中迅速普及的部分原因。
策略上的核心結論是什麼?
可觀測性不是監控系統的升級。它是把 AI 試點轉化為可辯護投資方案的機制,也是回答每個企業代理項目最終都要面對的三個問題的唯一實際方法:它有效嗎、它花多少錢、你能否證明。
Gartner 對 2026 與 2027 年的兩個預測並不矛盾,它們描述的是一道篩選。四成應用會內建代理,四成以上代理項目會被取消,而站在篩選正確一邊的機構,大多是那些看得見自己代理在做什麼的企業。
香港企業在這件事上有一項具體優勢。私隱專員公署已經公布了良好管治的標準,這意味著合規要求與效能要求,罕有地指向同一個方向。
要建立這種可見度,工具重要,判斷力同樣重要,而有一個看過多輪科技周期起落的夥伴同行,會容易得多。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD 企業 AI 團隊審閱。
讓你的 AI 代理,第一次變得可量度
掌握了框架,下一步是找出最值得優先儀表化的那一條流程。UD 團隊手把手帶你完成每一步,由 AI 準備度評估、評估準則設計,到部署上線、追蹤紀錄與向上匯報成效,28 年企業服務經驗,全程陪你走。