研究機構 Chroma 曾把 18 個當時最強的 AI 模型,放進同一項簡單的檢索任務做兩次:一次輸入很短,一次很長。任務完全沒變,改變的只是準確度,而在部分模型上,跌幅以十個百分點計。
沒有東西壞掉,也沒有哪個模型「今天狀態不佳」。這個現象叫 Context Rot,可理解為「脈絡衰減」。它解釋了很多老闆都經歷過的事:早上覺得 AI 精明伶俐,到了同一段對話的第四十個訊息,你開始覺得它靠不住。
什麼是 Context Rot?
Context Rot 是指 AI 助理的答案質素,隨著它需要重讀的對話越來越長而下降。模型並非疲倦,也不是故障。它只是被要求在一堆不斷變厚的文字中,找出真正相關的那一句,而它做這件事的準確度,會隨文字變厚而下跌。
名稱來自 Chroma 於 2025 年 7 月發表的研究報告 《Context Rot: How Increasing Input Tokens Impacts LLM Performance》,作者為 Kelly Hong、Anton Troynikov 與 Jeff Huber。團隊測試 18 個主流模型,涵蓋 GPT、Claude、Gemini 與 Qwen 等系列,結論相當直接:模型不會平均地處理一段長輸入,即使是短輸入下能完美完成的任務,只要輸入變長,表現就會顯著波動。重點是:任務一模一樣,改變的只是周邊文字的份量。
AI 到底怎樣「記得」你們的對話?
它並不記得。每次你按下發送,助理都由第一句開始重讀整段對話,然後才寫下一個回覆。這裡沒有人類意義上的記憶,只有一份被反覆重讀的紀錄,而紀錄每一回合都變長。
可以這樣想像:每個訊息都由一位全新的臨時員工回答,能力不錯但完全是新人,回答前必須讀完至今所有對話。第三個訊息時檔案只有一頁,幾秒讀完,答得準確;第六十個訊息時已經四十頁,同樣幾秒,總有東西只能略讀。
這也解釋了為何訂閱頁上的數字比表面重要。OpenAI 官方商業定價頁列明,ChatGPT Business 座位的 GPT Instant 總脈絡視窗為 54K,可輸入上限約 40 頁;Enterprise 方案則為 128K 與約 250 頁。同一頁補充:視窗中真正留給你輸入的部分比總數更小,因為系統指令、已儲存的記憶與模型內部處理都要佔用同一空間。那個視窗裡的住客,不只你一個。
為什麼對話越長,答案越差?
Chroma 的三個發現,已足夠解釋你日常見到的大部分情況。
長輸入不會被平均閱讀。可靠度隨輸入長度增加而下降,所以同一任務在一萬個 token 時做得漂亮,到十萬個 token 卻會出錯。
位置決定什麼會被記住。模型對放在開頭與結尾的資訊,回想得遠比埋在中段可靠。你在第十二個訊息辛苦談定的規則,如今正位於文件中段,那是全場最差的座位。
觸發條件不是難度,而是長度。測試中包括刻意設計得很簡單的任務,例如把字詞原樣重複。即使如此,輸入越長,輸出越不穩定。一個簡單要求,可以純粹因為之前內容太多而失手。
Context Rot 在香港中小企是什麼樣子?
它很少大聲宣告自己,通常表現為細微而昂貴的偏移。
忘記毛利的報價單。貿易公司老闆開頭說明所有報價須保持 15% 毛利,然後逐一處理十一條產品線。做到第九條,報價看起來正常,實際毛利只有 11%,直到客戶接受才有人發現。
不再像你家店舖的回覆。零售商開頭定好語氣:親切、簡短、每次提供門市自取。五十個回覆後,草稿變得冗長,再沒提過自取。指令沒有消失,只是沉了下去。
悄悄變樣的譯名表。餐飲集團在第六個訊息談定雙語菜單譯名,不得變動。到第六十個訊息,市面已流通三個版本,印刷廠用了其中兩個。三件事都不算災難,卻都真金白銀地蝕錢,而且當下看不出來,因為輸出看起來依然是完成品。
大多數人對長對話的誤解在哪裡?
誤解一:換更大的脈絡視窗就解決了。視窗更大代表可接收更多文字才被迫丟棄內容,但不代表模型會平均細讀。容量與可靠度是兩件事,空間更多不等於更用心。
誤解二:AI 在騙你。當模型推翻稍早談定的內容,它並非存心欺瞞。站在它的角度,那條指令只是剛略讀過的長文件中段的一行淡字。它不是抗命,是真的沒有給予足夠權重。
誤解三:換更新的模型就沒事。Chroma 在全部 18 個受測模型都觀察到衰減,包括當時最強的幾個。這是固有特性,並非某一家廠商的缺陷。
如何避免 Context Rot?五個步驟
解決這件事不需要技術能力,只需要一個習慣。
--- 一段對話只做一件事。報價一個對話,客戶回覆另一個,更表再開一個。三件工作混在一起,等於把模型每次要重讀的份量乘以三。
--- 把規則放在最前面。不能移動的條件要寫在第一個訊息:毛利、語氣、譯名表、死線。開頭正是回想最可靠的兩個位置之一。
--- 重開前先要一份交接筆記。輸入:「請把我們已達成的決定與規則,整理成可貼進新對話的編號清單。」讀一次、改正、貼進新對話。沒有簡報的新對話不是解決方案,那叫失憶。
--- 重申三條不能移動的規則。每隔約十個訊息用一句短句重複,把它們送回結尾這個高回想位置。
--- 留意訊號。當助理重問你已答過的問題,或重複早前寫過的段落,衰減已經開始。停手、取交接筆記、重新開始,不要硬撐。
至於一開始該餵什麼給模型,可參考 脈絡工程;答案裡的事實從何而來,可參考 AI Grounding。
關於 Context Rot 的常見問題
開新對話會不會把之前的工作丟掉?
只有開空白對話才會。交接筆記就是轉移工具:要一份編號清單、自己核對、貼進新對話,你保留結論,同時甩掉產生結論的四十頁討論。
多長才算太長?
沒有通用數字,取決於模型與方案。實用準則是:如果你無法在兩三下滑動內回到對話最頂,就該做交接筆記。
這跟 AI 幻覺是同一回事嗎?
不是。幻覺是憑空捏造的事實;Context Rot 是真實存在的指令因位置而被低估權重。幻覺靠提供已核實來源處理,Context Rot 靠管理對話長度處理。
付費方案也會有嗎?
會。付費方案買到更大視窗,只會延後文字被丟棄的時間點,不會改變模型在視窗內閱讀的均勻程度。
給老闆的結論
現時香港辦公室最常聽到的 AI 投訴都是同一句:開頭很好,之後開始馬虎。大多數個案裡,退步的只有一樣,就是對話的長度。
這其實是好消息,因為修正成本是零。不用加訂閱,不用換工具,不用請顧問,三個習慣一個上午就能學會。
這也對應了香港中小企一直在說的、AI 卡住的真正原因。大新銀行 2026 年 5 月訪問超過 340 間本地中小企,約 23% 已採用 AI 或生成式 AI,45% 完全未開始;而未開始的一群中,57% 指主要障礙是缺乏相關知識或技能。不是價錢,不是技術,而是不懂得怎樣用得好。
這是一個教學問題,而長期同行,正正就是為了解決教學問題。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 團隊審閱,香港,2026 年 9 月。
想把這套方法帶回你的團隊?
知道 AI 為何走樣只是第一步,把它變成員工真的會照做的日常流程,才是真正的難處。UD 在香港做了 28 年技術,最擅長讓科技乖乖聽話。我們手把手教你,由用日常語言評估 AI 在你業務中的位置,到建立一套你團隊自己就能運作的做法。