為什麼 AI 會忽略長提示中段的資料?
大型語言模型對提示開頭與結尾的內容記得最牢,對中段的內容卻明顯遜色。研究者稱這種現象為「中段遺失」(lost-in-the-middle)。你貼上一份 40 頁報告,追問第 22 頁的一項條款,模型很可能改用第 2 頁與第 40 頁的內容作答,儘管第 22 頁明明就在它的上下文視窗之內。
先坦白承認 AI 的一個弱點:它並非平均地閱讀整段輸入。上下文視窗填滿之後,注意力集中在前後兩端,你最需要的那個事實,就在中段悄悄輸掉了爭奪焦點的競賽。你的提示沒有寫錯,只是把最重要的部分放在了錯誤的位置。
定義:中段遺失是指語言模型對放在輸入開頭或結尾的資訊,比放在中段的相同資訊使用得更可靠,形成一條依位置而變的 U 形準確率曲線。
核心文獻是 Nelson F. Liu 等人於 2024 年發表在 TACL 的論文 Lost in the Middle: How Language Models Use Long Contexts。在多文件問答測試中,答案位於第一份或最後一份文件時準確率最高,同一答案移到中段時準確率急跌。
更大的上下文視窗能否解決問題?
不能。更大的視窗讓你可以貼上更多內容,卻不會令模型平均地關注每一個 token。容量變大,多數只是增加了干擾的空間。真正該問的不是模型接受多少 token,而是它一次能準確運用多少,而這個數字遠低於宣傳數字。
宣傳數字仍在攀升。2026 年 9 月 14 日,ChatGPT 將手動選擇 Thinking 模式時的總上下文視窗提升至 256K token(輸入 128K 加輸出 128K),此前為 196K,AI 研究者 Tibor Blaho 記錄了這項變更。Gemini 的 Pro 級模型與 Claude 的頂級方案,則標榜百萬級 token 的視窗。
可用數字卻落後於宣傳數字。Chroma 的 context rot 研究測試了 18 個模型,包括 GPT-4.1、Claude 4 與 Gemini 2.5,發現沒有一個模型能均勻地使用長輸入,而且輸入越長,可靠性越低。另一篇 2025 年關於「最大有效上下文視窗」的論文指出,受測模型在部分任務上的有效視窗,比宣傳上限低了最多 99%。
提示中最重要的資訊應該放在哪裡?
把長期有效的規則與決定答案的關鍵事實放在最前面,把真正的問題與輸出要求放在最後面,絕不要讓決定答案的那一句話留在長貼文的中間三分之一。如果關鍵段落必須留在文件內部,就在問題旁邊再引用一次。
可以把一段長提示想成閱讀品質不同的三個區域。
--- 前區(記憶力強):角色、常設規則、整份文件所依賴的定義或數字,以及一句話預告你最後會問什麼。
--- 中區(記憶力弱):貼上的大部分材料。只存在於這裡的內容都有風險。
--- 後區(記憶力強):問題本身、輸出格式、限制條件,以及再次引用的決定性段落。
最實用的單一技巧來自 Anthropic 針對 Claude 2.1 發布的長上下文指引。在提示中加入一句 「以下是上下文中最相關的句子:」,並要求模型先抽出該句再作答,長文件檢索準確率由 27% 升至 98%,詳見 Anthropic 的公開說明。模型版本雖已過時,但「先強制抽取、再回答」這個習慣,在 2026 年的模型上日常使用依然有效。
如何構建長文件提示,確保沒有內容被遺漏?
使用固定次序的標籤區塊:規則、關鍵事實、完整文件、抽取步驟、最後是問題與格式。「規則」「關鍵事實」「文件」「任務」這些標籤是路標,而抽取步驟則強迫模型在動筆之前先找到決定性的段落。
以下是一個可以直接複製使用的完整範本,適用於 ChatGPT、Claude 或 Gemini 的一般對話介面,無需 API。
試試這個提示:
【規則】
你是一位嚴謹的分析員。只根據下方【文件】作答。若文件中沒有答案,請回答「文件中未找到」。除非被要求,不要總結整份文件。
【關鍵事實】
1. 租約續期日為 2027 年 3 月 31 日。
2. 終止租約須提前 90 日書面通知。
3. 逾期付款利息為每月 1.5%。
【文件】
[在此貼上完整文件]
【抽取步驟】
作答之前,先逐字引用【文件】中與【任務】最相關的一至三句,並標明條款編號。
【任務】
問題:如果我們在 2027 年 1 月 15 日發出通知,能否在續期日之前退租?會產生什麼罰款?
輸出格式:(1)引用的句子;(2)一段文字的答案;(3)一行信心評級並附原因。
這個範本有效的關鍵在於三個細節。【關鍵事實】位於前區,模型在進入大段貼文之前已先鎖定正確的數字。【抽取步驟】把檢索問題轉化為抄寫任務,而抄寫正是模型的強項。【任務】位於最底部,最接近生成答案的位置。
如果你已經在使用結構化的輸出約定,這個範本可以直接嵌入;格式方面可參考 UD 的 輸出契約指南。
這套方法如何應用於報告、會議與數據等實際工作?
只要你貼上的內容超過大約十頁或一小時的會議記錄,就套用同一套三區結構:把重要事實釘在最前面,加入抽取步驟,在最後提問。無論是董事會報告、會議轉錄、匯出成文字的試算表,還是多封往來電郵,都同樣適用。
客戶會議準備。你貼上一段 90 分鐘的會議轉錄,問客戶承諾了什麼。承諾多數集中在最後 15 分鐘,這沒有問題,但客戶的預算上限是在第 40 分鐘提到的。把「第 40 分鐘左右提及預算上限:120 萬港元」寫進【關鍵事實】,否則模型會圍繞錯誤的數字擬定方案。
季度報告審閱。一份 60 頁的 PDF,唯一的收入重列藏在第 31 頁的註腳。把該註腳引用在前區,並在問題之前再引用一次。否則模型會很樂意替你核對一堆早已被取代的數字。
長對話。你在 40 條訊息之前給出的指令,現在已經處於視窗中段。每 15 至 20 輪重申一次常設規則,或者開一個新對話並把規則放在最頂。長對話中的「跑題」,多數只是換了面貌的中段遺失。
哪些錯誤會令中段遺失問題更嚴重?
最常見的錯誤包括:貼上超出任務所需的內容、把規則與數據混在同一段、一次問多個問題,以及在未核對來源段落的情況下相信一個自信的答案。每一項都會加劇上下文視窗內的競爭,並掩蓋模型跳過關鍵事實的那一刻。
--- 「以防萬一」把所有東西都貼上。文字越多,干擾越多。Chroma 的數據顯示,即使額外的文字與任務相關,可靠性仍會隨長度下降。只保留問題真正需要的部分。
--- 近似重複的段落。同一段貼文裡有兩個相似的定義是經典陷阱,模型可能因為舊版本更靠近邊緣而選了它。貼上之前先刪除已被取代的版本。
--- 規則埋在文件之後。如果你的格式規則排在 30 頁貼文之後,在模型眼中它們就是中段。規則放最前,格式放最後,絕不放中間。
如何用十分鐘測試你的 AI 工具是否有這個問題?
選一個模型理應答對的事實,把它分別藏在同一份長文件的三個位置:靠近開頭、正中間、靠近結尾,然後用完全相同的問題問三次。若中間那次答錯或含糊,你就已經在自己的工具與自己的文件上量度到這個效應。
一個現在就能做的十分鐘版本:
--- 選一份你熟悉的長文件,大約 20 頁。
--- 在第 2 頁插入一句虛構但合理的話,例如「本項目代號為海港燈籠」,然後問「本項目代號是什麼?」記下答案。
--- 開新對話,把那句話移到第 10 頁,再問一次。然後移到第 19 頁。
--- 把第 10 頁的版本再跑一次,這次加入【抽取步驟】,並把問題放在最底部。
多數人會看到中間那次失敗或含糊其辭,而加入抽取步驟的那次則恢復正常。這就是你在自己的模型、自己的內容上取得的證據,不需要任何基準論文。隨之養成的習慣很簡單:每次貼上長內容,都刻意安排位置,並在提問之前先抽取。
今年真正拉開差距的從業者,並不是擁有最大上下文視窗的人,而是明白 AI 的閱讀方式與人不同,並確保它的冷區永遠不會承載決定性事實的人。懂AI的冷,更懂你的難,UD 同行28年,讓科技成為有溫度的陪伴。
本文由 UD AI 團隊審閱。
看看你的 AI 協作成果,與 AI 員工對決會是什麼結果
你已經學會如何讓模型讀到真正重要的內容,下一步是把它變成可重複的工作流程,並看清 AI 同事在哪些環節確實勝過人類、哪些環節仍然落後。UD 免費的 AI Battle Staff 讓人類職位與 AI 員工在 20 個真實商業場景中正面對決,UD 團隊手把手帶你完成每一步,把對決結果轉化為你團隊可以實際運行的配置。