如果你在同一類任務上,AI 的輸出時而出色、時而不堪使用,問題幾乎從來不在你的措辭。你已經懂得寫像樣的提示。在好日子與壞日子之間改變的不是指令,而是模型執行那條指令時,眼前擺著什麼資訊。這就是「情境工程」(Context Engineering)的核心概念,也是為什麼這項原本屬於 AI 工程師的技術,在 2026 年成為非技術背景的實務工作者最值得學的一件事。
什麼是情境工程?
情境工程是控制模型回答時能看見哪些資訊的做法,而不只是控制你如何措辭。提示是指令,情境是視窗裡的其他一切:檔案、記憶、對話歷史、工具輸出、自訂指令。你優化的是資訊,不是句子。
這個區分之所以重要,是因為兩種做法的失敗方式完全不同。提示工程失敗時,你的判斷是「提示寫得不夠好」。情境工程失敗時,你的判斷是「模型沒有拿到正確的資訊」。只有後者能解釋為什麼同一條提示在早上十點給你精彩的答案,下午四點卻只給你套話。
這不是行銷詞彙的更替。2026 年第一季,Neo4j、Elastic、ByteByteGo 與 Firecrawl 各自獨立發表的指南,主題都是情境工程而非提示工程;LangChain 更把這套做法整理成四個動作:寫入、篩選、壓縮、隔離。Anthropic 自己的 2026 年提示工程指引 現在也把提示定位為更大的情境問題中的一塊積木,並明確指出「把情境放在問題之前」是核心技巧之一。
為什麼「把提示寫得更好」已經無法解決輸出不穩定
提示的邊際效益遞減得很快。一旦你的指令已經清晰、具體、有結構,再加字就沒有作用。然而模型的其他所有輸入,你上傳的檔案、專案記憶、對話歷史,卻在每一次工作階段之間持續變動,而這正是輸出品質持續變動的原因。
三件事讓「只調提示」失效。第一,工具的活動部件變多了:專案、記憶、連接器、檔案上傳與網頁搜尋,全都會注入你並未親手輸入的內容。第二,情境視窗變得極大,卻沒有變得更聰明。一百萬個 token 的視窗聽起來像是可以把所有東西貼進去的許可證,但模型的注意力會隨視窗填滿而衰退,所以硬塞的結果是成本更高、答案更差。第三,工具調用成為常態,而每一次工具回傳的結果,不管有沒有幫助都會落進情境裡。
換成實務版本就是這樣。好日子那次,你剛好開了一個新對話,只附上一份乾淨的簡報。壞日子那次,你已經在同一條對話裡走到第四十則訊息,裡面還混著一段無關的岔題、三份已被取代的草稿,以及一份你為另一個客戶上傳的 PDF。提示相同,情境不同,答案自然不同。
情境的五個層次,翻譯成你手上真的有的按鈕
情境工程把模型看見的一切拆成五個層次。工程師用程式碼組裝這五層,你則用 ChatGPT、Claude 與 Gemini 裡已經存在的設定組裝同樣的五層。知道是哪一層出問題,就能一步修好一份糟糕的輸出,而不是改寫十次。
第一層:系統情境(你的常設指令)
這是永遠不變的部分:模型扮演什麼角色、你的規則、你的輸出格式。在消費級工具裡,這就是自訂指令、專案說明,或 Claude Project 的描述欄。要寫得短。這裡每一個 token 都在跟其他四層搶注意力。典型的失敗是臃腫:你不斷加規則,卻從不刪掉過時的,直到模型悄悄開始忽略其中一半。
第二層:使用者情境(你是誰、你怎樣工作)
你的職能、行業、受眾、慣用文風、反覆出現的限制。這正是記憶功能的用途。好好設定一次,你就不必在每次對話裡重新解釋自己的工作。它的失敗模式是塞進與任務毫無關係的個人細節,既浪費視窗空間,又把模型拉離目標。
第三層:檢索情境(你附上的文件)
工程師稱之為 RAG,你稱之為上傳檔案、把來源加進專案,或開啟網頁搜尋。你的品質大部分住在這裡,你的錯誤也大部分發生在這裡。陷阱在於「相似」與「有用」是兩件事:舊版的品牌指南跟現行版本高度相似,卻會實質污染答案。
第四層:工具情境(你允許模型做什麼)
連接器、網頁搜尋、程式執行、檔案存取、自訂 GPT 的動作。生產系統裡那條反直覺的規則同樣適用於你:模型只需要五個工具時,不要給它五十個。可用工具愈多,選錯工具的機率愈高。如果你的助手一直跑去搜尋網頁,而你其實要它讀你附上的文件,那就在這項任務中把搜尋關掉。
第五層:對話情境(對話本身)
這是唯一會在你工作過程中不斷長大的一層,也是大多數人從不管理的一層。每一則訊息、每一份被否決的草稿、每一段岔題,都留在視窗裡。在一段長對話中,這一層可以吞掉大部分可用空間,把你在第二則訊息附上的檔案擠出去。這就是你在第四十則訊息時感受到的那種「跑題」背後的機制。
如何為情境視窗編預算,而不是把它填滿
生產團隊會為每一層分配視窗的百分比,而不是讓它們互相搶奪。常見的起始配置大約是系統 5%、使用者 5%、附加文件 40%、工具 10%、對話 40%,再依任務類型重新調整。你在 ChatGPT 裡無法設定百分比,但你可以用同一套邏輯,去決定什麼該離開視窗。
三個動作幾乎完成了全部工作。任務改變時就開新對話,因為新對話是收回第五層最便宜的方法。只附上那一份現行來源,而不是五份互相重疊的,因為專業系統用重排序(reranking)來避免的正是這件事,而你是在手動做同一件事。當一條長對話確實累積了有用的歷史時,請模型把「到目前為止的決定」整理成摘要,把摘要貼進新對話,然後放棄舊的那條。這就是漸進式摘要,與代理框架內部使用的技術相同。
就方向而言,成本邏輯對你和對工程師是一樣的,即使你付的是固定月費而非按 token 計價。情境愈大,速度愈慢、準確度愈低,所以刪掉無關情境不是整理房間,它就是優化本身。
任何重複性任務都能用的情境區塊(可直接複製)
大多數實務工作者已經有提示範本,卻極少人有情境範本。下面這個區塊明確覆蓋五個層次,設計上就是要貼在一個新對話的最上方,把你的細節換進去即可。它在 ChatGPT、Claude 與 Gemini 上都無需修改就能用。
試試這個情境區塊:
角色:你是我的[內容策略師/分析師/營運助理]。你按我的標準工作,而不是通用的最佳實務。
常設規則:[最多三條。例如:使用繁體中文書面語。不使用破折號。絕不編造統計數字;若缺數字,寫「待補」並列在「缺漏」欄下。]
關於我:我在[市場]從事[行業]。我的受眾是[受眾]。我反覆遇到的限制是[限制,例如:所有內容必須讓非技術背景的客戶讀得懂]。
來源:只使用附加檔案與本則訊息中的事實。若某項資訊不在來源中,不要用一般知識補上,請說出缺了什麼。
工具:本任務不要搜尋網頁,不要瀏覽,只依來源作業。
任務:[實際的請求]
輸出:[格式、長度、結構]
回答之前:用一行列出你將依賴哪些附加來源、將忽略哪些,以及原因。然後才產出結果。
最後一行正是大家會略過、卻最划算的一行。強迫模型先宣告它要用哪些來源,可以在壞草稿成形之前就把第三層的問題揭露出來。如果它告訴你它打算倚重那份過期檔案,你在五秒內就抓到了錯誤,而不是在整篇改寫之後。
情境工程在什麼情況下會失效
這不是萬靈丹,假裝它是,正是技術在第二週被放棄的原因。在你圍繞它重建工作流程之前,有四個誠實的限制值得知道。
硬塞情境感覺很有生產力,其實不是。「以防萬一」把所有東西載入,會提高成本與延遲,並透過「中段遺失」效應削弱品質,也就是埋在長視窗中央的材料得到最少注意力。如果你附了十份文件而品質下降,這就是機制。
持久記憶是雙面刃。記憶是把第二層做好的方式,直到它默默留著你三月完成的專案裡某項偏好,並把它套用在一個要求相反做法的客戶身上。如果你的輸出帶著一種你解釋不了的一致偏向,先讀你的記憶設定,再談改寫。
互相矛盾的來源會產出自信的胡說。附上兩份彼此不一致的文件,模型通常會選一份而不告訴你。專業管線會為此執行矛盾偵測,你沒有這個機制,所以你的版本是:每一項事實只附一份權威來源,並刪掉被取代的版本,而不是兩份都留。
有些任務確實是提示問題。如果你想要更有力的標題或不同的語氣,那屬於第一層,改措辭才是正解。情境工程修的是錯誤或缺漏的資訊,它修不了品味。
立即試做:二十分鐘情境稽核
挑出你最常做、每週重複的那項 AI 任務,也就是輸出品質最難預測的那一項。打開你最近三次執行它的紀錄,逐一列出當時視窗裡究竟有什麼:哪些自訂指令生效、工具對你保留了哪些記憶、附了哪些檔案、開啟了哪些工具,以及對話走到第幾則訊息。
你幾乎總會發現,成功那次的對話比較短、來源集比較乾淨。這就是你的答案,而它只花了二十分鐘,而不是再花一個月調提示。用上面的情境區塊把那次成功的執行重建成範本,然後在三份不同的輸入上各跑一次,確認結果站得住腳。
範本穩定之後,自然的下一步是讓它可攜,使同一套設定能在工具之間搬移,而這正是 Agent Skills 開放標準 的用途。如果你想證明而不只是感覺到改善,AI 評測(evals) 這套紀律能讓你用固定測試集,為同一流程的兩個版本打分。
重點回顧
提示只佔決定輸出品質的一小部分。其餘是你擺在模型面前的資訊,而與模型品質不同,這部分完全在你掌控之中。別再改寫句子,開始稽核視窗。2026 年拉開差距的實務工作者,不會是措辭更巧妙的那些人,而是讓 AI 始終擁有正確資訊的那些人。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 團隊審校。
🚀 想讓這套方法變成穩定的工作流程?
掌握了技術之後,下一步是把它整合成每次都可靠運作的工作流程。UD 團隊手把手帶你完成每一步,從工具配置、情境設計到實際部署,讓你的 AI 不再靠猜,而是真正交付結果。