大多數每日使用 AI 的人,仍然習慣在提示的開頭寫上一句「請一步一步思考」。在 2026 年 8 月你正在使用的模型上,這句話最好的結果是毫無作用,最壞的結果是令輸出質量明顯下降。
這不是風格偏好的問題。過去一年,各大模型家族都悄悄完成了一次架構轉變,而 API 圈子以外的使用者幾乎沒有察覺。
以下是實際改變了什麼、哪些提示習慣應該淘汰,以及可以直接複製使用的替代範本。
什麼是推理模型?2026 年到底改變了什麼?
推理模型是指在輸出可見答案之前,先自行生成一段內部思考鏈的語言模型。你看不到這些內容,但你要為它付費,而它直接決定回應的質素。到了 2026 年,這已經是預設行為,而不是一個需要你開啟的選項。
最清楚的例子是 Claude Sonnet 5。根據 Anthropic 的 adaptive thinking 官方文件,一個沒有指定 thinking 欄位的請求,現在會自動以適應性思考模式運行。同一個請求在 Claude Sonnet 4.6 上,是完全不會啟動思考的。
Anthropic 的 Sonnet 5 更新說明寫得更直接:手動設定 extended thinking 現在會回傳 400 錯誤;把 temperature、top_p 或 top_k 設為非預設值,同樣回傳 400 錯誤。你以前習慣調校的旋鈕,已經被移除。
OpenAI 的方向一致。GPT-5.6 系列的推理深度,是透過 reasoning effort 參數設定,而不是靠你在提示裡寫的一段文字。
為什麼「一步一步思考」現在反而有害?
叫一個推理模型「一步一步思考」,等於要求它做一件它已經完成的事。這句指令會落入兩種壞結果之一:模型把推理過程直接寫進可見答案,或者把內部推理限制在你寫的框架之內。
第一種情況是你會即時察覺的。你要求一段 200 字的產品描述,結果收到 700 字的「首先,讓我考慮目標受眾。其次,讓我思考語氣」。這段推理你本來已經付過一次錢,現在以輸出的形式再收你一次。
第二種問題更安靜,代價也更高。你列出的步驟其實是一個上限。模型在處理定價分析時可能想檢查五項因素,但你的提示只叫它檢查三項,於是它只檢查三項。
實務上有一個非常常見的情境:你把 2023 年寫下的提示範本貼進 2026 年的模型,得到一段冗長的回應,然後結論是「這個模型變差了」。模型並沒有變差,是你的提示在跟它對抗。
2026 年應該淘汰哪五個提示習慣?
以下五種技巧在 2023 年的模型上確實有效,但在推理模型上,效果已經變成中性或負面。每一項在當時都是正確建議,現在則是你在 token、延遲與偏移上白白付出的成本。
一、「一步一步思考」及其變體。包括「請仔細推理」「慢慢想」「想深入一點」。OpenAI 對現行推理模型的官方建議,就是不需要叫模型想得更用力,也不需要叫它展示思考鏈。
二、冗長的條列式規則清單。四十行的「應該/不應該」,是以前從非推理模型手上換取一致性的方法。在推理模型上,它會與任務本身爭奪注意力,而且你每加一條規則,真正重要的那幾條就被稀釋一分。
三、調高 temperature 追求創意。在 Claude Sonnet 5 上,這已經不是壞主意,而是一個錯誤:非預設的取樣參數會回傳 400。創意上的變化,現在來自你要求什麼,而不是來自一個滑桿。
四、單獨寫一句「請簡潔」。這句話既模糊,方向也錯。「請簡潔」是叫模型把所有內容平均壓縮;「最多 150 字,不要開場白,不要總結段落」才是告訴它應該砍哪裡。
五、把角色扮演當成整套策略。「你是一位世界級的營銷策略師」在 2023 年是關鍵一句。在 2026 年,它只是一個輕微的框架提示。真正的工作已經轉移到脈絡與限制:模型看得見什麼,以及怎樣才算完成。
那應該怎樣寫?結果導向提示範本
用結果規格取代過程指令。推理模型不需要你教它怎樣思考,它需要知道自己在看什麼、在優化什麼,以及一份完成品應該是什麼樣子。六個區塊已經足夠:目標、脈絡、限制、證據、成功標準、輸出格式。
以下是一份完整、可以直接複製使用的提示,當中沒有任何一句推理指令。
直接試用這個提示:
目標
撰寫新功能「網上預約」的發布通知電郵。
脈絡
對象:2,400 位現有客戶,主要是香港的診所與美容院東主,平均 4 名員工。
他們每日使用我們的排程產品,並已要求網上預約功能兩年。
品牌語氣直接、實用,不使用感嘆號。
產品事實:客戶只需分享一條預約連結;客人無須註冊帳戶即可預約;預約會在 5 秒內出現在原有日曆;所有付費方案免費包含此功能。
限制
正文最多 180 字。主旨一句,最多 20 字。
電郵前不要開場白,電郵後不要解釋。
不得聲稱任何我們未曾實測的省時數字。
證據
電郵中每一項產品聲明,都必須對應「脈絡」中列出的事實。若你需要一項我未提供的資料,請在原位寫上 [需要:所需資料],不要自行創作。
成功標準
一位只看主旨與第一句的診所東主,能夠明白網上預約功能已經推出,而且不需額外收費。
輸出格式
第一行為主旨。空一行。然後是電郵正文。不要有其他內容。
留意這裡缺少了什麼:沒有角色設定,沒有「請仔細思考」,沒有編號方法論。怎樣抵達由模型決定,抵達哪裡由你定義。
證據區塊是整份範本中槓桿最高的一句。要求模型寫出 [需要:⋯⋯] 而不是自行補上空白,等於把一次幻覺轉化成一項看得見的待辦事項。
如何把它套用在每週重複的工作上?
這套範本在你每週重複的任務上回報最高,因為固定的提示會令輸出的波動變得可診斷。當結果不穩定時,原因就是脈絡區塊的改動,而不再是一個謎。
以每週業績摘要為例。2023 年的做法是一大段指令:扮演數據分析師,逐步檢視數字,先找出趨勢,再解釋原因,然後提出建議,要簡潔但全面。
2026 年的做法,是把目標、限制、成功標準與輸出格式永久固定在一份已儲存的提示中,每週只更換脈絡區塊,貼上新的數字。
成功標準是大多數人投入不足的一環。「幫我總結今週的數字」沒有終點線;「一位只讀前三行的主管,能夠說出本週唯一有明顯變化的指標,以及本週唯一需要做的決定」則有一條模型可以瞄準、你也可以據此評分的終點線。
這也解釋了為何一份重複使用的提示,勝過一份靈光一閃的提示。你用四十次、改六次的提示,會贏過一次性的神來之筆,因為你看得見哪一次修改改變了哪一種行為。
這個建議在什麼情況下會失效?
捨棄推理指令,對現行的前沿推理模型是正確的,但並非放諸四海皆準。以下三種情況仍然適用舊習慣,假裝它們不存在只會令你吃虧。
小型模型與舊模型。如果你在跑輕量的本地模型或較舊的非推理模型,思維鏈提示依然有效,而且效果很好。本文的建議,範圍僅限於預設就會推理的模型。
當你需要審核邏輯時。有些情況你確實需要在可見輸出中看到推理,因為你要檢查它,例如合規計算或會被人質疑的定價決策。這時應該把它當成交付項目來要求:「答案之後,列出你所使用的假設。」這是輸出要求,不是推理指令,兩者的分別很重要。
結構化擷取與格式化工作。從 300 張發票中抽取欄位,完全不會因為推理而受益。在 Claude Sonnet 5 上,你可以傳入 disabled 的 thinking 設定將它關閉,同時省下成本與延遲。選擇最便宜而足夠的模式,與選擇最便宜而足夠的模型等級是同一種紀律,我們在如何在 GPT-5.6 Luna、Terra 與 Sol 之間選擇一文中詳細談過。
還有一項提醒:模型行為與版本綁定。本文所述的 400 錯誤行為,是 Claude Sonnet 5 截至 2026 年 8 月的官方記載。在你把生產流程建基於此之前,請先查閱你實際呼叫的那個模型字串的最新更新說明。
立即試做:20 分鐘提示審計
你可以用手上現有的提示,在大約二十分鐘內驗證本文的每一項說法。重點不是相信這套論證,而是在你自己的任務、自己的輸出上看見差別。
打開你重複使用得最多的三份提示,逐一做以下四步:
--- 刪除每一句告訴模型「怎樣思考」的指令,包括「一步一步」「仔細地」「以專家身份」,以及任何編號方法論。
--- 加入一個限制區塊,寫明硬性字數上限,以及明確的「不要開場白」規則。
--- 加入一句成功標準,描述讀者看完輸出之後應該能夠做到什麼。
--- 在兩個獨立對話中,用同一份輸入分別執行原版與改寫版,比較長度、準確度,以及各自需要多少修改。
在我們自己的測試中,改寫後的提示輸出更短,需要的修改更少;差距在有明確交付物的任務上最大,例如電郵、簡報大綱與摘要。開放式腦力激盪的差別則最小。
哪一版勝出就保留哪一版。整套方法就是這樣,而且每當你依賴的模型推出重大版本更新時,都值得重做一次。
核心結論:不要再管理模型,改為定義結果
2023 年重要的技能,是懂得如何讓模型思考。2026 年重要的技能,是懂得把一份完成品描述得夠精確,讓一個本來就會思考的模型可以準確命中。
這是一種截然不同的技能,它更接近「寫好一份工作簡報」而不是「寫程式」。如果你曾經為自由工作者寫過一份清晰的簡報,你其實已經掌握了大部分。
這也解釋了很多有能力的人現在的挫敗感:你落後,不是因為你欠缺某個秘密技巧,而是因為你學過的技巧,適用於一代已經被悄悄替換掉的模型。
要跟上這種變化,正是同行者發揮價值的地方。懂AI,更懂你 UD相伴,AI不冷。
測試你的 AI 實力
改寫提示只是第一步。把它變成每星期都穩定運作的工作流程,才是真正的收穫所在。UD 團隊手把手帶你完成每一步,由提示設計、模型選型,到部署進你日常使用的工具之中。
由 UD AI 團隊審閱。本文引用的模型行為,依據截至 2026 年 8 月 6 日的官方文件,並與版本綁定。