對推理模型說「一步一步思考」,究竟發生了什麼?
在推理模型的提示中加入「一步一步思考」,準確度幾乎不會提升,但回應時間會增加 20 至 80%。推理模型在輸出答案之前,本身已經生成內部推理過程。你的指令只是重複它已經安排好的工作,在部分模型上更會令答案變得不穩定。
這並非個人猜想,而是賓州大學沃頓商學院 Generative AI Labs 的《Prompting Science Report 2》的實測結論,作者為 Lennart Meincke、Ethan Mollick、Lilach Mollick 及 Dan Shapiro。
這句提示語當年確實名副其實。2022 年它是真正的突破,因為那個年代的模型如果你不要求,就不會把推理過程寫出來。
模型變了,習慣卻沒有變。
一句話定義
思維鏈提示(Chain-of-Thought)是指令模型在給出最終答案之前先敘述推理過程,藉此提升多步驟問題的準確度。到了 2026 年,前沿模型預設已在內部完成這個動作,因此這道明示指令已經不再划算。
沃頓的實測數據到底顯示了什麼?
沃頓以 GPQA Diamond 的 198 道博士級題目,每題重複 25 次,橫跨推理與非推理模型測試。即是每個模型、每種提示各 4,950 次運行。結果是:在推理模型上,思維鏈令平均準確度在兩個模型上升約 3 個百分點,在第三個模型上卻下跌。
具體數字值得記住,因為它們既細微,方向亦不一致。
--- o3-mini:加入「一步一步思考」後平均準確度上升 2.9 個百分點(p = 0.024)
--- o4-mini:上升 3.1 個百分點(p = 0.003)
--- Gemini Flash 2.5:下跌 3.3 個百分點(p = 0.005)
--- 推理模型的延遲代價:回應時間增加 20 至 80%,即每題多花 10 至 20 秒
更值得注意的結果出現在非推理模型:思維鏈拉高了平均分,卻嚴重破壞穩定性。沃頓另外設定了一項名為「100% Correct」的指標,即同一道題在 25 次試驗中全部答對才算成功。
在這項穩定性指標上,Gemini Pro 1.5 加入思維鏈後下跌 17.2 個百分點,Gemini Flash 2.0 下跌 13.1 個百分點。平均分升,一致性跌。
如果你對 AI 的抱怨是「昨天很好用,今天完全不行」,這個取捨正是問題的形狀。
2026 年取代思維鏈的是什麼?
是推理強度設定。你不再用文字編寫思考流程,而是用參數設定模型應該思考多深,然後寫一段簡短提示,直接說明你要的輸出。Google、OpenAI 與 Anthropic 都提供了某種形式的這個控制項。
Google 在自己的遷移指引中寫得很白。最後更新於 2026 年 8 月 18 日的Gemini 3 開發者指南直接告訴開發者:如果你過去用思維鏈這類複雜提示工程去迫使 Gemini 2.5 進行推理,改用 Gemini 3 時應該把 thinking_level 設為 high,並簡化提示。
同一頁列出四個等級:minimal、low、medium、high。Gemini 3.1 Pro 與 Gemini 3 Flash 預設為 high。
Google 亦指出,OpenAI 的 reasoning_effort 參數會透過兼容層自動對應到 Gemini 的 thinking_level,換言之這個概念在不同供應商之間是通用的。
如果你從不接觸 API
你依然擁有這個控制項,只是換了外觀。在消費者版應用中,它以模型或模式選單的形式存在:思考模式或延伸思考的開關、模型清單中的推理型號、「快速」與「仔細」的選擇。選擇模式就是現代版的「一步一步思考」,而且不用付出額外 token 成本。
一道好的推理模型提示長什麼樣?
2026 年的好提示是簡短的:先說任務,再定義完成品,列出限制,然後對「如何思考」完全不提。Google 針對 Gemini 3 的指引明確警告,模型可能會過度分析那些為舊模型而設的冗長提示工程。簡潔現在是一項效能特徵,不是懶惰。
以下模板在 Claude、ChatGPT 及 Gemini 的推理模式中都可用。直接複製,替換方括號內容即可。
立即試用這道提示
--- 任務:[一句話說明你要的唯一結果]
--- 輸入:[貼上原始素材,或寫「見附件」]
--- 輸出格式:[精確形狀,例如「六行表格,欄位為 X、Y、Z」、「三段各 60 字」、「包含這些鍵值的 JSON 物件」]
--- 必須包含:[令成品可用的兩三項要素,例如「每一行都要有港元金額」、「每項主張標明來源行數」]
--- 不得出現:[你反覆遇到的失敗,例如「不得虛構輸入資料中沒有的數字」、「不要加總結段」]
--- 驗收標準:[你將如何判斷,例如「我可以直接貼進簡報,不用修改」]
留意缺少了什麼。沒有「你是世界級專家」,沒有「深呼吸」,沒有「一步一步思考」,沒有奉承,沒有角色扮演的鋪墊,也沒有任何關於推理過程的指令。
取代這一切的是「驗收標準」那一行。寫明驗收標準,就把模糊的要求變成可檢查的要求,而推理模型特別擅長針對已明示的標準去優化。
Google 指引中還有一項小細節,效果比大多數人預期更明顯:當你貼上長文件時,把指令放在資料之後而不是之前,並以「根據以上資料」這類句式開始你的問題。
如何把這套方法套用到實際工作?
以一個常見任務為例:把 40 頁季度報告變成給客戶看的摘要。舊寫法會疊上人物設定、逐步思考指令與客套鋪陳。新寫法只陳述成品與驗收標準,讓推理模式自行完成思考。
舊版提示通常是這樣:「你是資深商業分析師。請仔細閱讀附件報告。一步一步思考。然後撰寫摘要。」它會產出一段合格但毫無形狀的文字,你之後還要重寫一次。
用上面模板寫的 2026 版本是這樣。
--- 任務:撰寫季度回顧簡報中面向客戶的摘要部分。
--- 輸入:附件的 40 頁第二季報告。
--- 輸出格式:四個要點,每點最多 25 字,然後一段 60 字的段落,指出唯一最大的風險。
--- 必須包含:每個要點都要有帶單位的數字,以及該數字出自的頁碼。
--- 不得出現:任何報告中沒有出現的數字;不得淡化風險段落。
--- 驗收標準:我可以直接把四個要點讀給客戶聽,中間不需要查證任何東西。
頁碼那項要求是低調的關鍵。它令輸出可以在 30 秒內被核查,而這一點才真正決定你是否信任這個工具到願意每週使用。
如果你想處理另一種可靠性問題,可以參考我們早前關於驗證鏈提示法的文章,那是專門抓出虛構事實的第二輪提示。
這套建議在什麼情況下會失效?
它在較舊、較小的模型上會失效,在你需要看見推理過程的任務上會失效,以及在任何需要向人類審核者展示思考過程的場景都會失效。沃頓發現思維鏈在非推理模型上依然能提升平均表現,換言之這條建議取決於模型,並非普世通則。
在你把這句提示從所有存檔中刪掉之前,請先看三項誠實的限制。
小型與廉價模型依然需要鋪墊。如果你為了控制成本而使用 mini 或 flash-lite 等級的模型,又或者在自己電腦上運行開放權重模型,思維鏈往往仍然值得那些 token。沃頓在較舊的非推理模型上量到 11 至 14 個百分點的平均準確度提升。
有時推理過程本身就是交付物。如果你在審視一項論證、教授一套方法,或需要查清模型錯在哪裡,要求它列出步驟是完全合理的。此時你不是為準確度而提示,而是為一件成品而提示,那是另一份工作。
不要擺向另一個極端。沃頓同時發現,強迫模型「只回答答案,不要其他內容」很可能損害非推理模型的表現,因為這阻止了它原本會自行進行的推理。「用一個詞回答」是有真實代價的,不是免費的效率。
還有一項香港本地觀察。中英混用的提示依然可行,但短提示原則令語言混用的影響,變得不如結構重要。一份乾淨的雙語模板,勝過一段文采優美的單語段落。
接下來 20 分鐘可以做什麼?
挑一項你每週都會重複的任務,做一次對照實驗。取你目前最好的提示,再造一個版本,把所有推理指令與人物設定刪掉,兩個版本各在推理模式下運行三次,然後用你自己的驗收標準比較輸出。每邊三次已足夠看出規律。
評分要用兩個軸,不是一個。第一,最好的那次輸出有沒有變好?第二,也是更重要的,最差的那次輸出有沒有變好?一致性才是決定一道提示能否在截稿壓力下存活的因素。
多數實務使用者會發現,精簡版即使在第一個軸上打成平手,在第二個軸上仍然勝出。整套論證就在這一次實驗裡。
更大的教訓是:提示技巧有保鮮期。2022 年不可或缺的技巧,2024 年變成可選,2026 年變成一種稅,而且沒有人發通告。唯一耐用的能力,是用你真正付費的那個模型,針對你自己的工作去測試自己的提示。
懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴。
由 UD AI 團隊審閱。
找出哪個模型值得你的提示
懂得如何提示推理模型只是一半功夫,知道該把提示指向哪個模型才是另一半。UD 的 AI 排行榜把當前主流模型放在真實商業任務上並列比較。如果你想把這套技術嵌入一個每週都以同樣方式運行的工作流程,UD 團隊手把手帶你完成每一步,由選模型、寫提示模板,到實際部署。