大多數天天使用 Claude 或 ChatGPT 的人,其實不知道現在有一個「旋鈕」,可以直接控制模型在回答之前願意思考多久。這不是提示技巧,而是一個設定。
Anthropic 在 2026 年 7 月 24 日隨 Claude Opus 5 推出了「effort(努力程度)」控制;OpenAI 則在 7 月 9 日隨 GPT-5.6 推出 max reasoning 設定與 ultra 模式。兩間最大的實驗室在兩星期之內推出同一類控制,這件事本身就說明了槓桿在哪裡。
如果你一直靠改寫提示來解決「輸出品質不穩定」的問題,這就是你漏掉的那個變數。
什麼是 AI 模型的努力程度設定?
努力程度設定是一個控制項,用來告訴模型在回答之前要投入多少推理。設得高,模型內部推敲更多,困難任務的準確度更高,但消耗更多 token、回應更慢;設得低,答案更快、更便宜,但也更淺。它是一個成本與品質之間的旋鈕,不是開關。
關鍵在於:努力程度與模型選擇是兩件事。你不再只是決定「用哪個模型」,而是同時決定「這個模型可以思考多深」。
這個區別很重要,因為大部分令人失望的 AI 輸出並不是模型能力不足,而是錯配:一個需要深思的任務,被用聊天的速度回答了。
Anthropic 對 Opus 5 的 effort 設定描述是:一端可以最大化智能表現,另一端則節省 token 以換取更快、更便宜的結果。OpenAI 的版本則以推理深度為核心,最高等級甚至可以把任務拆開,讓多個並行的子代理互相協調完成。
2026 年 7 月 Anthropic 與 OpenAI 究竟推出了什麼?
兩家公司都把推理控制綁在新的旗艦模型上。Anthropic 於 2026 年 7 月 24 日發布 Claude Opus 5,內建 effort 設定;OpenAI 於 7 月 9 日發布 GPT-5.6,一次推出三個級別,並附帶 max reasoning 設定與 ultra 模式。因為這些控制項太新,市面上絕大多數提示教學都寫在它們出現之前。
以下是依照兩家官方公布值得記住的細節:
--- Claude Opus 5(Anthropic,2026 年 7 月 24 日):每百萬輸入 token 收費 5 美元,每百萬輸出 token 收費 25 美元;1M token 上下文視窗,最高輸出 128K。首次引入 effort 設定。Anthropic 表示,它在 CursorBench 3.2 上與 Claude Fable 5 的最佳成績差距在 0.5% 以內,而每項任務成本約為一半。
--- GPT-5.6(OpenAI,2026 年 7 月 9 日):不再只有單一模型,而是三個級別。Sol 為每百萬 token 輸入 5 美元、輸出 30 美元;Terra 為 2.5 美元/15 美元;Luna 為 1 美元/6 美元。
--- Ultra 模式:在 Sol 級別上,模型可以把任務拆解並運行並行子代理。OpenAI 表示,這讓它在一項命令列編程基準上的分數由 88.8% 提升至 91.9%。
--- 你在哪裡會遇到它:在 API 中需要你自己明確設定;在消費版應用中則部分由系統代你決定,這也解釋了為什麼同一個問題在不同日子會得到深淺明顯不同的答案。
請把這些數字視為特定版本的資料。模型系列經常重新分級與調價,某一版的基準分數不會自動延續到下一版。
什麼時候應該把努力程度調高,什麼時候不需要?
當任務存在「答錯會有代價」的可能時,就把努力程度調高:分析、規劃,以及任何條件之間互相牽制的任務。當任務沒有隱藏陷阱時就維持低檔:排版、摘要、改寫、分類。把簡單任務調到最高,不會讓輸出變好,只會更貴更慢。
以下是一套實際可用的分流規則:
--- 低努力/便宜級別:重新排版、調整語氣、從文件抽取欄位、為收到的訊息分類、產出幾個你反正會親手改的文案版本。
--- 中等努力/平衡級別:真實交付物的初稿、範圍明確的資料整理、把會議記錄整理成結構化簡報。
--- 高努力/旗艦級別:定價與預算模型、渠道之間互相取捨的活動規劃、需要你向別人辯護的供應商比較,以及任何要呈給上級的內容。
--- Ultra 或並行子代理模式:涉及工具調用與重試的多步驟工作。用來回答單一問題是過度配置,而且你會明顯感受到延遲。
反直覺的一點是:高努力帶來的最大收益,通常不是來自最困難的任務,而是來自「中等難度但語意模糊」的任務。一份有三種合理解讀方式的簡報,正是深思最有價值的地方;而一個真正困難但條件寫得清楚的任務,中等努力往往已經處理得不錯。
成本上也有後果。努力程度越高,推理 token 越多,而推理 token 是按輸出計費。以上述價格計算,在 GPT-5.6 Sol 上以每百萬輸出 token 30 美元的價格跑高努力任務,並不適合放在整個收件匣上自動運行。
怎樣寫出真正受益於高努力的提示?
高努力設定獎勵那些「有東西可以推敲」的提示:互相競爭的選項、明確的限制條件,以及一個具名的失敗條件。如果你的提示只是要一段文字,額外的推理無處可用。若答案只有一個明顯選項,深思也無從發揮。
有效的模式是:先迫使模型比較,再迫使它淘汰。給它幾個選項與淘汰的理由,額外的思考就會花在判斷上,而不是堆字數。
立即試用這個提示:
你現在是在覆核一個決定,不是回答一個問題。
任務:[貼上你真正需要做的決定]
背景:[貼上限制條件、預算、期限,以及已經被排除的選項]
在回答之前,請在內部完成以下步驟:
1. 列出三個最合理的方案。
2. 為每一個方案寫出最強的反對理由。
3. 淘汰任何無法回應自身反對理由的方案。
然後只輸出:
--- 你的建議,一句話。
--- 這個建議依賴的兩個假設。
--- 什麼證據會讓你改變主意。
不要展示中間推理過程。如果背景資料缺少你需要的東西,請直接指出缺什麼,不要猜。
把這個提示在同一個任務上跑兩次,一次低努力、一次高努力。低努力版本通常會給你最常見的選項,加上很有自信的包裝;高努力版本則更常會指出一個你自己還沒寫下來的反對理由。
最後那一句指示,重要程度不亞於努力程度設定本身。推理型模型在資料不足時,會一路推理到一個建立在虛構假設之上的合理答案。要求它先指出缺口,才是把「深思」轉化為「可信」的關鍵。
這也是為什麼努力程度設定與結構化背景資料非常配。如果你想更深入了解如何把背景整理好,可以參考我們關於情境工程的文章。
努力程度控制在什麼情況下會失效?
努力程度控制有四種可預期的失效方式:它會放大錯誤的背景資料、增加破壞互動節奏的延遲、在自動化流程中令成本變得難以預測,以及無法補救一個本來就沒定義清楚的任務。這些都不是缺陷,而是這個取捨本身的形狀。
--- 垃圾進,精緻的垃圾出。把高努力用在資料單薄的簡報上,你會得到一個更長、更自信、內部邏輯更一致的錯誤答案。它比一個簡短的錯誤答案更難被發現,因此更危險。
--- 延遲會打斷節奏。如果你正在對話式地反覆修改,一個要等 40 秒的高努力回應會毀掉節奏。正確做法是低努力打稿,接近定稿時才升檔。
--- 自動化成本會漂移。在一天執行數百次的流程中把努力程度設到高檔,是最快收到意外帳單的方法,因為推理 token 按輸出 token 計費。
--- 它不是事實準確度的解藥。更多推理能改善一致性與結構,但不會讓模型獲得它本來沒有的資訊。如果答案取決於你的內部資料,努力程度並不會幫你把資料取回來。
--- 基準分數不會轉移到你的工作上。某項編程基準由 88.8% 升至 91.9%,完全不代表你的季度計劃會寫得更好。要在自己的任務上測試。
如何在 20 分鐘內用自己的工作測試一次?
挑一個你已經在用 AI 處理的重複任務,用完全相同的輸入跑三次不同努力程度,然後並排比較。20 分鐘足夠讓你知道自己的預設值是否一直設錯。多數人會發現:簡單任務付得太多,重要任務想得太少。
測試步驟如下:
--- 第一步。選一個你至少每週做一次、而且品質好壞你自己判斷得出來的任務。例如活動簡報、供應商比較,或一封必須寫得準確的客戶郵件。
--- 第二步。把輸入寫好一次就凍結。三次用完全相同的字,中間不改,否則比較沒有意義。
--- 第三步。先用最低努力跑一次,再用中等,最後用最高。三份輸出全部保留。
--- 第四步。只用一個標準評分:在你願意送出之前,還需要改多少。
--- 第五步。記下每次花的時間。如果最高努力版本需要修改的幅度與中等版本相同,你就找到了自己的預設值,同時直接壓低了每項任務的成本。
把最常做的三個 AI 任務都做一次,你就會擁有一套屬於自己的分流策略。這比任何通用建議都有價值,因為它是按你的標準校準,而不是按基準分數。
如果你已經在建立可重複的系統而不只是單次提示,同樣的測試紀律也適用於把流程封裝成可重用的 Agent Skill。
核心結論
過去三年,注意力幾乎都放在提示品質上。努力程度是 2026 年 7 月悄悄出現、卻改變了問題形狀的變數:同一個提示、同一個模型,因為一個大多數人從未動過的設定,就會給出兩個不同的答案。
真正的技巧不是「永遠調到最高」,而是知道你的哪些任務值得深思、哪些只需要速度,並且是實測出來而不是猜出來的。這是一個 20 分鐘的實驗,不是一門課程。
懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴。
你可以自行到 Anthropic 官方新聞室核對發布細節;在依賴任何基準數字之前,也請先查看當前的模型卡。
本文由 UD AI 團隊審閱。
看清你的 AI 實力真正在哪一級
知道有努力程度設定是一回事,知道自己哪些日常任務被用錯了深度,又是另一回事。
先做 UD 的 AI IQ 測試,看看你目前實際的 AI 使用水平與缺口在哪裡。
當你準備把技巧變成每次都穩定運行的工作流程,UD 團隊手把手帶你完成每一步,從工具配置、流程設計,到實際部署。