為什麼「扮演資深專家」已經不再提升輸出品質?
因為這句話沒有提供模型原本不知道的任何資訊。角色指令只告訴模型要扮演誰,卻沒有告訴它你的讀者知道什麼、你要優化什麼,以及什麼算是錯誤答案。模型只能用平均值填補空白,而平均值讀起來就是平庸。
角色提示(Role Prompting)的定義:在提示開頭加入身分指令,例如「你是一位擁有 15 年經驗的資深市場策略師」,藉此改變模型的語氣與專業程度。它屬於人設指令,而非情境指令。
這個分別很重要,因為它能預測技術何時有效。當角色真正改變了具體事物,例如所使用的詞彙、面向的讀者,或是刻意略去的內容,角色就發揮了作用。放射科醫生與病人衛教文案作者描述同一張掃描影像的方式截然不同,這時角色是有意義的。
但在分類、資料抽取與事實問答這類只有單一正確答案、沒有風格選擇餘地的任務上,角色幾乎毫無作用。告訴模型它是世界級分析師,並不會改變它從表格中抽出哪一個數字。
還有一個機制上的原因。具備推理能力的模型,例如 Claude 的延伸思考模式與 Google Gemini 的推理層級,無論你是否要求,內部都已經在執行思維鏈。因此「一步一步思考」與「你是出色的推理者」只是重複了早已開啟的行為。
2023 年到 2026 年之間,模型改變了什麼?
兩件事。技巧本身進入了訓練資料,而預設模型在這些技巧原本用來彌補的任務上大幅進步。提示技巧只有在稀有時才構成優勢,而 2023 年那批開場白現在毫不稀有。
最清楚的近期指標出現在免費層級。OpenAI 於 2026 年 8 月 6 日宣布,GPT-5.6 Luna 成為免費與 Go 用戶的預設模型並提供無限文字對話,並指出相較於前一代預設模型 GPT-5.5 Instant,含有至少一項事實錯誤的回應減少了 62%。
請把這件事讀成提示層面的事實,而非產品新聞。當基準模型本身明顯更準確,聰明開場白的邊際價值便會崩塌,而提供真實情境的邊際價值則同步上升。
Anthropic 現時將這門功夫重新定義為情境工程(Context Engineering):在每一次推論呼叫中,刻意篩選模型看得見的內容,而不是尋找一句神奇的咒語。這個重新定義才是真正的轉變。你不再問「怎樣措辭才能解鎖更好的答案」,而是問「一位優秀的人類同事需要知道什麼,而模型現在並不知道」。
有一點必須說清楚。人設句子並非禁忌,也不會造成傷害,它們只是回報偏低;而在長提示中,它們佔用的上下文視窗空間,本可用於一項具體限制。
真正改變輸出的五個情境區塊是什麼?
2026 年的品質提升,幾乎全部來自五個區塊:任務、讀者、原始素材、格式契約、負面限制。包含全部五項的提示,在幾乎所有商業寫作與分析任務上都勝過以人設為主的提示,因為每個區塊都消除了模型原本必須猜測的一件事。
五個區塊,以及各自消除的猜測
--- 任務:用一句話說明要產出什麼成品、目的為何。消除「你到底想要什麼」的猜測。
--- 讀者:誰會讀、他們已經知道什麼、讀完之後要做什麼決定。消除閱讀水平與敘述框架的猜測。
--- 原始素材:把真實的筆記、逐字稿、數據或草稿貼進去。消除對事實的猜測,也是回報最高的一項。
--- 格式契約:長度、結構,以及輸出的確切形狀。消除呈現方式的猜測。
--- 負面限制:不能出現什麼。消除你早已知道這個模型會犯的錯誤。
負面限制是最多人略過、卻最能穩定修正老毛病的一項。如果模型總是用「在當今瞬息萬變的時代」開頭,一句「禁止使用這個說法」就能永久終結它,而重複二十次「寫得俐落一點」則不會。
順序的影響比多數人預期更大。把指令放在大段貼上的素材之前而非之後,模型就能一邊看著素材一邊理解任務,而不必在讀完一整面文字之後回頭重建你的意圖。
取代它的提示長什麼樣子?
它看起來像一份有標籤分區的簡短工作簡報,而不是一段指令散文。不論寫成類似 XML 的標籤還是純大寫標題,標籤都能幫助模型區分「你的指令」與「你貼上的素材」,而多數混亂輸出正是源於兩者混淆。
試試這個提示。複製後替換方括號內容,並保留為你的範本。
<task>
撰寫一份〔成品,例如:300 字的客戶進度更新電郵〕,其任務是〔目的,例如:取得修訂時間表的批准,同時不重啟範疇爭論〕。
</task>
<audience>
〔誰會讀,例如:一位非技術背景、當初批准原時間表的市場總監〕。他們已經知道〔已知事項〕。他們不知道〔未知事項〕。讀完之後,他們需要〔決定或行動〕。
</audience>
<source>
〔把真實的筆記、逐字稿、數據或前一版草稿貼在這裡。不要先自行為模型摘要一遍。〕
</source>
<format>
〔長度〕。〔結構,例如:三個短段落、不用項目符號、主旨行放最前〕。〔語氣,用具體方式描述,例如:直接而事實導向,像專案負責人寫給同級同事〕。
</format>
<do_not>
不要使用〔禁用詞句〕。不要杜撰〔你無法查證的事實〕。不要〔這個模型在這類任務上的已知失誤〕。
若 <source> 中有任何缺漏或矛盾之處,請在文末以「假設」一節列出,而不是自行猜測。
</do_not>
最後那一句默默做了最重的工作。它把無聲的幻覺轉換成一張你十秒內就能核對的清單,而這正是「可以直接發出去的草稿」與「必須逐句重新查證的草稿」之間的分別。
如何把它套用在真實工作上?
挑一件你每週重複的任務,用真實內容把範本填一次,之後重複使用。真正的收穫不是某一次輸出變好,而是同一份簡報每週產出水準相當的結果,這才是「穩定」在實務上的意思。
以一個常見情境為例:把 45 分鐘的客戶通話整理成跟進電郵。人設版本會說「你是一位資深客戶經理,寫一封跟進電郵」,結果通常客氣、冗長,而且把死線寫錯。
情境版本則明確指出成品是一封 250 字電郵,目的是確認三項決定;讀者是缺席上次會議的客戶營運主管;貼上原始逐字稿;格式固定為三段加一份行動清單;並禁止杜撰逐字稿中沒有出現的日期。
第二份提示第一次寫起來比較久,之後每一次都更快,因為只有貼上的素材會變。這就是這項技術要求你做的取捨。
當範本穩定下來之後,就不要再重複打字。把固定簡報存成可重複使用的檔案,正是 Agent Skills 格式的設計目的,具體做法可參考我們的SKILL.md 撰寫指南。
什麼情況下角色指令仍然值得保留?
當角色改變詞彙、讀者或省略內容時保留它;當任務只有一個正確答案時刪掉它。這一條測試幾乎能決定所有提示的取捨,而且遠比「一律用人設」或「人設已死」更實用。
這些情況保留角色
--- 為不同讀者改寫同一段說明。「向財務總監解釋這件事」與「向新入職同事解釋這件事」確實會產生不同而且都正確的答案。
--- 創意草擬中的聲音與人物塑造,此時人設本身就是目的,而非效能加成。
--- 對抗式審閱,例如「以在場最挑剔的人的角度讀這份文件」,這會改變它挑出什麼問題。
這些情況刪掉角色
--- 抽取、分類與標記,輸出由素材決定。
--- 事實問答。自信的人設只會讓錯誤答案聽起來更權威,而不是更正確。
--- 任何已經很長的提示。人設正在與你真正的素材爭奪上下文視窗空間。
有一項限制必須誠實說明。以上是目前主流模型普遍成立的規律,而非經第三方審核的基準測試結果,而且模型行為會隨每次版本更新改變。請把它當作方向性判斷,並在你自己的重複任務上驗證,而不是全盤相信任何一篇提示技巧文章,包括這一篇。
如何用十分鐘在自己的工作上驗證?
挑一件你已經知道正確答案的任務,做兩個版本的對照測試。十分鐘足夠,而選擇有既定良好答案的任務,才能讓結果可判讀,而不是流於個人口味之爭。
十分鐘測試
--- 第 1 至 2 分鐘。找出你上週親手完成、而且自己滿意的一份成品,作為基準。
--- 第 3 至 4 分鐘。寫人設版本:「你是一位資深的〔角色〕。請撰寫〔成品〕。」執行後保存輸出。
--- 第 5 至 8 分鐘。用同樣的底層素材,填寫上面的五區塊範本,在同一個模型的全新對話中執行。
--- 第 9 至 10 分鐘。只用三個問題對照基準評分:有多少事實是錯的、你會刪掉多少句子、各自要花多久修好。
在下結論之前,請在第二個模型上重做同一次測試。只在一個模型出現、換個模型就消失的差異,屬於模型脾性,而不是提示原則。
留下勝出的那份提示,刪掉另一份。這個練習的重點不是證明某篇文章正確,而是終結「為何輸出時好時壞」的猜測,那才是真正的問題。
明天早上你應該改動什麼?
把你最常用的三個提示中的人設句子刪掉,換成一個素材區塊與一項負面限制。這一項改動就同時處理了輸出不穩定的兩大成因:缺失的事實,以及重複發生的失誤模式。
這個重新定義幅度不大,卻改變了工作性質。你不再獵捕那句能解鎖模型的咒語,而是在組裝一位能幹同事所需要的情境。沒有任何措辭能替代你根本沒有提供的素材。
這也是提示技巧在過去三年被視為玄學的誠實原因。它從來不神秘,它只是說明不足;而修正方法並不華麗,卻可以重複執行。
懂AI的冷,更懂你的難 UD 同行28年,讓科技成為有溫度的陪伴。
本文由 UD AI 團隊審閱。
看清楚你的 AI 功力實際落在哪一級
每天使用 AI 的人,大多從未量度過自己究竟用到多少。UD 的 AI IQ 測試會在幾分鐘內給你一個分數,並以白話指出你的缺口所在,完全免費。如果你想把它變成一套真正運作的系統,UD 團隊會手把手帶你完成每一步,從提示範本到每週穩定運行的工作流程。