为什么「扮演资深专家」已经不再提升输出质量?
因为这句话没有提供模型原本不知道的任何信息。角色指令只告诉模型要扮演谁,却没有告诉它你的读者知道什么、你要优化什么,以及什么算是错误答案。模型只能用平均值填补空白,而平均值读起来就是平庸。
角色提示(Role Prompting)的定义:在提示开头加入身分指令,例如「你是一位拥有 15 年经验的资深市场策略师」,借此改变模型的语气与专业程度。它属于人设指令,而非情境指令。
这个分别很重要,因为它能预测技术何时有效。当角色真正改变了具体事物,例如所使用的词汇、面向的读者,或是刻意略去的内容,角色就发挥了作用。放射科医生与病人卫教文案作者描述同一张扫描影像的方式截然不同,这时角色是有意义的。
但在分类、资料抽取与事实问答这类只有单一正确答案、没有风格选择余地的任务上,角色几乎毫无作用。告诉模型它是世界级分析师,并不会改变它从表格中抽出哪一个数字。
还有一个机制上的原因。具备推理能力的模型,例如 Claude 的延伸思考模式与 Google Gemini 的推理层级,无论你是否要求,内部都已经在执行思维链。因此「一步一步思考」与「你是出色的推理者」只是重复了早已开启的行为。
2023 年到 2026 年之间,模型改变了什么?
两件事。技巧本身进入了训练资料,而默认模型在这些技巧原本用来弥补的任务上大幅进步。提示技巧只有在稀有时才构成优势,而 2023 年那批开场白现在毫不稀有。
最清楚的近期指标出现在免费层级。OpenAI 于 2026 年 8 月 6 日宣布,GPT-5.6 Luna 成为免费与 Go 用户的默认模型并提供无限文字对话,并指出相较于前一代默认模型 GPT-5.5 Instant,含有至少一项事实错误的回应减少了 62%。
请把这件事读成提示层面的事实,而非产品新闻。当基准模型本身明显更准确,聪明开场白的边际价值便会崩塌,而提供真实情境的边际价值则同步上升。
Anthropic 现时将这门功夫重新定义为情境工程(Context Engineering):在每一次推论呼叫中,刻意筛选模型看得见的内容,而不是寻找一句神奇的咒语。这个重新定义才是真正的转变。你不再问「怎样措辞才能解锁更好的答案」,而是问「一位优秀的人类同事需要知道什么,而模型现在并不知道」。
有一点必须说清楚。人设句子并非禁忌,也不会造成伤害,它们只是回报偏低;而在长提示中,它们占用的上下文窗口空间,本可用于一项具体限制。
真正改变输出的五个情境区块是什么?
2026 年的质量提升,几乎全部来自五个区块:任务、读者、原始素材、格式契约、负面限制。包含全部五项的提示,在几乎所有商业写作与分析任务上都胜过以人设为主的提示,因为每个区块都消除了模型原本必须猜测的一件事。
五个区块,以及各自消除的猜测
--- 任务:用一句话说明要产出什么成品、目的为何。消除「你到底想要什么」的猜测。
--- 读者:谁会读、他们已经知道什么、读完之后要做什么决定。消除阅读水平与叙述框架的猜测。
--- 原始素材:把真实的笔记、逐字稿、数据或草稿贴进去。消除对事实的猜测,也是回报最高的一项。
--- 格式契约:长度、结构,以及输出的确切形状。消除呈现方式的猜测。
--- 负面限制:不能出现什么。消除你早已知道这个模型会犯的错误。
负面限制是最多人略过、却最能稳定修正老毛病的一项。如果模型总是用「在当今瞬息万变的时代」开头,一句「禁止使用这个说法」就能永久终结它,而重复二十次「写得俐落一点」则不会。
顺序的影响比多数人预期更大。把指令放在大段贴上的素材之前而非之后,模型就能一边看著素材一边理解任务,而不必在读完一整面文字之后回头重建你的意图。
取代它的提示长什么样子?
它看起来像一份有标签分区的简短工作简报,而不是一段指令散文。不论写成类似 XML 的标签还是纯大写标题,标签都能帮助模型区分「你的指令」与「你贴上的素材」,而多数混乱输出正是源于两者混淆。
试试这个提示。复制后替换方括号内容,并保留为你的范本。
<task>
撰写一份〔成品,例如:300 字的客户进度更新邮件〕,其任务是〔目的,例如:取得修订时间表的批准,同时不重启范畴争论〕。
</task>
<audience>
〔谁会读,例如:一位非技术背景、当初批准原时间表的市场总监〕。他们已经知道〔已知事项〕。他们不知道〔未知事项〕。读完之后,他们需要〔决定或行动〕。
</audience>
<source>
〔把真实的笔记、逐字稿、数据或前一版草稿贴在这里。不要先自行为模型摘要一遍。〕
</source>
<format>
〔长度〕。〔结构,例如:三个短段落、不用项目符号、主旨行放最前〕。〔语气,用具体方式描述,例如:直接而事实导向,像项目负责人写给同级同事〕。
</format>
<do_not>
不要使用〔禁用词句〕。不要杜撰〔你无法查证的事实〕。不要〔这个模型在这类任务上的已知失误〕。
若 <source> 中有任何缺漏或矛盾之处,请在文末以「假设」一节列出,而不是自行猜测。
</do_not>
最后那一句默默做了最重的工作。它把无声的幻觉转换成一张你十秒内就能核对的清单,而这正是「可以直接发出去的草稿」与「必须逐句重新查证的草稿」之间的分别。
如何把它套用在真实工作上?
挑一件你每周重复的任务,用真实内容把范本填一次,之后重复使用。真正的收获不是某一次输出变好,而是同一份简报每周产出水准相当的结果,这才是「稳定」在实务上的意思。
以一个常见情境为例:把 45 分钟的客户通话整理成跟进邮件。人设版本会说「你是一位资深客户经理,写一封跟进邮件」,结果通常客气、冗长,而且把死线写错。
情境版本则明确指出成品是一封 250 字邮件,目的是确认三项决定;读者是缺席上次会议的客户营运主管;贴上原始逐字稿;格式固定为三段加一份行动清单;并禁止杜撰逐字稿中没有出现的日期。
第二份提示第一次写起来比较久,之后每一次都更快,因为只有贴上的素材会变。这就是这项技术要求你做的取舍。
当范本稳定下来之后,就不要再重复打字。把固定简报存成可重复使用的文件,正是 Agent Skills 格式的设计目的,具体做法可参考我们的SKILL.md 撰写指南。
什么情况下角色指令仍然值得保留?
当角色改变词汇、读者或省略内容时保留它;当任务只有一个正确答案时删掉它。这一条测试几乎能决定所有提示的取舍,而且远比「一律用人设」或「人设已死」更实用。
这些情况保留角色
--- 为不同读者改写同一段说明。「向财务总监解释这件事」与「向新入职同事解释这件事」确实会产生不同而且都正确的答案。
--- 创意草拟中的声音与人物塑造,此时人设本身就是目的,而非效能加成。
--- 对抗式审阅,例如「以在场最挑剔的人的角度读这份文件」,这会改变它挑出什么问题。
这些情况删掉角色
--- 抽取、分类与标记,输出由素材决定。
--- 事实问答。自信的人设只会让错误答案听起来更权威,而不是更正确。
--- 任何已经很长的提示。人设正在与你真正的素材争夺上下文窗口空间。
有一项限制必须诚实说明。以上是目前主流模型普遍成立的规律,而非经第三方审核的基准测试结果,而且模型行为会随每次版本更新改变。请把它当作方向性判断,并在你自己的重复任务上验证,而不是全盘相信任何一篇提示技巧文章,包括这一篇。
如何用十分钟在自己的工作上验证?
挑一件你已经知道正确答案的任务,做两个版本的对照测试。十分钟足够,而选择有既定良好答案的任务,才能让结果可判读,而不是流于个人口味之争。
十分钟测试
--- 第 1 至 2 分钟。找出你上周亲手完成、而且自己满意的一份成品,作为基准。
--- 第 3 至 4 分钟。写人设版本:「你是一位资深的〔角色〕。请撰写〔成品〕。」执行后保存输出。
--- 第 5 至 8 分钟。用同样的底层素材,填写上面的五区块范本,在同一个模型的全新对话中执行。
--- 第 9 至 10 分钟。只用三个问题对照基准评分:有多少事实是错的、你会删掉多少句子、各自要花多久修好。
在下结论之前,请在第二个模型上重做同一次测试。只在一个模型出现、换个模型就消失的差异,属于模型脾性,而不是提示原则。
留下胜出的那份提示,删掉另一份。这个练习的重点不是证明某篇文章正确,而是终结「为何输出时好时坏」的猜测,那才是真正的问题。
明天早上你应该改动什么?
把你最常用的三个提示中的人设句子删掉,换成一个素材区块与一项负面限制。这一项改动就同时处理了输出不稳定的两大成因:缺失的事实,以及重复发生的失误模式。
这个重新定义幅度不大,却改变了工作性质。你不再猎捕那句能解锁模型的咒语,而是在组装一位能干同事所需要的情境。没有任何措辞能替代你根本没有提供的素材。
这也是提示技巧在过去三年被视为玄学的诚实原因。它从来不神秘,它只是说明不足;而修正方法并不华丽,却可以重复执行。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
本文由 UD AI 团队审阅。
看清楚你的 AI 功力实际落在哪一级
每天使用 AI 的人,大多从未衡量过自己究竟用到多少。UD 的 AI IQ 测试会在几分钟内给你一个分数,并以白话指出你的缺口所在,完全免费。如果你想把它变成一套真正运作的系统,UD 团队会手把手带你完成每一步,从提示范本到每周稳定运行的工作流程。