什么是 AI 规格书?为何提示技巧不再管用?
AI 规格书是一份你交给模型的书面工作演示文稿,而非一句聪明的提示语。它明确写出目标、读者对象、输出格式、评分标准,以及模型不确定时应该怎样处理。它是一份职位说明书,不是一句咒语。
它比技巧有效的原因并不浪漫:现时的推理模型在内部已经自动完成旧技巧试图从外部强加的工作。
沃顿商学院生成式 AI 实验室一直在直接测试这件事。他们的《Prompting Science Report 1》发现,流行的提示格式技巧所带来的提升,一旦把整份题库的结果汇总计算,就会消失。在个别题目上效果是真实的,放大到规模层面就只是杂讯。
该系列的共同作者 Ethan Mollick 在 2026 年 7 月讲得更直接:提示技巧已经不再有太大价值,现在真正重要的技能,是清楚界定目标、输出、评分标准与测试方法。那是管理工作,不是文本雕琢。
专家角色设置和「一步一步思考」真的有效吗?
在现时的模型上,基本上没有效。沃顿的《Prompting Science Report 4》以 GPQA Diamond 及 MMLU-Pro 测试六个模型,把专家角色设置与「不设角色」对照,结果找不到一致的准确度提升。错配的角色设置有时甚至令表现变差。至于低知识水平的角色,例如要求模型以小朋友的身份回答,则稳定地降低准确度。
「一步一步思考」的情况也类似。在内置推理能力的模型上,它增加了延迟,却没有带来相应的质量提升,因为模型本来就会推理。
角色设置过去偷偷做的事,其实是替你补上语境。「你是一位资深 B2B 文案」隐含了读者对象、语气、篇幅和一套行文惯例。当你把这些直接写出来,你就拿到了同样的好处,而不需要依赖模型自己猜。
所以实际做法不是删掉「你是行销专家」然后祈祷,而是用那句话原本代表的四五项具体条件去取代它。
一份可用的 AI 规格书包含哪五个部分?
可用的规格书有五个部分:要完成的任务、读者与语境、输出契约、评分标准,以及不确定处理规则。缺少任何一项,模型都会用一个平均值的猜测去补位,而这正是输出品质不稳定的来源。
一、任务
--- 用一句话写出成果,而非活动本身。「产出一篇 300 字的 LinkedIn 贴文,令人力资源经理愿意下载薪酬基准报告」比「写一篇关于报告的 LinkedIn 贴文」有用得多。
二、读者与语境
--- 谁会读、他们已经知道什么、他们对什么抱怀疑,以及有哪些事实是模型不可以自行虚构的。这一栏就是你粘贴真实素材的位置,而不是信任模型的记忆。
三、输出契约
--- 篇幅、结构、格式,以及不准出现的东西。禁止事项与要求同样重要:不要点列、不要设问句、不要破折号、不要结尾总结段。
四、评分标准
--- 一份好答案必须通过的三至五项测试。这是几乎所有人都会略过的部分,而它正是令输出稳定的关键。把你评改新同事初稿时会用的标准写出来即可。
五、不确定处理规则
--- 模型不知道时该怎么办。「如果某个数字不在我粘贴的素材里,请写上[需要来源],不要估算」这一句,把幻觉风险转换成一个看得见的待办事项。
一份完整的 AI 规格书实际是什么样子?
以下是一份完整的规格书,你可以直接贴进 ChatGPT、Claude 或 Gemini,大约两分钟就能改成自己的版本。它刻意写得平淡。规格书有效,是因为它枯燥而完整,不是因为它聪明。
立即试用这份规格书:
任务
产出[一篇 900 字文章],目的是[令香港的运营经理愿意预约一次流程查看]。成功的定义是[读者会把它转发给自己的上司]。
读者
读者是[香港 20 至 200 人公司的运营经理]。他们已经知道[什么是流程自动化]。他们怀疑[供应商声称十倍节省的说法]。他们不知道[如何界定第一个项目的范围]。
输出契约
--- 篇幅:850 至 950 字
--- 结构:5 个章节,每节标题都是一个问句
--- 每节开首先用两句直接回答该问题
--- 格式:纯段落,每段最多 3 行
--- 不准使用:点列、破折号、设问句,以及「赋能」、「解锁」、「格局」这些字词
--- 不要以总结段作结
评分标准
一份合格初稿必须全部通过:
--- 每项论述都附有数字、具名来源或具体情境
--- 读者今天就可以按第 3 节行动,不需要再问我问题
--- 没有任何一句,在客户引用回来时会令我尴尬
--- 删掉任何一段都会失去真实信息
不确定处理规则
如果某个统计数字、价格或日期不在下方素材中,请写上[需要来源]而不要估算。不要从相邻事实推论数字。
流程
开始写之前,先列出 5 个章节标题并等我确认。我确认后再写初稿,然后按评分标准自行评分,并告诉我哪一项最弱。
素材
[在此粘贴你的笔记、会议记录、数据或现有文案]
最后两栏是大多数人漏掉的。流程那一栏把一次长篇猜测拆成两个短检查点。自行评分那一句则出奇地有效,因为模型必须用你的标准重读自己的初稿,而不是用它自己的标准。
如何把一份规格书重用一整个月?
把规格书存成文件,不要存成对话消息。读者、输出契约与评分标准三栏在同类型输出中完全不变,每次只需要换任务句和素材,于是一段 15 分钟的提示语拉锯,变成 90 秒的粘贴动作。
然后把不变的部分放在模型会自动读取的位置。ChatGPT Projects、Claude Projects 和 Gemini Gems 都支持附加在工作区的长期指令。把读者、输出契约和评分标准贴进去一次,该工作区内每一段新对话都会预先加载。
版本管理的习惯比工具更重要。当初稿出错,不要去改初稿,而是把缺少的规则补进规格书文件,然后重新运行。大约六轮之后,规格书就不再带来意外,而且这个改善是永久的,不会困在单一段对话里。
这样做同时令你的指令远离对话中会退化的部分。长对话会逐渐失去对最早指令的忠诚度,这种失效模式在这篇关于 context rot 的分析中有详细说明。把规格书放在项目指令中,或在新对话开首重新贴一次,就能直接绕过这个问题。
AI 规格书会在哪些情况失效?
规格书有四种可预测的失效方式:写得太长、标准互相矛盾、过度限制创意工作,以及被当成一次写完就不再修改的文档。四者都可以修正,而预先知道它们,可以省下一星期的困惑。
过长
--- 指令一旦超过大约 600 字,模型对你各项规则的权重就会变得不均。如果你的规格书正在膨胀超过这个长度,你很可能是在同一份文档里界定两种不同输出,应该拆成两份。
标准互相矛盾
--- 「要全面」加上「最多 400 字」是一组冲突,模型会静静地二选一。把你的标准当成一整套来读,然后删掉那条在真实截稿压力下你会牺牲的规则。
过度限制创意工作
--- 规格书非常适合重复产出,对构思阶段却有实际伤害。当你想要二十个古怪角度,一份严密的输出契约只会给你同一个安全角度的二十种变体。发散阶段用宽松演示文稿,直到落笔撰稿才切换成规格书。
当成已完成的文档
--- 一份写完就不再修订的规格书,会随着你的产品、读者以至模型本身改变而过时。尤其推理深度在多个模型上现时已可调整,这改变了规格书需要就「思考力度」交代什么。UD 早前关于自适应思考的一篇文章,说明了这个旋钮如何与指令遵循互相影响。
如何在二十分钟内测试这套做法?
挑选你最常产出的那一种内容,然后把同一项任务跑两次:一次用你平时的提示语,一次用上面的五部分规格书。用你自己的评分标准去比较两份初稿,而不是靠感觉。差距通常在第一次尝试就已经明显。
通常会出现两件事。规格书版本的初稿需要修改的地方更少,这正是重点。而写评分标准这个动作,会迫使你把一直隐隐带在身上的标准说清楚,副作用是你给人类同事的演示文稿也会变好。
这就是提示工程演变的老实总结。巧妙措辞的年代已经过去,取代它的,是在开口要求之前先清楚说明「好」的样子这种平凡纪律。它没那么有趣,却可靠得多。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
本文由 UD AI 团队审阅。
看清你的 AI 技能实际站在哪一级
写规格书是 AI 技能的其中一级。上面还有好几级,而大部分人都分不清自己站在哪里。
UD 免费的 AI IQ 测试用 15 条题目评估你的实战知识,并指出下一步最值得补上的具体缺口。UD 团队手把手带你完成每一步,由解读测试结果,到创建补强最弱一环的工作流程。