大多数天天使用 Claude 或 ChatGPT 的人,其实不知道现在有一个「旋钮」,可以直接控制模型在回答之前愿意思考多久。这不是提示技巧,而是一个设置。
Anthropic 在 2026 年 7 月 24 日随 Claude Opus 5 推出了「effort(努力程度)」控制;OpenAI 则在 7 月 9 日随 GPT-5.6 推出 max reasoning 设置与 ultra 模式。两间最大的实验室在两星期之内推出同一类控制,这件事本身就说明了杠杆在哪里。
如果你一直靠改写提示来解决「输出质量不稳定」的问题,这就是你漏掉的那个变量。
什么是 AI 模型的努力程度设置?
努力程度设置是一个控制项,用来告诉模型在回答之前要投入多少推理。设得高,模型内部推敲更多,困难任务的准确度更高,但消耗更多 token、回应更慢;设得低,答案更快、更便宜,但也更浅。它是一个成本与质量之间的旋钮,不是开关。
关键在于:努力程度与模型选择是两件事。你不再只是决定「用哪个模型」,而是同时决定「这个模型可以思考多深」。
这个区别很重要,因为大部分令人失望的 AI 输出并不是模型能力不足,而是错配:一个需要深思的任务,被用聊天的速度回答了。
Anthropic 对 Opus 5 的 effort 设置描述是:一端可以最大化智能表现,另一端则节省 token 以换取更快、更便宜的结果。OpenAI 的版本则以推理深度为核心,最高等级甚至可以把任务拆开,让多个并行的子代理互相协调完成。
2026 年 7 月 Anthropic 与 OpenAI 究竟推出了什么?
两家公司都把推理控制绑在新的旗舰模型上。Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,内建 effort 设置;OpenAI 于 7 月 9 日发布 GPT-5.6,一次推出三个级别,并附带 max reasoning 设置与 ultra 模式。因为这些控制项太新,市面上绝大多数提示教学都写在它们出现之前。
以下是依照两家官方公布值得记住的细节:
--- Claude Opus 5(Anthropic,2026 年 7 月 24 日):每百万输入 token 收费 5 美元,每百万输出 token 收费 25 美元;1M token 上下文窗口,最高输出 128K。首次引入 effort 设置。Anthropic 表示,它在 CursorBench 3.2 上与 Claude Fable 5 的最佳成绩差距在 0.5% 以内,而每项任务成本约为一半。
--- GPT-5.6(OpenAI,2026 年 7 月 9 日):不再只有单一模型,而是三个级别。Sol 为每百万 token 输入 5 美元、输出 30 美元;Terra 为 2.5 美元/15 美元;Luna 为 1 美元/6 美元。
--- Ultra 模式:在 Sol 级别上,模型可以把任务拆解并运行并行子代理。OpenAI 表示,这让它在一项命令行编程基准上的分数由 88.8% 提升至 91.9%。
--- 你在哪里会遇到它:在 API 中需要你自己明确设置;在消费版应用中则部分由系统代你决定,这也解释了为什么同一个问题在不同日子会得到深浅明显不同的答案。
请把这些数字视为特定版本的资料。模型系列经常重新分级与调价,某一版的基准分数不会自动延续到下一版。
什么时候应该把努力程度调高,什么时候不需要?
当任务存在「答错会有代价」的可能时,就把努力程度调高:分析、规划,以及任何条件之间互相牵制的任务。当任务没有隐藏陷阱时就维持低档:排版、摘要、改写、分类。把简单任务调到最高,不会让输出变好,只会更贵更慢。
以下是一套实际可用的分流规则:
--- 低努力/便宜级别:重新排版、调整语气、从文件抽取字段、为收到的信息分类、产出几个你反正会亲手改的文案版本。
--- 中等努力/平衡级别:真实交付物的初稿、范围明确的资料整理、把会议记录整理成结构化简报。
--- 高努力/旗舰级别:定价与预算模型、渠道之间互相取舍的活动规划、需要你向别人辩护的供应商比较,以及任何要呈给上级的内容。
--- Ultra 或并行子代理模式:涉及工具调用与重试的多步骤工作。用来回答单一问题是过度配置,而且你会明显感受到延迟。
反直觉的一点是:高努力带来的最大收益,通常不是来自最困难的任务,而是来自「中等难度但语意模糊」的任务。一份有三种合理解读方式的简报,正是深思最有价值的地方;而一个真正困难但条件写得清楚的任务,中等努力往往已经处理得不错。
成本上也有后果。努力程度越高,推理 token 越多,而推理 token 是按输出计费。以上述价格计算,在 GPT-5.6 Sol 上以每百万输出 token 30 美元的价格跑高努力任务,并不适合放在整个收件箱上自动运行。
怎样写出真正受益于高努力的提示?
高努力设置奖励那些「有东西可以推敲」的提示:互相竞争的选项、明确的限制条件,以及一个具名的失败条件。如果你的提示只是要一段文字,额外的推理无处可用。若答案只有一个明显选项,深思也无从发挥。
有效的模式是:先迫使模型比较,再迫使它淘汰。给它几个选项与淘汰的理由,额外的思考就会花在判断上,而不是堆字数。
立即试用这个提示:
你现在是在复核一个决定,不是回答一个问题。
任务:[贴上你真正需要做的决定]
背景:[贴上限制条件、预算、期限,以及已经被排除的选项]
在回答之前,请在内部完成以下步骤:
1. 列出三个最合理的方案。
2. 为每一个方案写出最强的反对理由。
3. 淘汰任何无法回应自身反对理由的方案。
然后只输出:
--- 你的建议,一句话。
--- 这个建议依赖的两个假设。
--- 什么证据会让你改变主意。
不要展示中间推理过程。如果背景资料缺少你需要的东西,请直接指出缺什么,不要猜。
把这个提示在同一个任务上跑两次,一次低努力、一次高努力。低努力版本通常会给你最常见的选项,加上很有自信的包装;高努力版本则更常会指出一个你自己还没写下来的反对理由。
最后那一句指示,重要程度不亚于努力程度设置本身。推理型模型在资料不足时,会一路推理到一个建立在虚构假设之上的合理答案。要求它先指出缺口,才是把「深思」转化为「可信」的关键。
这也是为什么努力程度设置与结构化背景资料非常配。如果你想更深入了解如何把背景整理好,可以参考我们关于情境工程的文章。
努力程度控制在什么情况下会失效?
努力程度控制有四种可预期的失效方式:它会放大错误的背景资料、增加破坏互动节奏的延迟、在自动化流程中令成本变得难以预测,以及无法补救一个本来就没定义清楚的任务。这些都不是缺陷,而是这个取舍本身的形状。
--- 垃圾进,精致的垃圾出。把高努力用在资料单薄的简报上,你会得到一个更长、更自信、内部逻辑更一致的错误答案。它比一个简短的错误答案更难被发现,因此更危险。
--- 延迟会打断节奏。如果你正在对话式地反复修改,一个要等 40 秒的高努力回应会毁掉节奏。正确做法是低努力打稿,接近定稿时才升档。
--- 自动化成本会漂移。在一天执行数百次的流程中把努力程度设到高档,是最快收到意外账单的方法,因为推理 token 按输出 token 计费。
--- 它不是事实准确度的解药。更多推理能改善一致性与结构,但不会让模型获得它本来没有的信息。如果答案取决于你的内部数据,努力程度并不会帮你把数据取回来。
--- 基准分数不会转移到你的工作上。某项编程基准由 88.8% 升至 91.9%,完全不代表你的季度计划会写得更好。要在自己的任务上测试。
如何在 20 分钟内用自己的工作测试一次?
挑一个你已经在用 AI 处理的重复任务,用完全相同的输入跑三次不同努力程度,然后并排比较。20 分钟足够让你知道自己的默认值是否一直设错。多数人会发现:简单任务付得太多,重要任务想得太少。
测试步骤如下:
--- 第一步。选一个你至少每周做一次、而且质量好坏你自己判断得出来的任务。例如活动简报、供应商比较,或一封必须写得准确的客户邮件。
--- 第二步。把输入写好一次就冻结。三次用完全相同的字,中间不改,否则比较没有意义。
--- 第三步。先用最低努力跑一次,再用中等,最后用最高。三份输出全部保留。
--- 第四步。只用一个标准评分:在你愿意送出之前,还需要改多少。
--- 第五步。记下每次花的时间。如果最高努力版本需要修改的幅度与中等版本相同,你就找到了自己的默认值,同时直接压低了每项任务的成本。
把最常做的三个 AI 任务都做一次,你就会拥有一套属于自己的分流策略。这比任何通用建议都有价值,因为它是按你的标准校准,而不是按基准分数。
如果你已经在建立可重复的系统而不只是单次提示,同样的测试纪律也适用于把流程封装成可重用的 Agent Skill。
核心结论
过去三年,注意力几乎都放在提示质量上。努力程度是 2026 年 7 月悄悄出现、却改变了问题形状的变量:同一个提示、同一个模型,因为一个大多数人从未动过的设置,就会给出两个不同的答案。
真正的技巧不是「永远调到最高」,而是知道你的哪些任务值得深思、哪些只需要速度,并且是实测出来而不是猜出来的。这是一个 20 分钟的实验,不是一门课程。
懂AI的冷,更懂你的难 UD 同行28年,让科技成为有温度的陪伴。
你可以自行到 Anthropic 官方新闻室核对发布细节;在依赖任何基准数字之前,也请先查看当前的模型卡。
本文由 UD AI 团队审阅。
看清你的 AI 实力真正在哪一级
知道有努力程度设置是一回事,知道自己哪些日常任务被用错了深度,又是另一回事。
先做 UD 的 AI IQ 测试,看看你目前实际的 AI 使用水平与缺口在哪里。
当你准备把技巧变成每次都稳定运行的工作流程,UD 团队手把手带你完成每一步,从工具配置、流程设计,到实际部署。