很多人习惯固定用一个 Claude 模型处理所有工作。10 月 7 日上线的 Claude Haiku 5.5 让这个习惯变得不划算:短提示的 API 价格降到 Haiku 4.5 的十分之一,免费版也能选用,而且足够胜任那些占满你一天的琐碎任务。
问题是,哪些任务该交给它?这篇文章给你一套三问判断法、一份让小模型稳定输出的提示词模板,以及“大模型拆任务、小模型干重复活”的分工流程。
Claude Haiku 5.5 是什么?
Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日发布的 Claude 5.5 系列中最小、最快的模型,面向大批量、范围明确的任务,比如摘要、分类和数据提取。它也是第一款支持调节“思考力度”(effort)的 Haiku,可以按任务在成本和能力之间权衡。
根据 Anthropic 官方发布页,Free、Pro、Max、Team 和 Enterprise 用户都能在 Claude.ai 网页端、iOS 和 Android 上选择 Haiku 5.5。API 定价如下:
--- 提示在 10 万 token 以内:输入每百万 token 0.10 美元,输出 0.50 美元。
--- 超过 10 万 token:输入 0.50 美元,输出 2.50 美元。
--- 对比 Haiku 4.5:输入 1 美元,输出 5 美元。
Anthropic 估算,即使新分词器每个任务会多用一点 token,实际成本仍比 Haiku 4.5 低约 75%。
哪些任务适合交给 Haiku 5.5?
适合 Haiku 5.5 的任务有三个特点:单一、好核对、高频重复。给两百条问卷回复打标签很合适;写季度战略备忘录就不合适。Anthropic 自己也建议,复杂任务继续交给 Sonnet 5.5 或 Opus 5.5。
切换模型前,先问三个问题:
--- 是不是只有一件事?“把这封邮件分成投诉、咨询或表扬”是一件事;“看完这些邮件,告诉我客服团队怎么改进”其实是五件事。
--- 结果能不能几秒钟核对完?标签、从文档里提取的数字、三行摘要都能抽查;一篇说服性文章不行。
--- 会不会重复十次以上?省钱和提速只有在批量处理时才有意义。
三个“是”就用 Haiku,有一个“否”就先用 Sonnet。官方页面上的客户案例也是这个思路:金融 AI 公司 Rogo 让大模型做演示文稿,同时让 Haiku 5.5 子代理去年报里取一个分部收入数字。
怎样写出小模型能稳定执行的提示词?
想让小模型稳定执行,提示词要替它省掉所有不必要的判断:只给一个任务、固定输出格式、写清楚拿不准时怎么办,再附一个示例。这份“Haiku 专用任务单”能把模糊的请求变成快模型可以连续执行两百次都不跑偏的指令。
四个部分:
--- 任务:一句话、一个动词,比如分类、提取、总结、改写。
--- 格式:答案的确切样子,最好每条一行。
--- 拿不准时:写明用什么代替猜测。光这一句就能挡住大部分“自信的错误”。
--- 示例:一个输入和对应的正确输出。
试试这条提示词(先在模型菜单里选 Haiku 5.5):
任务:把下面每条客户消息归入一个类别:投诉、咨询、表扬或其他。
格式:每条消息一行,形式为:
[消息编号] | [类别] | [消息中决定分类的三到八个字]
列表前后不要加任何文字。
拿不准时:如果一条消息同时像两类,或哪一类都不明确,请归入“其他”,并引用让你犹豫的原文,不要猜。
示例:
消息:“快递又晚了两天,这个月第二次了。”
输出:1 | 投诉 | 又晚了两天
消息:
[在这里粘贴编好号的消息]
引用原文这一列很关键。你一分钟就能核对二十行,因为每个标签的依据都摆在眼前。
怎样在 Sonnet 和 Haiku 之间分工?
分工原则是大模型做规划,小模型做执行。先让 Sonnet 5.5 或 Opus 5.5 把工作拆成小而独立的步骤,每一步写成 Haiku 专用任务单;再交给 Haiku 5.5 分批处理,最后把结果交回大模型做总结判断。
举个例子:你有来自三个渠道的六十条客户反馈,周一要交一页总结。第一步让 Sonnet 设计分类并写好任务单;第二步让 Haiku 每批处理二十条;第三步把结果贴回 Sonnet,让它提炼三大问题和一条建议。
规划提示词(在 Sonnet 5.5 或 Opus 5.5 上运行):
我需要处理[描述材料,比如六十条客户反馈],最终产出[比如给领导的一页总结]。
请把工作拆成更便宜的快速模型可以逐条处理的最小重复步骤。每一步写成可以直接使用的任务单,包含四个标明的部分:任务(一个动词)、格式(确切输出形式,尽量每条一行)、拿不准时(用什么代替猜测)、示例(一个输入和正确输出)。
最后告诉我,哪部分工作应该留给你这个大模型来做,以及原因。
Claude Haiku 5.5 有哪些短板?
Haiku 5.5 不擅长长链条的多步推理;提示超过 10 万 token 后价格涨到五倍;如果便宜的答案要重来三次,反而更费钱。另外,宣传里的基准成绩由 Anthropic 自己公布,部分是在最高思考力度下测得的,而默认是中等力度。把它当成快速专才,而不是 Sonnet 的替代品。
--- 思考力度会影响结果:据 VentureBeat 分析,Haiku 5.5 在 Terminal-Bench 4.0 上的 39% 是最高力度成绩,默认中等力度约为 20%。
--- 长提示更贵:超过 10 万 token 后,输入价从 0.10 美元涨到 0.50 美元,长报告最好先拆分。
--- 厂商成绩不等于你的工作:官方数据显示 Haiku 5.5 在 OSWorld 2.1 上为 72.4%,Sonnet 5.5 为 83.9%,一定要用自己的真实文件测试。
--- 记录重试次数:第一周记下 Haiku 需要返工几次,才知道是否真的省钱。
Max 和 Team 订阅用户还有额外福利:Anthropic 本周起每月发放 API 额度,Max 5x 为 100 美元,Max 20x 为 200 美元,Team 合计最多 500 美元。
怎样用 20 分钟在自己的工作上测试 Haiku 5.5?
最直接的办法是把同一项重复任务同时交给 Haiku 和 Sonnet,然后对比差异。挑二十个真实条目,用同一份任务单分别运行;如果 Haiku 在二十条里至少有十八条与 Sonnet 一致,这项任务以后就可以交给 Haiku。
--- 第 0 到 5 分钟:选一项每周都做的任务,比如给咨询打标签或从发票提取日期,收集二十个例子。
--- 第 5 到 10 分钟:按四个部分写好任务单,在 Sonnet 5.5 上运行。
--- 第 10 到 15 分钟:新开对话,在 Haiku 5.5 上运行完全相同的任务单。
--- 第 15 到 20 分钟:逐行对比,数一数分歧和“其他”的数量。
被标成拿不准的答案是好事,说明模型在提醒你,而不是瞎猜。目标不是到处用最便宜的模型,而是不再为任务根本用不上的智能付出金钱和等待时间。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 团队审阅。模型信息以 Anthropic 2026 年 10 月 7 日发布资料及 VentureBeat 同日报道为准,价格、套餐和基准成绩以后可能变化。延伸阅读:GPT-6 Sol 与 Luna 模型选择指南。
把重复任务变成现成的 AI 技能
弄清楚哪些工作适合交给快速小模型之后,可以去 UD 免费的 AI Employee Hub 看看专为这类重复任务准备的现成技能。等你希望它们每天稳定运行,UD 团队手把手带你完成每一步,从工具配置、流程设计到实际部署。