GPT-6 Astra 在文档、演示文稿与电子表格上究竟改变了什么?
GPT-6 Astra 是 OpenAI 于 2026 年 9 月 1 日发布的前沿模型。在文档工作上,真正的改变是「模板依从」:Astra 能打开、编辑并反复修改文档、电子表格与演示文稿,并依照你提供的模板,沿用它的版面、语气与视觉风格,而不是自行另创一套。
这与「写得好」是两件不同的事。旧模型能产出通顺的文本,然后把它倒进一份通用样板。Astra 则被训练成把你现有的文档当成规格书来读。
OpenAI 在官方发布页上称它是「最擅长依从既有模板」的模型,能产出版面工整、叙事有结构的幻灯片。官方示范中,模型只拿到 OpenAI 演示文稿模板的几张幻灯片,就完成整份虚构模型的介绍演示文稿,全程维持一致的语气与版面。
支撑这个说法的数字在 AutomationBench 上,该基准测试真实的专业工作流程任务。Astra 得分 41.4%,GPT-5.6 Sol 为 18.1%。在 OpenAI 内部设计任务上,Astra 为 50.0%,Sol 为 47.4%;内部数据科学任务上,Astra 为 40.9%,Sol 为 30.5%。
供应情况:发布当日先开放给少数组织,其后陆续开放给所有 ChatGPT Plus、Pro、Business 与 Enterprise 用户,并上线 OpenAI API、Microsoft Azure 与 AWS Bedrock。API 标准定价为每百万输入 token 10 美元、每百万输出 token 50 美元。企业管理员需要手动打开,因为发布时默认为关闭。
为什么直接给模板,比用文本描述格式有效?
用文本描述格式,等于逼模型去猜行距、层级、配色与每页的信息密度。把你自己演示文稿里真实的两三张幻灯片交给它,猜测的空间就消失了。Astra 会读档、抽取版式,再套用到新内容上。
这一点在「一眼就看得出不对」的细节上最关键。字体搭配、标题区块的位置、你所属机构能接受多少文本量、图表应该放在结论句的左边还是右边。
同样逻辑适用于电子表格。上传一份你已在用的工作表,Astra 会填进你建好的结构,而不是另开一张自订列序的新表。OpenAI 亦说明,Astra 只会把真正相关的上下文带进输出,不会重复那些对当前工作无用的信息。
对在香港处理客户文档的人来说,实际后果是:你的品牌模板从此是可重用的资产,不再是排版杂务。一份干净的模板档,价值高于一整页格式指示。
--- 附上 2 至 3 张具代表性的幻灯片,不要整份 40 页的文档。Astra 需要的是版式,不是数据库。
--- 其中一张要能显示图表风格,一张是文本量较重的版面,再加上标题页。
--- 电子表格请附有数据的范例,而非空白骨架,让模型看得见数据类型与格式惯例。
要怎样写指令,Astra 才真的做得出你想要的东西?
含糊的指令现在代价更高,而不是更低。正因为 Astra 更有能力长篇运行,薄弱的指令只会产出一份更精致的错误成品。「帮我做一份 Q3 的演示文稿」,换来的是二十张版面漂亮但方向错误的幻灯片。
指令是整个流程中杠杆最大的输入。它必须包含五件事:对象、你希望对象做出的决定、素材来源、模板,以及篇幅上限。
以下是一份可直接拷贝使用的完整指令。它为演示文稿而写,只要换掉成品类型与结构那一行,同一骨架也适用于报告或电子表格。
试试这个提示
请依附件模板与附件 Q3 业绩数据,制作一份 9 页演示文稿。
对象:区域市场总监,只有 10 分钟,未看过 Q3 数字。
我要的决定:批准或否决最后一页提出的 Q4 预算重新分配方案。
模板:字体、配色、标题位置与图表风格,完全依照附件那 3 张幻灯片。不要添加任何颜色或图标。
结构:第 1 页标题;第 2 页单一内核数字及其意义;第 3 至 6 页每页一个渠道,各配一张图表与一句结论;第 7 页问题所在;第 8 页重新分配方案及金额;第 9 页我要你做的决定。
限制:每页正文不超过 40 字。所有图表必须使用附件的实际数字,不得使用示意性占位数据。若数据中缺漏某个数字,请留空,并在最后一页的备注中列出,不要自行估算。
开始制作前,先告诉我你必须做出的任何假设,只要那个假设会改变建议结论。
最后一行是大多数人会漏掉的部分。它把 Astra 爱提问的倾向,转化成一份可一次审阅的清单,而不是制作到一半时的中断。
指令不明确时,Astra 的处理方式有何不同?
Astra 比 GPT-5.6 Sol 更常提出厘清问题,而非自行假设。OpenAI 形容它会用上下文填补例行的空白,但当答案足以改变结果时,就会提出聚焦的问题。代价是它有时会在你以为它应该继续的地方停下来。
若你宁愿它往前推进,OpenAI 自己的模型文档已提供解法。官方指引建议你明确要求模型推断意图并「倾向行动」,把「可以帮我」、「我想要」、「帮我」这类说法视为行动指令,而不是提问的邀请。
OpenAI 在 2026 年 9 月 5 日公布的 GPT-6 Astra 指引中,用了这样的说法:用户应该是在审批一个具体、可查看的成果。换句话说,让它先完成一件事,然后你再查看。
Astra 在任务演变过程中也更能守住方向。旧模型常把对话中途的修正消息当成全新目标,把原本的限制条件整批丢掉。Astra 会纳入新要求、依指示转向,并在回答旁支问题后仍守住主线任务。
对实务用户而言,这改变了修改的方式。你不再需要每改一处就重述整份指令。「把第 6 页的柱状图改成表格」,不再有可能连带把你的 40 字上限一并重设。
如何让 Astra 不要写出一看就知是 AI 的文本?
Astra 默认偏好清单、表格与 Markdown 格式,并且会在不同对话中重复同一批措辞。若你要的是连贯段落,就必须明确讲清楚。OpenAI 的官方指引比大多数第三方教学走得更远,它直接附上一份「slop words」黑名单。
指引中点名的包括「delve into」、「it's worth noting」、「what's important is」、「leverage」,以及「In short:」这类收尾总结句,还有「X, not Y」的对比句式。它同时标示要避免自创的连字号复合词与套语式转折。
这份清单特别有用,因为那是模型的供应商亲自告诉你该压制哪些习惯。把它贴进项目指令或自订 GPT,就会套用到每一次输出,而不只是一次对话。
试试这个提示
请以清晰、精简的段落写作,每段只发展一个内核观点。只有在信息确实并列、有序或更适合对照时才使用清单,并避免嵌套清单。
使用简单常见的词、具体的例子与精确的动词。偏好主动语态与直述句。先把重点讲清楚,再补上读者需要的解释与证据。
不得使用以下措辞:「delve into」、「it's worth noting」、「what's important is」、「leverage」、「truly」、「really」,以及「In short」、「Conclusion:」这类收尾总结。
不得使用「X, not Y」的对比句式。不得自创连字号复合词。不要说明你不会做什么、或哪些部分没有改动。直接说明你做了什么。
两点值得知道的注意事项。Astra 派工给子代理的频率低于预期,因此若你要并行处理,就必须明确指定何时委派、委派多少。另外在代码任务上它会过度测试,除非你要求它只在出现新的失败时才重跑测试,否则小改动也会触发不成比例的测试套件。
这套做法在实际使用中会在哪里失效?
在把工作流程整个搬到 Astra 之前,有三种失效情况值得先规划。
互相矛盾的上下文会压过你的指令
Astra 比前代更能遵循长指令,但也对上下文更敏感。它能读到的文档中若有含糊或互相矛盾的指示,包括项目指令与技能文档,都可能令它中止工作或偏离方向。OpenAI 的建议是逐一审核模型可读取的所有上下文文档,并明确赋予你的直接指令优先权。
OpenAI 亦为此公布了一段调试指令:要求模型指名它读到的具体文档,并引述那条导致它暂停或改变方向的指示。这能把一次无法解释的停顿,变成可追溯的原因。
安全检查会中断正当工作
由于 Astra 在 OpenAI 的 Preparedness Framework 下已跨越网络安全能力的「Critical」门槛,Astra 级模型在生产环境会运行失准监测。OpenAI 明言,额外的安全检查有时会拖慢、暂停或中止正当工作。在 ChatGPT 中,你可能会被要求先审核某个动作才继续;在 API 中,任务会直接停止。
上下文窗口大,不等于理解力强
Astra 的长上下文检索表现强劲,在 OpenAI MRCR v2 8-needle 测试的 512K 至 1M 区间得分 96.3%。但检索不等于读懂一份结构混乱的文档。一份杂乱的 200 页来源档,照样会产出一份混乱的演示文稿。先整理输入。
关于模型版本的一点诚实说明:以上所有内容反映的是 2026 年 9 月初刚发布时的 Astra。OpenAI 表示 Codex 的笔记保留行为将在未来数周成为默认,访问权限亦会逐步扩大,因此你建好的流程,应该针对你实际被分配到的版本重新测试。
接下来 20 分钟可以做什么?
找一份你已交付并且满意的演示文稿。删掉所有内容,只留标题页、一张图表页、一张文本较多的版面。把这份三页文档存成你的模板。
然后找一件你还没开始的工作,把上文第三节那份指令套上去。把结果拿来与「用文本描述格式」所得到的版本比较。
电子表格也照做一次:保留一份有数据的范例,其余删去,然后要求 Astra 依这个结构延伸新数据。「描述了格式」与「交出了文档」之间的落差,就是这项能力的全部所在。
如果你想看同一个原则在「输入端」而非「输出端」如何发挥作用,我们谈为什么 AI 聊得越久表现越差那一篇,正好处理你交出去的上下文形状不对时会发生什么事。若你想先掌握自己的 AI 技术实际处于什么水平,AI IQ 测试只需几分钟。
「模板依从」听起来是个小功能,实际后果却很大:现在真正值钱的技能是写好指令,而不是提示技巧的小花招。懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 团队审核。
把一次成功的指令,变成可重复的工作流程
掌握技术只是第一步。要让它每星期、在整个团队、用你的模板与你的数据,每次都跑出同样的结果,才是真正困难的部分。UD 同行 28 年,手把手带你完成每一步,从工具配置、流程设计,到实际部署,让 AI 真正为你所用。