為什麼 ChatGPT 的語音工作分頁需要另一種提示方式?
ChatGPT 現在可以在手機上接收一句口述指令,直接產出文件、電郵草稿或 Slack 摘要。OpenAI 於 2026 年 9 月 23 日宣布把語音驅動的工作分頁(Work tab)帶到流動應用程式。問題在於,口述的提示通常含糊、冗長,而且缺少打字時會寫清楚的細節,結果輸出很容易偏離。
如果你曾經在走去港鐵站的路上口述一項任務給 ChatGPT,然後得到一份平淡無奇的草稿,你並沒有做錯什麼。你只是用平常說話的方式在說話,而一個真正產出工作成果的代理,需要的是交代任務的方式。
語音簡報(voice brief)是一段經過結構化的口述指令,讓 AI 代理不必反覆追問就能完整完成任務。它交代你想要的成果、應該使用的材料、交付物的形式,以及應該停在哪裡。整段大約二十秒。
本文會說明 OpenAI 這次實際推出了什麼、令口述指令穩定可靠的四段式結構、一段你今天就能照讀的腳本,以及語音仍然容易失靈的地方。
OpenAI 在 2026 年 9 月 23 日實際推出了什麼?
根據 TechCrunch 記者 Ivan Mehta 的報道,OpenAI 於 2026 年 9 月 23 日把語音驅動的代理功能帶到 ChatGPT 流動應用程式。Plus 與 Pro 訂閱用戶可以用語音操作手機上的工作分頁,包括建立文件、草擬電郵和摘要 Slack 訊息。Free 與 Go 用戶則獲得語音使用外掛及已連接應用程式的能力。
對日常工作影響最大的功能是接力。你可以在手機上用語音啟動任務,然後在桌面電腦上接續完成。通勤時間因此變成啟動實際工作的時段,回到座位再審閱。
背景是這樣的:OpenAI 在 2026 年 7 月推出 GPT-Live 對話語音模型,同月稍後接入桌面應用程式,讓語音可以驅動電腦上的工作分頁與 Codex 分頁。9 月的更新只是把同樣的能力帶到手機。Anthropic 早兩星期走了另一條路,把 Claude 的對話與 Cowork 介面合併,而 OpenAI 仍然把對話與工作區分開。資料來源:TechCrunch,2026 年 9 月 23 日。
為什麼口述提示的輸出通常比打字差?
口述提示表現較差有三個原因:人說話時常常只說半句,覺得把格式說出口很彆扭所以略過,而且從來不交代任務在哪裡結束。一個能夠製作整份簡報的代理,在你只想要三行電郵時,也會樂意做出整份簡報。
比較一下。打字時你可能會寫:「草擬一封 120 字以內的電郵給客戶,確認星期四的會議,語氣友善但專業,兩項議程用點列。」口述時,同一個人通常會說:「嗯,可以幫我寫點東西給客戶,關於星期四,確認一下,順便提議程。」第二個版本沒有長度、沒有語氣、沒有結構,也沒有終點。
解決方法不是用機械式的語氣說話,而是按固定次序說話,讓打字提示會包含的細節永遠不會被略過。
什麼是四段式語音簡報?
四段式語音簡報是一種按固定次序分為四部分的口述結構:成果(完成品是什麼、給誰看)、材料(使用哪些訊息、檔案或事實)、形式(長度、格式、語氣)與終點(怎樣算完成、什麼不要做)。按這個次序說,大約 15 至 25 秒,就能消除大部分追問。
第一段,成果。用一句話說出交付物與讀者。「一封給客戶方 Mandy 的跟進電郵,確認星期四的啟動會議。」點名讀者,模型就能自行判斷語氣,你不必逐一形容。
第二段,材料。說明內容從哪裡來。「使用專案 Slack 頻道最近五則訊息,加上我昨天貼上的議程。」在手機上,這一段決定了工作分頁是從已連接的應用程式提取內容,還是自己編造。
第三段,形式。即使覺得奇怪,也要把形式說出口。「120 字以內,議程用兩個短點列,友善但專業。」長度與格式是最常被遺漏的兩項。
第四段,終點。定義完成,並圍住多餘的動作。「只要草稿,不要多個主旨選項,不要日曆邀請,不確定的地方標示出來而不是猜測。」正是這一段,阻止一項文件任務變成一份簡報。
這個次序對應你在電梯裡向一位能幹同事交代工作的方式。已經在用書面輸出契約的從業者會認出同一套邏輯,可參考 UD 早前關於輸出契約與穩定 AI 結果的文章,那是同一套方法的打字版本。
如何把語音簡報用在真實的工作任務上?
一個真實情境:你是市場推廣經理,傍晚六時離開客戶會議,明天之前有三件事要完成。其中兩件變成四段式語音簡報,在走向車站的路上對 ChatGPT 工作分頁說出,回家後在桌面電腦審閱。
任務一,會後總結電郵。「成果:給客戶團隊的今日會議總結電郵。材料:我接下來說的三項決定,預算批出八萬,推出日期改為 10 月 15 日,創意部分由 Sarah 負責。形式:150 字以內,每項決定一行,語氣溫和直接。終點:只要草稿,不要加入我沒提到的下一步,主旨留空。」
任務二,Slack 摘要。「成果:設計團隊今天討論內容的摘要,只給我自己看。材料:設計審閱頻道今天的訊息。形式:最多五個點列,每點以發言者姓名開頭。終點:只保留已決定或受阻的事項,略過閒聊,如果頻道少於十則訊息就告訴我。」
留意兩段簡報的共通點。讀者被點名,事實來源被點名,長度是一個數字,而且模型被告知什麼要略過、什麼要標示。最後那一項指令,正是讓語音驅動的代理保持誠實的關鍵,因為它允許模型說「我找不到這項資料」,而不是自行補上。
語音簡報在哪些情況仍然會失靈?
語音簡報在五個可預期的地方會失靈:需要精確字串(例如網址或產品編號)的任務、材料尚未連接的任務、嘈雜環境、在公共場所說出敏感內容,以及過度信任一份你沒有讀過的摘要。事先知道這些,比任何提示技巧更省時間。
精確字串。語音轉文字會弄亂 SKU 編號、電郵地址和網址。先口述簡報,等草稿打開後再打字補上這些細節,或者引用一則貼上的筆記而不是逐字口述。
缺少材料。「摘要 Slack 頻道」只在 Slack 已經是你 ChatGPT 帳戶的已連接應用程式時才有效。如果沒有連接,模型可能會對著空無一物產出一份看似合理的摘要。終點那一段的「找不到就告訴我」就是你的安全網。
方案與推出限制。根據 TechCrunch,工作分頁的語音代理功能面向 Plus 與 Pro 訂閱用戶;Free 與 Go 用戶獲得的是語音配合外掛與已連接應用程式。功能也可能因地區而異並分階段推出,請以你自己的應用程式為準。
接下來 20 分鐘可以試哪一段語音簡報?
在手機上打開 ChatGPT,如果你的方案包含工作分頁就進入該分頁,按下語音控制,然後照讀以下腳本,把方括號內的內容換成你的資料。之後在桌面電腦打開同一段對話,把草稿與你自己會寫的版本比較。整個練習不用 20 分鐘。
試試這段語音簡報(照讀):
成果:以我的名義草擬一封跟進電郵給[讀者姓名與職位],主題是[主題]。
材料:使用我接下來說的[三至四]個要點:[要點一]、[要點二]、[要點三]。不要使用其他任何內容。
形式:[120]字以內,語氣[友善但專業],一個短段落之後加[兩個]點列。
終點:只給我草稿。不要多個主旨選項,不要日曆邀請,不要額外建議。如果有任何要點不清楚,問我一個問題,而不是猜測。
基本簡報用順之後,一個有用的升級是加上第五句:「檢查:完成之前,列出草稿中任何不是來自我提供材料的事實。」較新的模型檢查主張的能力,遠高於一開始就避免產生主張的能力,而語音驅動的任務比打字任務更需要這道檢查。
用語音指揮 AI,最需要記住的一件事是什麼?
按固定次序說,而不是按自然的方式說。成果、材料、形式、終點。新的 ChatGPT 語音工作分頁讓你可以在手機上啟動真正的交付物,但成果的品質是在你說話的那二十秒決定的,不是在代理工作的那幾分鐘。
語音是最貼近人的指令方式,也正因如此,最容易給出不完整的指令。四段式簡報填補了這個缺口,而且不會讓你聽起來像機器。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 團隊審閱。
準備好把真正的工作交給 AI 同事了嗎?
把簡報說清楚是第一步。下一步是給這位代理一個在團隊裡明確的崗位,把材料、界線與審閱流程一併建好。AI Employee Hub 展示 AI 員工可以在市場推廣、行政、客戶服務等範疇承擔的工作,UD 團隊手把手帶你完成每一步,從崗位設計到日常運作。