Midjourney 的「一致性」究竟指什麼?
圖像一致性,是指同一個主體與同一種視覺處理,能夠在多次獨立生成之間保持不變。在 Midjourney 裡,這件事並不由你的文字提示控制,而是由參考參數控制,它們把一張臉、一組色調或一整套美學釘死在你之後生成的每一張圖上。
如果你的輸出品質參差不齊,你很可能正在用愈寫愈長的提示,去解決提示本身無法解決的問題。提示負責描述意圖,參考參數負責承載身份。
真正發揮作用的是三個參數。Omni Reference(--oref)承載主體;Style Reference(--sref)承載風格;Personalization(--p)承載你長期累積的偏好。本文其餘部分,都是在講如何把它們組合起來而不浪費額度。
為什麼提示完全相同,圖像還是會飄?
相同的提示不會產生相同的圖像,因為每一次生成都從不同的雜訊起點開始。Midjourney 每跑一次,都會重新發明那張臉、那塊布料、那個光線角度與那組調色。純文字裡沒有任何東西,具體到足以描述一張模型必須重現的臉。
這就是「同一個角色、換個姿勢」在實務上失敗的原因。你可以寫「32 歲香港女性,及肩黑髮,圓框眼鏡,深藍西裝外套」,然後得到十二個在技術上都符合描述的不同女人。
文字描述的是類別,參考描述的是個體。這個分別,就是整件事的關鍵。
不斷加形容詞只會令飄移更嚴重,因為提示愈長,每一個詞的權重就被攤得愈薄。正確做法是把提示縮短,改為附上一張參考圖。
Omni Reference 如何鎖定跨圖片的同一個角色?
Omni Reference 的作用,是把一張參考圖的內容釘進新的生成裡,最實用的情況是人物、物件或產品。你用 --oref 傳入一條可公開存取的圖片網址,再用 --ow 控制它被執行的強度。
根據 Midjourney 的 Omni Reference 官方文件,--ow 接受 1 至 1,000 之間的任何數值,預設為 100。文件同時指出,除非你使用非常高的 stylize 數值,否則權重超過 400 的結果會趨向不可預測。
實際可用的區間相當窄。大約在 --ow 100 時,你會得到一個可辨認的人物,同時仍然能適應新的姿勢與光線。推高到 --ow 300,相似度會明顯提升,但彈性大幅下降,因為模型會連同原圖的姿勢與構圖一起複製。
有兩個操作細節必須注意。參考網址必須可公開連結,因此一條私人的 Google Drive 連結會失敗。另外,把 Omni Reference 圖片拖進 Imagine 欄,會自動以 V7 而非更舊版本執行該提示。
Style Reference 如何只鎖風格而不鎖主體?
Style Reference 做的事跟 Omni Reference 相反。--sref 不負責畫面裡是誰或是什麼,而是承載視覺處理:色調、明暗層次、顆粒感、光線氛圍與構圖習慣,主體則完全交還給你的文字提示。
一致性真正的來源,是兩者的組合。Midjourney 自己的建議,就是把 Omni Reference 與 Style Reference 並用,以建立連貫的系列;而當你想同時鎖定主體與風格時,可以把同一張圖同時作為 --oref 與 --sref 傳入。
Personalization 則加上第三層、也是最慢的一層。以 --p 套用的 Personalization 個人化設定檔,是由你長期的排序選擇累積而成,會令之後的生成偏向你已經偏好過的圖像。Midjourney 表示,V7 的全域 Personalization 設定檔可與 V8.2 相容。
把 --p 當成你的品牌基調,把 --sref 當成單一項目的風格。前者是長期偏向,後者是可以一行換掉的專案指令。
可重複的圖像工作流程,具體有哪幾步?
可重複的工作流程,意思是參考圖只生成一次然後重複使用,而不是每次需要新圖就重新賭一次運氣。整套只有四步,第一次跑約需二十分鐘,之後每張圖不用兩分鐘。
第一步:生成錨點圖。為你的主體寫一段簡短提示,生成一批,然後只挑出最強的一張。放大它,複製它的公開圖片網址。這張圖從此就是你的標準參考,不應再重新生成。
第二步:生成風格板。另外製作或挑選一張承載你想要的觀感的圖:色調、光線、質感。它就是整個專案的 --sref 網址。
第三步:建立模板句。文字提示保持簡短,只更換場景。雙破折號之後的所有內容,在整個專案期間都凍結不動。
第四步:每次只改一個變數。你可以改場景用詞,也可以改 --ow,但同一次不要同時改兩者,否則你無法判斷差異由哪個改動造成。
以下是可直接複製的模板。把兩條網址換成你自己的,之後只更改場景描述。
立即試用這段提示:
[場景描述,8 至 15 字,例如「坐在咖啡店桌前閱讀印本報告,晨光」] --oref [你的錨點圖網址] --ow 120 --sref [你的風格圖網址] --ar 16:9 --hd
參數速查表:
--- --oref [網址]:Omni Reference,釘住主體,網址必須可公開存取。
--- --ow [1 至 1000]:Omni 權重,預設 100,據官方文件超過 400 會變得不可預測。
--- --sref [網址]:Style Reference,釘住色調、光線與質感,不釘主體。
--- --p:Personalization 設定檔,來自你自身排序歷史的長期偏向,V7 全域設定檔可用於 V8.2。
--- --ar:畫面比例。--no:排除某個元素。--c:chaos,增加變化。--hd 與 --sd:解析度控制。
這套技巧在哪些情況下會失效?
參考鎖定在臉孔、產品與色調上相當可靠,在文字、標誌與精確幾何上則不可靠。在把一整個campaign押上這套流程之前先了解失效模式,最能節省時間。
它更貴。Midjourney 文件指出,使用 Omni Reference 的 GPU 時間是一般 V7 圖像的兩倍。在 fast hours 有限的 Basic 方案上,一個 40 張圖的專案若全部使用 --oref,額度消耗速度大約是你原本預算的兩倍。
它並非所有工具都支援。Omni Reference 與仍然運行於 V6.1 的功能不相容,包括 inpainting 與 outpainting。因此「先用參考生成,再用 inpainting 修補」這條路走不通,你必須二選一。
高權重會壓死變化。大約超過 --ow 400 之後,你不再是在生成該角色的新圖像,而是在生成參考照片的近似複製品,只是顏色略有不同。
臉孔只是近似,不是相同。對虛構的品牌代言人來說這完全足夠;但若是有名有姓的真人,或客戶會與照片並排比對的素材,就要預期可見的差異,並預留修圖時間。
還有一個實務提醒:版本行為會變。Omni Reference 的說明是以 V7 為基準記錄的,而目前預設版本為 V8.2,輸出原生 2K。在大批量生產之前,先在你實際使用的版本上驗證參數行為。
接下來二十分鐘可以怎樣實測?
請跑一個受控的三圖測試,而不是直接開始整個專案。目標是找出屬於你的 --ow 可用數值,因為正確的數字取決於你的參考圖,以及你的專案需要多少姿勢彈性。
先生成一張主體的錨點圖並複製網址。然後用同一段簡短場景提示跑三次,只改權重:一次 --ow 60,一次 --ow 120,一次 --ow 300。
把三張結果並排放好,只問一個問題:在哪個權重下,主體仍然可辨認,而場景仍然有變化?那個數字就是你的專案預設值,整組圖都沿用它。
把它寫在你日後找得回的地方。大多數人始終無法得到穩定輸出,並不是因為缺少技巧,而是因為每個新專案都要從零開始重新摸索一次可用設定。
如果你更大的問題是 AI 輸出品質每次都在波動,同一原則也適用於文字。關於提示可靠性,我們寫過 2026 年逐步思考提示法有什麼改變;關於工具訂閱成本,則寫過 每月 20 美元究竟買到什麼。
核心結論
一致性不是一種提示技巧,而是一種參考紀律:錨點只生成一次,把它凍結,然後每次只改一個變數。
這就是「使用 AI 圖像工具」與「運行 AI 圖像流程」之間的分別。前者產出好看的單張圖,後者產出你真正交得出去的一整組圖。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 團隊審閱。
把技巧變成流程
認識參數只是第一步,建立整個團隊都跑得動的生產線才是第二步。
UD 同行 28 年,手把手帶你完成每一步,從工具選型、流程設計,到實際部署。