为什么同一段提示词,在不同 AI 视频模型上效果差这么远?
因为 AI 视频模型并非可以互换的通用工具。每一个模型在训练与调校时都针对不同任务:有些擅长稳定的镜头运动,有些的口型同步是原生生成,有些纯粹便宜到让你可以反复尝试。把所有镜头都丢给同一个顺手的模型,正是 AI 视频输出品质参差的最大原因。
过去两星期,我用三份相同的简报分别在五个模型上跑过:产品环绕镜头、一句对白的人物镜头、城市空镜。模型之间的品质差距,其实小于「派工」的差距。
模型派工(model routing)是指把视频中每个镜头分派给最适合该镜头类型的模型,而不是全部在同一个平台生成。这是工作流程的决定,不是订阅方案的决定,而且通常能同时降低成本与重拍次数。
哪一个 AI 视频模型适合哪一种镜头?
把镜头配对到模型的强项。对白用原生口型同步的模型,镜头运动用可控性高的模型,背景空镜用最便宜的一档,单一主视觉镜头则交给榜首模型。截至 2026 年 7 月,没有任何一个模型在这四类同时胜出。
以下是我现在使用的派工表:
--- 对白与人物镜头:选原生口型同步的模型。Seedance 2.5 是目前首选,声音与嘴型一同生成,而非事后配上。事后配音的口型,在手机屏幕上两秒内就被看穿。
--- 指定运镜:Runway Gen-4.5。它对结构化提示词(推轨、环绕、变焦对焦)的反应比榜首模型更可预测,而且嵌进剪辑流程而非聊天窗口。
--- 背景空镜与过场:用你能接受的最低价位。Veo 3.1 Lite 与 Runway Gen-4 Turbo 均约为每秒输出 0.05 美元。没有人会为你的第三个过场镜头按暂停。
--- 主视觉镜头:Gemini Omni Flash。截至 2026 年 7 月下旬,它以 1527 Elo 位居 LMArena 文字转视频榜首,领先第二名约 45 分,并支持对话式修改。
--- 4K 或较长序列:同样是 Seedance 2.5,新增原生 4K 与 30 秒输出,以及最终渲染前规划运镜的 3D 预览步骤。
模型每隔几星期就会改朝换代,但派工的分类不会。把习惯建立在分类上。
AI 视频每一分钟成片,实际成本是多少?
远高于每秒标价,因为你不可能用第一次生成的结果。以实际上约 8:1 的生成与采用比例计算,一分钟成片代表约 480 秒输出。以每秒 0.10 美元计算约为 48 美元,折合约 375 港元;以每秒 0.05 美元计算则降至约 187 港元。
截至 2026 年 7 月下旬的公开牌价,按输出秒数计算:
--- Veo 3.1 Lite:约每秒 0.05 美元。Runway Gen-4 Turbo:约每秒 0.05 美元(每秒 5 点数)。
--- Kling:约每秒 0.07 美元,Kling 3.0 接近 0.10 美元。
--- Sora 2 基础版:720p 约每秒 0.10 美元。Sora 2 Pro:约 0.30 至 0.50 美元,1080p Pro 可达 0.70 美元。
--- Gemini Omni Flash:约每秒 0.10 美元(每百万视频输出 token 17.50 美元),通过 Batch API 可减半至约 0.05 美元。
--- Runway Gen-4.5:每秒 12 点数,约 0.12 美元。Veo 3.1 标准版:1080p 约每秒 0.40 美元。
在决定订阅方案之前先算一次。同样以 8:1 比例计算,一段 60 秒产品视频若全部使用 Veo 3.1 标准版,单是生成成本便约为 1,498 港元。若妥善派工,只保留一个主视觉镜头、其余交给低价档,同样一分钟的成本会落在约 250 港元。
以上每一个数字都只是快速变动市场中的牌价。真正动用预算的当天,请回到供应商自己的定价页面确认。
一段好的 AI 视频提示词应该长什么样?
好的提示词会按固定次序写明五件事:主体、动作、镜头、光线、格式。模糊的提示词只会产生模糊的动态。模型并非凭感觉猜测你的意图,而是把你的文字对应到训练字幕,而字幕语言本身就是技术性的。
以下是我每个镜头都在用的模板。原样复制,填入方括号内容即可。
试试这段提示词:
SUBJECT:[一个具体主体,写明材质与颜色,例如「一只哑光黑陶瓷咖啡杯,冒着热气」]
ACTION:[只写一个物理动作,例如「热气缓缓上升,液面静止」]
CAMERA:[只写一个运镜,例如「由左至右缓慢 90 度环绕,视平线高度,50mm 镜头」]
LIGHTING:[光源、方向、色温,例如「单一柔光主灯自镜头左侧打入,暖色 3200K,向黑色深度衰减」]
FORMAT:[时长、比例、分辨率,例如「6 秒,16:9,1080p,无文字叠加,无标志」]
NEGATIVE:[不可出现的元素,例如「无手部、无摄影棚反光、无镜头晃动」]
有两条规则让模板生效。每段片只给一个动作、一个运镜:同时要求横摇、变焦与主体转身,结果只会一团糊,分成两段再剪辑。永远不要省略光线描述:光线正是决定多段片段是否像同一场拍摄的关键变量。
如果你已经在为文字模型撰写结构化提示词,这是同一套纪律换到另一种输出形式。我们关于情境工程的文章,说明了为何在各类模型上,明确结构都胜过巧妙措辞。
怎样让多段 AI 片段看起来像同一支视频?
在每次生成之间锁定三个变量:光线描述、镜头焦段与高度、色彩基调。把这三行原文照抄到每段提示词,只更换主体与动作。大部分「AI 视频看起来很割裂」的抱怨,源头都是每次重写光线那一行。
提示词之外,善用平台的一致性功能。风格参考、角色锁定、种子码重用本质上都在做同一件事:把模型约束在先前输出上。Runway 与 Kling 都有这类设定,聊天式工具则往往藏得很深。
然后在剪辑软件里收尾。所有片段套用同一组 LUT 调色,整条时间线加一层颗粒,统一音场。十五分钟调色掩盖的模型不一致,比多生成五十次还要多。
静态图像那一端同样有进展,这对分镜很重要。Meta 于 2026 年 7 月 7 日推出 Muse Image,目前在文字转图像约排第三、图像编辑排第二,Google 亦推出了 Nano Banana 2 Lite。先把关键帧以静态图生成,确认后再动画化,成本远低于直接在视频阶段反复试。
2026 年,AI 视频在哪些地方仍然做不好?
稳定地失手于四处:具名产品、画面文字、需要精细操作的手部、以及超过约十秒的连贯性。这些不是靠更好措辞就能解决的提示词问题,而是当前的模型极限,假装不存在只会浪费预算。
--- 你自己的产品。没有模型见过你的货号。生成的近似品不如手机实拍。产品实拍,环境交给生成。
--- 画面文字。小字级的清晰文字至今不稳定。字幕与标题请在剪辑软件加上,而不是写进提示词。
--- 精细手部动作。手指操作小物件仍然是最常见的失败点。用切镜或裁切避开。
--- 长度。多数模型在短片段上表现最好。即使有 30 秒输出,也应以多镜头组成序列,而非押注一次完美长生成。
诚实比吹捧有用。AI 视频如今在氛围、动态与环境上确实出色,在具体指涉上仍然薄弱。依这个分界规划剪辑,输出就不再像赌博。
立即试做:20 分钟派工测试
挑一个你这星期真正需要的镜头。用上面的模板生成三次:一次用低价档,一次用 Runway Gen-4.5,一次用当前榜首模型。五行内容相同、光线文字相同,只更换平台。
然后看「每段可用片段的成本」,而非每秒成本。我的测试中,低价档在空镜上大幅胜出,在需要指定运镜的镜头上则惨败。这一次测试抵得上几个月的订阅猜测。
把结果记在一张两栏笔记上:左边写镜头类型,右边写胜出模型。那张笔记就是你的派工表,价值高于任何排行榜,因为它反映的是你真正会拍的镜头。若你想了解模型在不同负载下的行为差异,我们的AI 努力程度设定指南在文字端说明了同一个原则。
结语
不要再寻找「最好的 AI 视频模型」,改为把镜头派给最能处理它的模型。建立派工表只需要一个下午,能撑过每一次模型改版,并把一分钟成片的成本,从四位数港元压到低三位数。
科技应该减少你在压力下要做的决定,而不是增加。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 团队审阅。
🎬 把技术变成可重复的流程
派工表你已经有了,下一步是把它建成每周都能稳定运行、不用每次从零重建的制作流程。UD 团队手把手带你完成每一步,由工具选型、提示词库,到审核关卡与交付。