返回首页

Vidu Q4 Preview

2026 年 10 月 7 日上线的 Preview 怎么跑图生视频和参考生视频:静帧、提示词、时长、分辨率、原生音频与限制。

最近更新: 2026-10-09

2026 年 10 月 7 日公开的 Preview 是以图像为起点的视频模型。你从一张静帧(或一组静帧)出发,描述运动和机位,得到 3–16 秒的片段,并可选用原生音频。viduq4.app 是面向该模型的独立创作器,不是官方产品站,目的是让你不用写请求 JSON 也能先跑一条镜头。

本页是操作指南:选哪种任务、怎么准备素材、各个旋钮实际改什么、Preview 在哪里停住。费用见价格。请求字段与官方路径见 API 说明。如果要和从文本起手的模型做选型,见与 Sora 2 对比。

穿青色上衣的人在暮色窗边举起一张空白纸

能生成什么

两种任务共用同一个模型名(viduq4-preview):

  • 图生视频 — 一张起始画面加提示词。静帧就是第一帧,模型从这里往后续运动。
  • 参考生视频 — 1–15 张静帧约束角色、产品或风格,可选最多 3 段短音色。适合同一主体要在单段内切镜仍对得上的任务。

本站创作器分别标成 Vidu Q4 和 Vidu Q4 Refs。它们是不同任务,不是“只写一句话”的滑杆。

两条路径常见参数:

  • 时长:3–16 秒。本站提供 3、5、8、12、16 秒。
  • 分辨率:540p、720p、1080p、2K、4K(默认 720p)。
  • 纵横比:16:9、9:16、1:1、3:4、4:3。图生视频的输出会跟随起始静帧。
  • 音频:每个任务可开关。开则对白与环境声随画面一起生成;关则是静音底板。

官方材料还提到单段内的镜头切换和 10bit 色深。把它们当成 Preview 能力,而不是“每条提示词都会剪得像成片”的保证。

图生视频:可重复的工作循环

已经有满意的画面、只想让它动起来时,走这条路。

  1. 先锁定静帧。 png / jpeg / jpg / webp,只能一张。主体在 720p 下要看得清;大远景里的小脸容易糊。
  2. 写运动,不要把画面再描述一遍。 模型看得见静帧。告诉它接下来发生什么:谁在动、机位怎么动、有没有人说话。
  3. 按时长选时长,不要按习惯。 眨眼转身用 3–5 秒。走到窗边再回头用 8–12 秒。16 秒留给真正有两个节拍的镜头。
  4. 从 720p 开始。 只有在验证运动点子时才用 540p。动作稳定后再上 1080p 或 2K。4K 留给要调色或二次裁切的底板。
  5. 迭代前先决定音频。 若要自己配乐,第一次运动跑通时就关掉音频,避免为稍后会静音的声音付费。
  6. 在首页创作器提交。 面板会在运行前显示预估积分。成功后从生成记录下载。

比较管用的提示词形状:主体动作 + 机位 + 可选对白。例如:“她转向窗户,停一下,再向前走。镜头缓慢推近。房间底噪很轻。她说:‘我放在桌上了。’”

比较容易失败的写法:把服装和房间再写一遍,并要求五秒里讲完三幕故事。

参考生视频:把主体留住

任务是“同一个人、同一只瓶子、同一种造型必须认得出”时,走这条路。

静帧包(1–15 张)。 按角色想,不要把截图一股脑丢进去:

  • 一两张清楚的主肖像(正面、四分之三侧面)。
  • 需要比例时,加一张全身或产品四分之三侧面。
  • 场景不在主静帧里时,加一张环境和光线参考。
  • 只有主画面里没有的细节,才加风格静帧(色彩、服装、陈设)。

图多不一定更好。互相打架的服装、混杂的画风、或“同一角色”却是两张不同的脸,都会互相拉扯。十五个槽位是给复杂包用的——口播广告常常三张就够。

音色(0–3 段 MP3,大约 3–12 秒)。 官方文档用它们让角色用稳定的声音说话。干净、偏干的朗读比带配乐的素材更稳。不需要克隆音色时,跳过音频参考,把台词写进提示词即可。

多图提示词。 在提示词里点明每张图的角色(“第一张里的女人沿着货架走,手里拿着第二张里的瓶子”),不要指望模型自己猜哪张脸配哪件产品。

在本站选择 Vidu Q4 Refs,把包放进参考区,设好时长 / 分辨率 / 音频后提交。提交前同样会显示积分预估。

原生音频

音频是按任务开关的,本站创作器默认打开。打开时,模型会尝试把对白和环境声跟画面一起生成——提示词里有台词时,也会尽量对口型。关掉则得到静音底板。

实用规则:

  • 需要台词时,把句子放进引号。
  • 不要点名要某首受版权保护的歌。你不会得到原曲,只会得到一团糊。
  • 如果要在剪辑软件里重配声音,直接出静音。在新配乐底下再叠一层生成的房间底噪,是额外工作。
  • 参考路径上的音色参考是为了谁在说话,不是为了背景音乐。

时长、分辨率和纵横比

时长。 官方图生视频允许 3–16 秒(默认 5)。部分供应商页面把参考生视频写成 1–16 秒;本站两条任务都提供 3、5、8、12、16 秒,界面保持一致。短镜头在标价上更便宜,也更好控。16 秒的提示词如果崩了,拆成两条 8 秒。

分辨率。 540p 是草稿。720p 是默认,多数社交裁切够用。1080p 是第一档“给客户看”的尺寸。2K 和 4K 每秒标价更高——见价格——也更久才出片。不要用 4K 去“修好”一条糟糕的运动提示词。

纵横比。 图生视频跟随静帧。需要 9:16 时,先把静帧裁成或生成成 9:16。参考生视频可以在任务上选 16:9、9:16、1:1、3:4 或 4:3。按投放走:Stories / 竖屏短视频用 9:16;YouTube 和多数广告用 16:9;仍按方形裁切的信息流用 1:1。

Preview 不包含什么

  • 没有纯文生视频。 只有句子不能成任务。先准备或生成静帧,再做动画。
  • 没有分钟级时间线。 一次任务就是一段最多 16 秒。更长的故事在剪辑里拼接。
  • 没有主体库调用。 官方说明指出 Preview 暂不支持旧的“主体调用”方式。图像(和可选的音色文件)要随任务一起传。
  • 不是调色完成片工具。 10bit 是余量,不是调色的替代。
  • 不是官方网页应用。 本站通过授权 API 通道调用该模型,并扣除工作区积分。盛数科技自己的产品界面是另一回事。

如果只有一句话、还没有锁定静帧,从文本起手的模型可能更适合做概念——这正是对比页要讲的分流。

把更长的片子拼起来

把每次生成当成一个镜头,而不是一集。

  1. 写分镜:每个片段一个动作。
  2. 每个镜头先有一张主静帧(拍摄或生成),让连贯性有据可依。
  3. 画面已锁定用图生;同一张脸或同一只瓶子必须反复出现时用参考生。
  4. 提示词里的时长、镜头高度和光线用语保持一致(“同一间公寓,钨丝灯,35mm,平视”)。
  5. 在任何剪辑软件里完成。手柄、J 切、字幕都发生在模型之后。

一条 45 秒的社交广告,通常是四到八次 Preview 任务再加一次剪辑,而不是一条英雄式的 16 秒提示词。

上 4K 之前的质量清单

  • 脸或产品在静帧里够大,不是小小的插入。
  • 提示词写的是变化:运动、机位、光线、说话。
  • 时长匹配节拍数量(大约每 3–5 秒一个节拍是有用的上限)。
  • 纵横比匹配静帧和投放。
  • 音频开关匹配成片(保留还是重配)。
  • 参考包没有把两个身份当成同一个角色。
  • 你看过创作器上的积分预估,并接受了它。

常见翻车:过长的提示词把静帧又写一遍;16 秒里塞五个运动;参考包里不同的人被当成同一个主角;把 4K 当第一稿。

在本站试用

打开首页创作器。单张起始画面选 Vidu Q4,一组参考选 Vidu Q4 Refs。放入静帧,设时长和分辨率,看预估,再提交。出片需要登录;若被带到注册页,草稿提示词和参考会留在面板里。

本站与盛数科技无隶属关系。官方字段列表见图生视频 API。本站钱包如何把标价换成积分,见价格。