PixMind 上的 Wan 3.0 是一条多模态视频生成线路,可通过文本、图片、首尾帧、参考媒体、文件或网页创建 2 至 30 秒的视频。当前稳定的模型 ID 为 wan3.0-video,可输出 480p、720p 和 1080p,并生成同步音频。
关键问题并不是提示词要写多长,而是应当选择哪种输入模式来获得所需的控制。首帧决定镜头从哪里开始,首尾帧共同确定镜头两端,参考素材用于传递角色特征或风格,文件或网页则为模型提供需要理解的源材料。不同模式适用的组合规则并不相同。
本指南于 2026 年 9 月 5 日完成事实核验,依据包括 Wan 3.0 在线生成器与 API 页面、PixMind 实现、Alibaba API 参考文档、官方代码仓库,以及 Alibaba Cloud 的当前模型发布列表。本文核实的是界面与限制,并未通过付费基准测试验证速度、质量或可靠性。
关于本指南: PixMind 编辑团队通过在线页面检查、实现审查和模型一手资料记录当前产品行为。本文未委托付费输出基准测试。
要点速览
- 请使用 PixMind 当前的模型 ID
wan3.0-video,不要替换成上游版本或旧版标识符。- 添加媒体前先确定一种控制策略:需要精确开场和收尾时使用首尾帧,需要复用角色特征或风格时使用参考素材,需要依据源材料规划时使用文件或链接。
- 当前线路支持 2 至 30 秒输出,可选 480p、720p 或 1080p,支持自适应或固定宽高比以及同步音频。
- 最多可使用 10 张参考图片、5 个参考视频和 5 个参考音频。Alibaba 上游参考文档还规定,参考视频与参考音频各自的合计时长不得超过 15 秒。
- 请求中包含视频输入时,Alibaba 上游规则要求输入视频时长加请求输出时长不超过 30 秒。
- API 计费与 Studio 积分相互独立。API 任务被接受时返回的价格,是该任务最终采用的价格快照。
本文内容
- PixMind 当前接入的 Wan 3.0 是什么
- Wan 3.0 规格速览
- 如何选择输入模式
- 参考素材限制与有效组合
- 如何在工作流中使用同步音频
- 时长、分辨率、宽高比与 API 价格
- 按控制目标组织的提示词模板
- Wan 3.0 与 Wan 2.7 对比
- Studio 与 API 工作流对比
- 局限、权利与发布检查
- 常见问题
PixMind 当前接入的 Wan 3.0 是什么
Wan 3.0 是 PixMind 当前接入的 Wan 视频模型系列多模态生成线路。在线产品页面将稳定线路标识为 wan3.0-video,并在同一个生成器中提供文本、图片、首尾帧、参考素材、文件和网页输入。
明确这一点很重要,因为上游模型系列可能包含已接入平台尚未开放的产品。Alibaba 文档同时列出了 wan3.0-video 和 wan3.0-video-prime,但 PixMind 当前 API 页面只列出 wan3.0-video。上游文档可以说明技术原理,却不能证明每个上游版本都能通过 PixMind 使用。
可以将该模型理解为一组控制模式:
- 文生视频从场景描述开始,无须提供视觉源素材。
- 首帧图生视频从一张给定图片开始,让模型以此为起点向后生成动画。
- 首尾帧生成同时固定镜头的起点和终点。
- 参考素材生成通过图片、视频、音频或兼容组合来约束结果。
- 文件或网页输入提供可用于理解任务的源材料。
可在 Wan 模型系列中心查看相关 Wan 线路;对于具体任务可用的控件,仍应以在线生成器为准。
Wan 3.0 规格速览
PixMind 当前线路兼具较长的视频时长、多类参考素材和三档分辨率。不过,下表内容应视为特定日期核实的界面事实,而不是永久不变的服务承诺。
| 设置 | PixMind 当前页面 | 规划提示 |
|---|---|---|
| 模型 ID | wan3.0-video |
当前 API 线路请使用这一准确 ID |
| 时长 | 2 至 30 秒 | 有视频输入时,上游规则要求输入视频时长加输出时长不超过 30 秒 |
| 分辨率 | 480p、720p、1080p | 分辨率越高,每秒价格越高 |
| 宽高比 | 自适应、16:9、4:3、1:1、3:4、9:16 | 生成前先匹配最终发布渠道 |
| 音频 | 同步音频 | 有意识地描述声音与对白 |
| 参考图片 | 最多 10 张 | 仅保留职责明确的参考素材 |
| 参考视频 | 最多 5 个 | 上游规定合计时长不超过 15 秒 |
| 参考音频 | 最多 5 个 | 上游规定合计时长不超过 15 秒 |
| 其他来源 | 文件或网页 | 上游规则中文件与链接模式互斥 |
| API 端点 | POST /v1/generations |
任务被接受时的响应会提供最终任务报价 |
不同来源可能从不同层级描述同一限制。PixMind 产品页写明单个参考视频最长可为 15 秒,而 Alibaba 上游 API 参考文档规定参考视频的合计时长上限为 15 秒。提供多个视频时,更稳妥的规划方式是将总时长控制在 15 秒以内。多个参考音频也应采用同样的合计时长限制。带有视频输入的请求还受另一条上游上限约束:输入视频总时长加请求输出时长不得超过 30 秒。
如何选择输入模式
选择与你最不能丢失的约束相对应的模式。输入越多并不代表控制越强,不兼容的模式还可能导致请求无效。
开放式构图使用文生视频
当新镜头不需要保留已有图片或指定首尾画面时,适合使用纯文本生成。围绕一个主要事件,说明主体、动作、地点、镜头、光线、节奏与声音。
开场画面很重要时使用首帧
首帧图生视频从已经确认的构图开始。应写清哪些元素移动、哪些元素保持稳定,以及摄像机如何运动。
需要控制起点与终点时使用首尾帧
首尾帧适合开场和结束画面都已确定的转场。Alibaba 将其视为独立模式:不要与参考媒体、文件、链接或音频输入组合使用。
连贯性或声音优先时使用参考素材
参考模式通过相关素材约束镜头。图片可以说明外观,视频可以传递运动方式,音频可以提供节奏或声音方向。这些类型可在各自限制内组合使用。
如果最大的困难是选择模型与模式,可以通过 AI Video Agent将场景需求转化为当前可用的模型选项。已经明确输入模式和参数的用户,则更适合直接使用 Wan 3.0 生成器。
参考素材限制与有效组合
Wan 3.0 支持同时使用多种参考素材,但首尾帧、文件和链接模式都有明确边界。开始精简提示词之前,应先围绕一种有效组合构建请求。

Alibaba 上游规则可以概括如下:
| 输入组合 | 上游支持情况 | 重要约束 |
|---|---|---|
| 参考图片 + 参考视频 | 支持 | 参考视频合计最长 15 秒;输入视频时长加输出时长最长 30 秒 |
| 参考图片 + 参考音频 | 支持 | 希望图片与音频共同驱动结果时的推荐组合 |
| 参考视频 + 参考音频 | 支持 | 每类媒体都应保持在各自限制内 |
| 文件 + 参考媒体 | 支持 | 文件可与兼容的参考素材一同使用 |
| 网页链接 + 参考媒体 | 支持 | 链接可与兼容的参考素材一同使用 |
| 文件 + 网页链接 | 不支持 | 两种源文档模式只能选择一种 |
| 首尾帧 + 参考媒体 | 不支持 | 首尾帧是独立模式 |
| 首尾帧 + 音频输入 | 不支持 | 需要音频驱动时改用参考图片 + 参考音频 |
应为每项素材指定一个明确职责,例如定义产品、背景或镜头运动。使用文件或网页时,要说明需要提取什么信息。不要假设每句话、每个价格或每条免责声明都能被准确呈现。

如何在工作流中使用同步音频
同步音频是当前线路的一部分,因此需要结合画面动作规划环境音、音效、对白意图与时间点。
对于简单场景,可以将声音指令与画面指令分开:
Visual: A barista places a ceramic cup on a walnut counter as the camera makes a slow 20-degree arc.
Timing: The cup lands at 00:03 and steam becomes visible immediately after.
Audio: Quiet cafe room tone, one soft ceramic tap at 00:03, no music, no spoken dialogue.
这种结构无法保证逐帧精准同步。发布前应检查对白时机、意外语音、音乐和声音相似度。
Alibaba 上游的首尾帧模式不接受音频输入。如果必须由音频驱动生成,请使用参考图片加参考音频。如果首尾帧控制更重要,则在后续流程中添加已获得适当许可的声音。
声音权利尤其需要谨慎处理。未获得必要授权且不符合适用条款时,不要上传声音参考,也不要发布可识别的声音仿制内容。
时长、分辨率、宽高比与 API 价格
生成前应先确定交付格式,因为时长和分辨率会直接改变 API 成本,宽高比则决定构图是否适合最终渠道。2026 年 9 月 5 日核实的在线 API 价格快照为:480p 每秒 $0.050、720p 每秒 $0.090、1080p 每秒 $0.18。
以下估算仅用时长乘以当日每秒价格:
| 时长 | 480p,$0.050/秒 | 720p,$0.090/秒 | 1080p,$0.18/秒 |
|---|---|---|---|
| 2 秒 | $0.10 | $0.18 | $0.36 |
| 5 秒 | $0.25 | $0.45 | $0.90 |
| 10 秒 | $0.50 | $0.90 | $1.80 |
| 30 秒 | $1.50 | $2.70 | $5.40 |
这些数字是规划估算,不是未来请求的报价。价格和账户规则可能发生变化。当前公开参考应以在线 Wan 3.0 API 页面为准,任务被接受时返回的价格则是该任务最终采用的价格快照。
并非每个含视频条件的请求都能使用表中的 30 秒输出。根据 Alibaba 上游文档规则,当任务包含视频输入时,应从 30 秒中减去输入视频总时长,从而得到可请求的最长输出时长,并在提交前确认 PixMind 在线控件。
API 计费与 Studio 积分相互独立。不要把 Studio 积分预览换算成 API 美元价格,也不要假设 API 余额包含 Studio 权益。可先在当前定价页面查看套餐背景,再核对实际准备使用的产品页面。
渠道规划方面,16:9 适合横屏内容,9:16 适合竖屏视频,1:1 适合方形版位。自适应比例可以跟随源素材,但提前确定发布比例可以减少后续裁切。可先用 480p 低成本测试结构,在模式、节奏和构图稳定后再提高分辨率。
按控制目标组织的提示词模板
有效的提示词应说明哪些内容保持稳定、哪些内容允许变化,以及变化如何发生。以下结构并不保证特定结果。
模板 1:通过文本创建一个可控镜头
Create a [duration]-second [aspect ratio] shot.
Subject and action: [one subject performing one clear action].
Setting: [location, time, background activity].
Camera and light: [framing, movement, light direction, palette].
Timing: [start], [midpoint], [final state].
Audio: [ambience, effects, dialogue, music].
Preserve or avoid: [essential constraints].
模板 2:让已确认的首帧动起来
Use the image as the opening composition.
Keep stable: [identity, product, logo, or geometry].
Animate: [motion and final action by time].
Camera: [locked, pan, dolly, or orbit].
Audio: [sound tied to visible events].
Do not introduce: [unwanted additions].
模板 3:为多模态参考素材分配职责
Image 1 defines [subject]. Image 2 defines [setting or palette].
Video 1 defines [camera or action], not identity.
Audio 1 defines [tempo, timing, ambience, or dialogue cue].
Create a [duration]-second [ratio] scene with [one narrative beat].
Prioritize: [two constraints]. Allow variation in: [nonessential details].
模板 4:将文件或网页转化为聚焦的视频需求
Use the [file or web page] as source material.
Extract only: [approved facts or section].
Audience and goal: [viewer], [explain, introduce, or summarize].
Structure: [opening], [two beats], [final message].
Do not invent: [prices, claims, quotations, or features].
Audio: [narration, ambience, effects, music].
先运行能够验证结构的最低成本测试,再生成较长的最终版本。如果构图有问题,应精简提示词,而不是继续堆叠形容词。如果连贯性有问题,应减少参考素材并标明各自职责。如果节奏有问题,应减少事件数量,并给出更清晰的时间点。
Wan 3.0 与 Wan 2.7 对比
Wan 3.0 是新的接入目标,并不是给 Wan 2.7 请求换一个名称。当前线路使用 wan3.0-video,文档所示输出时长扩展到 30 秒,输入规划也拓展到首尾帧、参考素材、文件和网页。迁移前应重新核对参数名称、有效组合、宽高比、时长、音频、响应处理与价格。
以上只是接口迁移摘要,并非宣称 3.0 在所有质量对比中都更优。本文没有进行受控的并排生成测试。输出偏好可能取决于主体、参考素材、镜头设计与审核标准。
应保留不同版本文章的明确标识,不要直接将 Wan 2.7 完整指南悄然改名。在对运动、连贯性、提示词遵循度、声音或性价比作出结论前,仍需要进行受控对比。
Studio 与 API 工作流对比
Studio 与 API 适用于不同的操作需求,并采用相互独立的计费体系。Studio 适合交互式设置和可视化迭代;API 则适合需要重复提交、任务跟踪和程序化处理结果的应用。
Studio 工作流
打开 Wan 3.0 生成器,选择模式,仅添加兼容的源素材,并确认时长、分辨率、宽高比与在线积分预览。核对设置后再生成,导出前检查完整的视频与音频。
API 工作流
- 确认
wan3.0-video可用并查看当前 API 价格。 - 向
POST /v1/generations发送一种有效的模式组合。 - 保存任务 ID 与被接受的价格数据,然后轮询同一任务。
- 验证结果,并记录参数、源素材来源和权利审批信息。
Alibaba 上游文档采用异步创建与轮询模式。除非 PixMind 明确说明,否则不要把上游任务有效期规则直接套用到 PixMind。PixMind API 快速入门解释了为什么在客户端超时后保存任务 ID 比重新提交更安全。

局限、权利与发布检查
Wan 3.0 的输出需要人工审核,因为多模态控制并不等同于合规保证。文档界面只能说明接受哪些输入和设置,不能证明结果准确、可靠、已获得法律许可,或适合某种特定发布用途。
发布前请完成以下检查:
- 画面与时间准确性: 将完整视频与已批准的参考素材比较,检查漂移、物体变化、错误文字或意外剪切。
- 音频审核: 检查对白、声音相似度、时机、背景语音、音乐与音效。
- 事实审核: 对照源文件或网页,验证由其衍生的陈述。
- 权利审核: 确认已获得提示词、图片、视频素材、音频、人物、声音、商标、标志及其他第三方材料的必要许可。
- 交付审核: 检查导出文件的时长、尺寸、比例、编码,以及在目标平台上的播放情况。
- 记录保存: 保存任务被接受时的详细信息、输入来源、同意或许可记录、审核人和审批决定。
商业使用取决于付费套餐资格、适用的模型与提供商条款,以及用户是否拥有提示词、参考素材、人物、声音、标志和其他第三方材料的相应权利。生成内容并不会自动清除这些权利风险。请针对账户和使用场景查看当前定价条款与服务条款;法律风险较高时,请寻求专业意见。
常见问题
首尾帧生成可以使用音频吗?
根据 Alibaba 上游文档,首尾帧模式不能使用音频输入。如果需要由音频驱动结果,请采用官方建议的参考图片加参考音频组合。如果必须固定首尾帧,则保留首尾帧模式,并在独立工作流中处理已获许可的音频。
Wan 3.0 API 生成需要多少钱?
2026 年 9 月 5 日的价格快照为:480p 每秒 $0.050、720p 每秒 $0.090、1080p 每秒 $0.18。请将这些数字视为带日期的规划依据。任务被接受时的响应会提供该任务最终采用的价格快照;API 计费与 Studio 积分相互独立。
PixMind 可以使用 wan3.0-video-prime 吗?
PixMind 当前模型页面列出的是 wan3.0-video,而不是 wan3.0-video-prime。Alibaba 将 Prime 记录为上游版本,但这不能证明它已通过 PixMind 开放。
Wan 3.0 输出可以商用吗?
商业使用有前提条件,并非自动获得许可。它取决于付费套餐资格、适用的模型与提供商条款,以及您是否拥有任务与结果中所有提示词、参考素材、人物、声音、标志和第三方材料的相应权利。
选定一项约束,先运行受控任务
开始使用 Wan 3.0 最清晰的方法,是先确定最重要的一项约束,再选择对应的输入模式。开放式构图用文本,固定开场用首帧,明确收尾用首尾帧,复用角色特征或确定声音方向用参考素材,依据源材料规划则用文件或链接。
第一次任务应足够短,以便尽快暴露结构问题。提交前确认模型 ID、参考素材、宽高比、分辨率、时长、音频、价格与权利。应检查完整结果,不要只凭缩略图判断。
确认这些决策后,可打开 Wan 3.0 生成器执行交互式任务,或访问 Wan 3.0 API 页面构建程序化工作流。每次生成时,都应重新核对在线控件与任务被接受时的价格。


