限时开通年费会员,享30%折扣并且获得 GPT Image、MiniMax H3 等模型无限使用权益
新上线 AI Chat · 每天赠送免费试用次数
立即升级
Pixmind

Wan 3.0 视频完整指南:输入、音频、价格与 API

选对输入模式,合理控制参考素材与音频,并将 Studio 中的试验转化为稳定的 API 工作流。

文章目录

PixMind 上的 Wan 3.0 是一条多模态视频生成线路,可通过文本、图片、首尾帧、参考媒体、文件或网页创建 2 至 30 秒的视频。当前稳定的模型 ID 为 wan3.0-video,可输出 480p、720p 和 1080p,并生成同步音频。

关键问题并不是提示词要写多长,而是应当选择哪种输入模式来获得所需的控制。首帧决定镜头从哪里开始,首尾帧共同确定镜头两端,参考素材用于传递角色特征或风格,文件或网页则为模型提供需要理解的源材料。不同模式适用的组合规则并不相同。

本指南于 2026 年 9 月 5 日完成事实核验,依据包括 Wan 3.0 在线生成器与 API 页面、PixMind 实现、Alibaba API 参考文档官方代码仓库,以及 Alibaba Cloud 的当前模型发布列表。本文核实的是界面与限制,并未通过付费基准测试验证速度、质量或可靠性。

关于本指南: PixMind 编辑团队通过在线页面检查、实现审查和模型一手资料记录当前产品行为。本文未委托付费输出基准测试。

要点速览

  • 请使用 PixMind 当前的模型 ID wan3.0-video,不要替换成上游版本或旧版标识符。
  • 添加媒体前先确定一种控制策略:需要精确开场和收尾时使用首尾帧,需要复用角色特征或风格时使用参考素材,需要依据源材料规划时使用文件或链接。
  • 当前线路支持 2 至 30 秒输出,可选 480p、720p 或 1080p,支持自适应或固定宽高比以及同步音频。
  • 最多可使用 10 张参考图片、5 个参考视频和 5 个参考音频。Alibaba 上游参考文档还规定,参考视频与参考音频各自的合计时长不得超过 15 秒。
  • 请求中包含视频输入时,Alibaba 上游规则要求输入视频时长加请求输出时长不超过 30 秒。
  • API 计费与 Studio 积分相互独立。API 任务被接受时返回的价格,是该任务最终采用的价格快照。

本文内容

PixMind 当前接入的 Wan 3.0 是什么

Wan 3.0 是 PixMind 当前接入的 Wan 视频模型系列多模态生成线路。在线产品页面将稳定线路标识为 wan3.0-video,并在同一个生成器中提供文本、图片、首尾帧、参考素材、文件和网页输入。

明确这一点很重要,因为上游模型系列可能包含已接入平台尚未开放的产品。Alibaba 文档同时列出了 wan3.0-videowan3.0-video-prime,但 PixMind 当前 API 页面只列出 wan3.0-video。上游文档可以说明技术原理,却不能证明每个上游版本都能通过 PixMind 使用。

可以将该模型理解为一组控制模式:

  • 文生视频从场景描述开始,无须提供视觉源素材。
  • 首帧图生视频从一张给定图片开始,让模型以此为起点向后生成动画。
  • 首尾帧生成同时固定镜头的起点和终点。
  • 参考素材生成通过图片、视频、音频或兼容组合来约束结果。
  • 文件或网页输入提供可用于理解任务的源材料。

可在 Wan 模型系列中心查看相关 Wan 线路;对于具体任务可用的控件,仍应以在线生成器为准。

Wan 3.0 规格速览

PixMind 当前线路兼具较长的视频时长、多类参考素材和三档分辨率。不过,下表内容应视为特定日期核实的界面事实,而不是永久不变的服务承诺。

设置 PixMind 当前页面 规划提示
模型 ID wan3.0-video 当前 API 线路请使用这一准确 ID
时长 2 至 30 秒 有视频输入时,上游规则要求输入视频时长加输出时长不超过 30 秒
分辨率 480p、720p、1080p 分辨率越高,每秒价格越高
宽高比 自适应、16:9、4:3、1:1、3:4、9:16 生成前先匹配最终发布渠道
音频 同步音频 有意识地描述声音与对白
参考图片 最多 10 张 仅保留职责明确的参考素材
参考视频 最多 5 个 上游规定合计时长不超过 15 秒
参考音频 最多 5 个 上游规定合计时长不超过 15 秒
其他来源 文件或网页 上游规则中文件与链接模式互斥
API 端点 POST /v1/generations 任务被接受时的响应会提供最终任务报价

不同来源可能从不同层级描述同一限制。PixMind 产品页写明单个参考视频最长可为 15 秒,而 Alibaba 上游 API 参考文档规定参考视频的合计时长上限为 15 秒。提供多个视频时,更稳妥的规划方式是将总时长控制在 15 秒以内。多个参考音频也应采用同样的合计时长限制。带有视频输入的请求还受另一条上游上限约束:输入视频总时长加请求输出时长不得超过 30 秒。

如何选择输入模式

选择与你最不能丢失的约束相对应的模式。输入越多并不代表控制越强,不兼容的模式还可能导致请求无效。

开放式构图使用文生视频

当新镜头不需要保留已有图片或指定首尾画面时,适合使用纯文本生成。围绕一个主要事件,说明主体、动作、地点、镜头、光线、节奏与声音。

开场画面很重要时使用首帧

首帧图生视频从已经确认的构图开始。应写清哪些元素移动、哪些元素保持稳定,以及摄像机如何运动。

需要控制起点与终点时使用首尾帧

首尾帧适合开场和结束画面都已确定的转场。Alibaba 将其视为独立模式:不要与参考媒体、文件、链接或音频输入组合使用。

连贯性或声音优先时使用参考素材

参考模式通过相关素材约束镜头。图片可以说明外观,视频可以传递运动方式,音频可以提供节奏或声音方向。这些类型可在各自限制内组合使用。

如果最大的困难是选择模型与模式,可以通过 AI Video Agent将场景需求转化为当前可用的模型选项。已经明确输入模式和参数的用户,则更适合直接使用 Wan 3.0 生成器。

参考素材限制与有效组合

Wan 3.0 支持同时使用多种参考素材,但首尾帧、文件和链接模式都有明确边界。开始精简提示词之前,应先围绕一种有效组合构建请求。

示意图以 Wan 3.0 视频工作流为中心,展示图片、视频、音频、文件和网页输入。

Alibaba 上游规则可以概括如下:

输入组合 上游支持情况 重要约束
参考图片 + 参考视频 支持 参考视频合计最长 15 秒;输入视频时长加输出时长最长 30 秒
参考图片 + 参考音频 支持 希望图片与音频共同驱动结果时的推荐组合
参考视频 + 参考音频 支持 每类媒体都应保持在各自限制内
文件 + 参考媒体 支持 文件可与兼容的参考素材一同使用
网页链接 + 参考媒体 支持 链接可与兼容的参考素材一同使用
文件 + 网页链接 不支持 两种源文档模式只能选择一种
首尾帧 + 参考媒体 不支持 首尾帧是独立模式
首尾帧 + 音频输入 不支持 需要音频驱动时改用参考图片 + 参考音频

应为每项素材指定一个明确职责,例如定义产品、背景或镜头运动。使用文件或网页时,要说明需要提取什么信息。不要假设每句话、每个价格或每条免责声明都能被准确呈现。

文档参考素材被转换为规划镜头,用于基于源材料的 Wan 3.0 视频请求。

如何在工作流中使用同步音频

同步音频是当前线路的一部分,因此需要结合画面动作规划环境音、音效、对白意图与时间点。

对于简单场景,可以将声音指令与画面指令分开:

Visual: A barista places a ceramic cup on a walnut counter as the camera makes a slow 20-degree arc.
Timing: The cup lands at 00:03 and steam becomes visible immediately after.
Audio: Quiet cafe room tone, one soft ceramic tap at 00:03, no music, no spoken dialogue.

这种结构无法保证逐帧精准同步。发布前应检查对白时机、意外语音、音乐和声音相似度。

Alibaba 上游的首尾帧模式不接受音频输入。如果必须由音频驱动生成,请使用参考图片加参考音频。如果首尾帧控制更重要,则在后续流程中添加已获得适当许可的声音。

声音权利尤其需要谨慎处理。未获得必要授权且不符合适用条款时,不要上传声音参考,也不要发布可识别的声音仿制内容。

时长、分辨率、宽高比与 API 价格

生成前应先确定交付格式,因为时长和分辨率会直接改变 API 成本,宽高比则决定构图是否适合最终渠道。2026 年 9 月 5 日核实的在线 API 价格快照为:480p 每秒 $0.050、720p 每秒 $0.090、1080p 每秒 $0.18。

以下估算仅用时长乘以当日每秒价格:

时长 480p,$0.050/秒 720p,$0.090/秒 1080p,$0.18/秒
2 秒 $0.10 $0.18 $0.36
5 秒 $0.25 $0.45 $0.90
10 秒 $0.50 $0.90 $1.80
30 秒 $1.50 $2.70 $5.40

这些数字是规划估算,不是未来请求的报价。价格和账户规则可能发生变化。当前公开参考应以在线 Wan 3.0 API 页面为准,任务被接受时返回的价格则是该任务最终采用的价格快照。

并非每个含视频条件的请求都能使用表中的 30 秒输出。根据 Alibaba 上游文档规则,当任务包含视频输入时,应从 30 秒中减去输入视频总时长,从而得到可请求的最长输出时长,并在提交前确认 PixMind 在线控件。

API 计费与 Studio 积分相互独立。不要把 Studio 积分预览换算成 API 美元价格,也不要假设 API 余额包含 Studio 权益。可先在当前定价页面查看套餐背景,再核对实际准备使用的产品页面。

渠道规划方面,16:9 适合横屏内容,9:16 适合竖屏视频,1:1 适合方形版位。自适应比例可以跟随源素材,但提前确定发布比例可以减少后续裁切。可先用 480p 低成本测试结构,在模式、节奏和构图稳定后再提高分辨率。

按控制目标组织的提示词模板

有效的提示词应说明哪些内容保持稳定、哪些内容允许变化,以及变化如何发生。以下结构并不保证特定结果。

模板 1:通过文本创建一个可控镜头

Create a [duration]-second [aspect ratio] shot.
Subject and action: [one subject performing one clear action].
Setting: [location, time, background activity].
Camera and light: [framing, movement, light direction, palette].
Timing: [start], [midpoint], [final state].
Audio: [ambience, effects, dialogue, music].
Preserve or avoid: [essential constraints].

模板 2:让已确认的首帧动起来

Use the image as the opening composition.
Keep stable: [identity, product, logo, or geometry].
Animate: [motion and final action by time].
Camera: [locked, pan, dolly, or orbit].
Audio: [sound tied to visible events].
Do not introduce: [unwanted additions].

模板 3:为多模态参考素材分配职责

Image 1 defines [subject]. Image 2 defines [setting or palette].
Video 1 defines [camera or action], not identity.
Audio 1 defines [tempo, timing, ambience, or dialogue cue].
Create a [duration]-second [ratio] scene with [one narrative beat].
Prioritize: [two constraints]. Allow variation in: [nonessential details].

模板 4:将文件或网页转化为聚焦的视频需求

Use the [file or web page] as source material.
Extract only: [approved facts or section].
Audience and goal: [viewer], [explain, introduce, or summarize].
Structure: [opening], [two beats], [final message].
Do not invent: [prices, claims, quotations, or features].
Audio: [narration, ambience, effects, music].

先运行能够验证结构的最低成本测试,再生成较长的最终版本。如果构图有问题,应精简提示词,而不是继续堆叠形容词。如果连贯性有问题,应减少参考素材并标明各自职责。如果节奏有问题,应减少事件数量,并给出更清晰的时间点。

Wan 3.0 与 Wan 2.7 对比

Wan 3.0 是新的接入目标,并不是给 Wan 2.7 请求换一个名称。当前线路使用 wan3.0-video,文档所示输出时长扩展到 30 秒,输入规划也拓展到首尾帧、参考素材、文件和网页。迁移前应重新核对参数名称、有效组合、宽高比、时长、音频、响应处理与价格。

以上只是接口迁移摘要,并非宣称 3.0 在所有质量对比中都更优。本文没有进行受控的并排生成测试。输出偏好可能取决于主体、参考素材、镜头设计与审核标准。

应保留不同版本文章的明确标识,不要直接将 Wan 2.7 完整指南悄然改名。在对运动、连贯性、提示词遵循度、声音或性价比作出结论前,仍需要进行受控对比。

Studio 与 API 工作流对比

Studio 与 API 适用于不同的操作需求,并采用相互独立的计费体系。Studio 适合交互式设置和可视化迭代;API 则适合需要重复提交、任务跟踪和程序化处理结果的应用。

Studio 工作流

打开 Wan 3.0 生成器,选择模式,仅添加兼容的源素材,并确认时长、分辨率、宽高比与在线积分预览。核对设置后再生成,导出前检查完整的视频与音频。

API 工作流

  1. 确认 wan3.0-video 可用并查看当前 API 价格。
  2. POST /v1/generations 发送一种有效的模式组合。
  3. 保存任务 ID 与被接受的价格数据,然后轮询同一任务。
  4. 验证结果,并记录参数、源素材来源和权利审批信息。

Alibaba 上游文档采用异步创建与轮询模式。除非 PixMind 明确说明,否则不要把上游任务有效期规则直接套用到 PixMind。PixMind API 快速入门解释了为什么在客户端超时后保存任务 ID 比重新提交更安全。

工作流示意图将交互式 Studio 生成与可重复的 API 任务处理分开。

局限、权利与发布检查

Wan 3.0 的输出需要人工审核,因为多模态控制并不等同于合规保证。文档界面只能说明接受哪些输入和设置,不能证明结果准确、可靠、已获得法律许可,或适合某种特定发布用途。

发布前请完成以下检查:

  • 画面与时间准确性: 将完整视频与已批准的参考素材比较,检查漂移、物体变化、错误文字或意外剪切。
  • 音频审核: 检查对白、声音相似度、时机、背景语音、音乐与音效。
  • 事实审核: 对照源文件或网页,验证由其衍生的陈述。
  • 权利审核: 确认已获得提示词、图片、视频素材、音频、人物、声音、商标、标志及其他第三方材料的必要许可。
  • 交付审核: 检查导出文件的时长、尺寸、比例、编码,以及在目标平台上的播放情况。
  • 记录保存: 保存任务被接受时的详细信息、输入来源、同意或许可记录、审核人和审批决定。

商业使用取决于付费套餐资格、适用的模型与提供商条款,以及用户是否拥有提示词、参考素材、人物、声音、标志和其他第三方材料的相应权利。生成内容并不会自动清除这些权利风险。请针对账户和使用场景查看当前定价条款服务条款;法律风险较高时,请寻求专业意见。

常见问题

首尾帧生成可以使用音频吗?

根据 Alibaba 上游文档,首尾帧模式不能使用音频输入。如果需要由音频驱动结果,请采用官方建议的参考图片加参考音频组合。如果必须固定首尾帧,则保留首尾帧模式,并在独立工作流中处理已获许可的音频。

Wan 3.0 API 生成需要多少钱?

2026 年 9 月 5 日的价格快照为:480p 每秒 $0.050、720p 每秒 $0.090、1080p 每秒 $0.18。请将这些数字视为带日期的规划依据。任务被接受时的响应会提供该任务最终采用的价格快照;API 计费与 Studio 积分相互独立。

PixMind 可以使用 wan3.0-video-prime 吗?

PixMind 当前模型页面列出的是 wan3.0-video,而不是 wan3.0-video-prime。Alibaba 将 Prime 记录为上游版本,但这不能证明它已通过 PixMind 开放。

Wan 3.0 输出可以商用吗?

商业使用有前提条件,并非自动获得许可。它取决于付费套餐资格、适用的模型与提供商条款,以及您是否拥有任务与结果中所有提示词、参考素材、人物、声音、标志和第三方材料的相应权利。

选定一项约束,先运行受控任务

开始使用 Wan 3.0 最清晰的方法,是先确定最重要的一项约束,再选择对应的输入模式。开放式构图用文本,固定开场用首帧,明确收尾用首尾帧,复用角色特征或确定声音方向用参考素材,依据源材料规划则用文件或链接。

第一次任务应足够短,以便尽快暴露结构问题。提交前确认模型 ID、参考素材、宽高比、分辨率、时长、音频、价格与权利。应检查完整结果,不要只凭缩略图判断。

确认这些决策后,可打开 Wan 3.0 生成器执行交互式任务,或访问 Wan 3.0 API 页面构建程序化工作流。每次生成时,都应重新核对在线控件与任务被接受时的价格。


Wan 3.0 对比 Wan 2.7:迁移与模型选择

继续浏览中,生成器即将加载...