期間限定年間メンバーシップで30% オフさらに GPT Image、MiniMax H3 などが無制限
新登場 AI Chat · 毎日無料お試し回数を付与
今すぐアップグレード
Pixmind

Wan 3.0 動画完全ガイド:入力、音声、料金、API

目的に合う入力方式を選び、参照素材と音声を適切に管理し、Studioでの試作から安定したAPI運用へ移行する方法を紹介します。

目次

PixMindのWan 3.0は、テキスト、画像、開始・終了フレーム、参照メディア、ファイル、ウェブページから2〜30秒の動画を作成できるマルチモーダル動画生成ルートです。現在の安定版モデルIDはwan3.0-videoで、480p、720p、1080pの出力と同期音声に対応しています。

重要なのは、プロンプトを長くすることではありません。必要な制御に合う入力方式を選ぶことです。開始フレームはショットの始点を固定し、開始・終了フレームは両端を定義します。参照素材は人物・物体の特徴やスタイルを伝え、ファイルやウェブページはモデルが解釈する元資料を与えます。入力方式ごとに併用ルールが異なります。

本ガイドは2026年9月5日に、Wan 3.0の公開ジェネレーターとAPIページ、PixMindの実装、AlibabaのAPIリファレンス公式リポジトリ、Alibaba Cloudの現行モデル公開一覧を照合して事実確認しました。確認対象はインターフェースと制限です。有料ベンチマークによる速度、品質、信頼性の検証は行っていません。

本ガイドについて: PixMind編集部は、公開ページの確認、実装レビュー、モデル提供元の一次資料に基づき、現時点の製品挙動を記録しています。本記事のための有料出力ベンチマークは実施していません。

要点

  • PixMindで現在使われているモデルIDはwan3.0-videoです。上流の別バージョンや旧モデルのIDに置き換えないでください。
  • メディアを追加する前に制御方法を1つ決めます。開始と終了を厳密に指定するなら開始・終了フレーム、人物・物体の特徴やスタイルを再利用するなら参照素材、元資料に基づく構成ならファイルまたはリンクを使います。
  • 現行ルートは2〜30秒の出力、480p、720p、1080p、自動または固定アスペクト比、同期音声に対応しています。
  • 参照画像は10枚、参照動画は5本、参照音声は5本までです。Alibabaの上流リファレンスでは、参照動画の合計時間と参照音声の合計時間が、それぞれ15秒以内に制限されています。
  • 動画入力を含む場合、Alibabaの上流ルールでは、入力動画の長さと要求する出力時間の合計を30秒以内にする必要があります。
  • API料金とStudioクレジットは別会計です。APIタスクが受け付けられた時点で返される料金が、そのタスクに適用される最終的な料金スナップショットです。

このガイドの内容

PixMindで現在利用できるWan 3.0とは

Wan 3.0は、PixMindが現在接続しているWan動画モデル群のマルチモーダル生成ルートです。公開中の製品ページでは、安定版ルートをwan3.0-videoとし、テキスト、画像、開始・終了フレーム、参照素材、ファイル、ウェブ入力を1つのジェネレーターで提供しています。

この区別は重要です。上流のモデル群には、接続先プラットフォームで公開されていない製品が含まれる場合があります。Alibabaの資料にはwan3.0-videowan3.0-video-primeの両方が掲載されていますが、PixMindの現行APIページにあるのはwan3.0-videoだけです。上流資料は技術の仕組みを理解する手掛かりにはなりますが、すべての上流バージョンがPixMindで利用できる根拠にはなりません。

このモデルは、次の制御方式の集合として捉えると分かりやすくなります。

  • テキスト動画生成は、視覚的な元素材を必須とせず、シーンの説明から生成を始めます。
  • 開始フレーム画像からの動画生成は、指定した画像を起点に、その先の動きを生成します。
  • 開始・終了フレーム生成は、ショットの両端を固定します。
  • 参照ベース生成は、画像、動画、音声、または互換性のある組み合わせで結果を条件付けします。
  • ファイルまたはウェブページ入力は、リクエストの元となる資料を提供します。

関連するWanルートはWanモデルファミリーハブで確認できます。特定のタスクで利用できる操作項目については、公開中のジェネレーターを基準にしてください。

Wan 3.0の仕様早見表

現在のPixMindルートは、長尺クリップ、複数種類の参照素材、3段階の解像度に対応しています。ただし、以下の各項目は永続的なサービス保証ではなく、確認日時点のインターフェース情報です。

設定 PixMindの現行画面 設計上の注意
モデルID wan3.0-video 現行APIルートでは、このIDを正確に指定します
時間 2〜30秒 動画入力がある場合、上流ルールでは入力動画と出力時間の合計が30秒以内です
解像度 480p、720p、1080p 高い解像度ほど1秒あたりの料金が上がります
アスペクト比 自動、16:9、4:3、1:1、3:4、9:16 生成前に公開先へ合わせます
音声 同期音声 音とセリフを意図的に指定します
参照画像 最大10枚 役割が明確な素材だけを使います
参照動画 最大5本 上流では合計15秒以内です
参照音声 最大5本 上流では合計15秒以内です
その他の入力 ファイルまたはウェブページ 上流ではファイルとリンクを同時に使えません
APIエンドポイント POST /v1/generations 受け付け時のレスポンスに最終タスク料金が含まれます

同じ制限でも、情報源によって説明の粒度が異なることがあります。PixMindの製品ページには参照動画1本あたり最大15秒とありますが、Alibabaの上流APIリファレンスでは参照動画の合計時間が15秒以内です。複数の動画を渡す場合は、合計15秒以内に収めるのが安全な設計です。複数の参照音声にも、同じ合計時間の制限を適用してください。動画入力を含むリクエストには、もう1つ上流の上限があります。入力動画の合計時間と要求する出力時間を合わせて30秒以内にする必要があります。

入力方式の選び方

失いたくない制約に対応する方式を選びます。入力を増やしても自動的に制御性が高まるわけではなく、互換性のない方式を組み合わせるとリクエストが無効になることがあります。

構図を自由に決めるならテキスト動画生成

既存画像や始点・終点を維持する必要がない新規ショットには、テキストのみの生成が向いています。1つの主要な出来事を中心に、被写体、動作、場所、カメラ、照明、タイミング、音を指定します。

冒頭の画を重視するなら開始フレーム

開始フレーム画像からの動画生成では、承認済みの構図から始められます。動かすもの、固定するもの、カメラの動きを明示してください。

始点と終点を制御するなら開始・終了フレーム

開始・終了フレームは、冒頭と最後の両方が決まっているトランジションに適しています。Alibabaでは独立した方式として扱われるため、参照メディア、ファイル、リンク、音声入力とは併用しないでください。

一貫性または音を優先するなら参照素材

参照方式では、関連素材を使ってショットを条件付けします。画像は外観、動画は動き、音声はタイミングや音の方向性を伝えられます。各上限の範囲内で、これらを組み合わせることができます。

モデルや方式の選択で迷う場合は、AI Video Agentを使うと、シーンの要件から現行モデルの候補を確認できます。使いたい入力方式と設定がすでに決まっている場合は、Wan 3.0を直接操作する方が適しています。

参照素材の上限と有効な組み合わせ

Wan 3.0では複数種類の参照素材を組み合わせられますが、開始・終了フレーム、ファイル、リンクの各方式には明確な境界があります。プロンプトを調整する前に、有効な組み合わせを1つ選んでリクエストを設計してください。

Wan 3.0動画ワークフローを中心に、画像、動画、音声、ファイル、ウェブ入力を配置した図。

Alibabaの上流ルールは次のように整理できます。

入力の組み合わせ 上流での対応 重要な制限
参照画像 + 参照動画 対応 参照動画は合計15秒以内、入力動画と出力時間の合計は30秒以内
参照画像 + 参照音声 対応 画像と音声の両方で結果を制御したい場合の推奨方式です
参照動画 + 参照音声 対応 メディアの種類ごとに、それぞれの上限を守ります
ファイル + 参照メディア 対応 ファイルは互換性のある参照素材と併用できます
ウェブリンク + 参照メディア 対応 リンクは互換性のある参照素材と併用できます
ファイル + ウェブリンク 非対応 元資料の入力方式はどちらか1つを選びます
開始・終了フレーム + 参照メディア 非対応 開始・終了フレームは独立した方式です
開始・終了フレーム + 音声入力 非対応 音声で制御する場合は参照画像 + 参照音声を使います

各素材には、製品、背景、カメラワークの定義など、1つの役割を割り当てます。ファイルやページを使う場合は、抽出してほしい情報を指定してください。すべての文章、料金、注意書きが正確に再現されるとは限りません。

元資料に基づくWan 3.0動画リクエストで、ドキュメントの内容がシーン案へ変換される様子。

同期音声をワークフローへ組み込む方法

同期音声は現行ルートの機能です。画面上の動作に合わせて、環境音、効果音、セリフの意図、タイミングを設計してください。

単純なシーンでは、映像と音の指示を分けます。

Visual: A barista places a ceramic cup on a walnut counter as the camera makes a slow 20-degree arc.
Timing: The cup lands at 00:03 and steam becomes visible immediately after.
Audio: Quiet cafe room tone, one soft ceramic tap at 00:03, no music, no spoken dialogue.

この構造でも、フレーム単位の正確な同期は保証されません。公開前にセリフのタイミング、意図しない発話、音楽、声の類似性を確認してください。

Alibabaの上流にある開始・終了フレーム方式は、音声入力に対応していません。音声を生成の起点にする必要がある場合は、参照画像と参照音声を組み合わせます。開始・終了フレームを優先する場合は、適切な使用許諾を得た音を後工程で追加してください。

声に関する権利には特に注意が必要です。必要な許可を得ておらず、適用される規約にも準拠していない場合、声の参照素材をアップロードしたり、識別可能な声を模したコンテンツを公開したりしないでください。

時間、解像度、アスペクト比、API料金

生成前に納品形式を決めてください。時間と解像度はAPI費用に直結し、アスペクト比は最終公開先へ構図が合うかどうかに影響します。2026年9月5日に確認した公開API料金は、480pが1秒あたり$0.050、720pが1秒あたり$0.090、1080pが1秒あたり$0.18です。

次の金額は、動画時間に上記の1秒あたり料金を掛けた単純な試算です。

時間 480p、$0.050/秒 720p、$0.090/秒 1080p、$0.18/秒
2秒 $0.10 $0.18 $0.36
5秒 $0.25 $0.45 $0.90
10秒 $0.50 $0.90 $1.80
30秒 $1.50 $2.70 $5.40

これは計画用の試算であり、将来のリクエストに対する見積もりではありません。料金やアカウントのルールは変更される場合があります。公開情報はWan 3.0の現行APIページで確認し、個々のタスクについては、受け付け時のレスポンスに含まれる料金を最終スナップショットとして扱ってください。

動画を条件として使うすべてのリクエストで、表の30秒出力を選べるわけではありません。Alibabaの上流ドキュメントに従い、動画入力を含むタスクでは、30秒から入力動画の合計時間を差し引いて要求可能な最大出力時間を求めます。送信前にPixMindの現行操作画面でも確認してください。

API料金とStudioクレジットは別会計です。Studioに表示されたクレジットをAPIのドル料金に換算したり、API残高にStudioの利用権が含まれると判断したりしないでください。プラン全体の条件は現行の料金ページで確認し、その後、実際に使用する画面の料金を確認します。

公開先を決める際、16:9は横長、9:16は縦長、1:1は正方形の配置に適しています。自動比率は元素材に合わせられますが、公開先の比率を固定しておくと後のトリミングを減らせます。まず480pで構成を低コストにテストし、方式、タイミング、構図が固まってから解像度を上げると効率的です。

制御目的別のプロンプトテンプレート

優れたプロンプトは、維持する要素、変更してよい要素、変化の進み方を定義します。次の構成を使っても、特定の結果が保証されるわけではありません。

テンプレート1:テキストから1つのショットを制御する

Create a [duration]-second [aspect ratio] shot.
Subject and action: [one subject performing one clear action].
Setting: [location, time, background activity].
Camera and light: [framing, movement, light direction, palette].
Timing: [start], [midpoint], [final state].
Audio: [ambience, effects, dialogue, music].
Preserve or avoid: [essential constraints].

テンプレート2:承認済みの開始フレームを動かす

Use the image as the opening composition.
Keep stable: [identity, product, logo, or geometry].
Animate: [motion and final action by time].
Camera: [locked, pan, dolly, or orbit].
Audio: [sound tied to visible events].
Do not introduce: [unwanted additions].

テンプレート3:マルチモーダル参照素材に役割を割り当てる

Image 1 defines [subject]. Image 2 defines [setting or palette].
Video 1 defines [camera or action], not identity.
Audio 1 defines [tempo, timing, ambience, or dialogue cue].
Create a [duration]-second [ratio] scene with [one narrative beat].
Prioritize: [two constraints]. Allow variation in: [nonessential details].

テンプレート4:ファイルやウェブページから焦点の定まった動画案を作る

Use the [file or web page] as source material.
Extract only: [approved facts or section].
Audience and goal: [viewer], [explain, introduce, or summarize].
Structure: [opening], [two beats], [final message].
Do not invent: [prices, claims, quotations, or features].
Audio: [narration, ambience, effects, music].

長い最終版を生成する前に、構造を確認できる最も低コストなテストを実行します。構図が悪い場合は、形容詞を増やすのではなくプロンプトを短くします。一貫性に問題がある場合は、参照素材を減らし、それぞれの役割を明示します。タイミングに問題がある場合は、出来事を減らし、時点を明確に指定します。

Wan 3.0とWan 2.7の違い

Wan 3.0は新しい接続先であり、Wan 2.7のリクエスト名を変えただけのものではありません。現行ルートはwan3.0-videoを使い、資料上の出力時間が30秒に延び、開始・終了フレーム、参照素材、ファイル、ウェブページまで入力の選択肢が広がっています。移行前に、パラメータ名、有効な組み合わせ、アスペクト比、時間、音声、レスポンス処理、料金を改めて確認してください。

これはインターフェース移行の概要であり、3.0があらゆる品質比較で優れているという主張ではありません。本ガイドでは、同一条件での比較生成を行っていません。好ましい出力は、被写体、参照素材、ショット設計、評価基準によって変わる可能性があります。

バージョン別の記事は明確に区別し、Wan 2.7完全ガイドを黙って改名しないでください。動き、一貫性、プロンプトへの追従性、音、費用対効果を評価するには、条件をそろえた比較が必要です。

StudioとAPIのワークフロー

StudioとAPIは用途が異なり、課金も別です。Studioは対話的な設定と画面上での試行に向いています。APIは、送信、タスク追跡、結果処理を繰り返しプログラムから実行するアプリケーションに適しています。

Studioのワークフロー

Wan 3.0ジェネレーターを開き、方式を選び、互換性のある元素材だけを添付します。時間、解像度、アスペクト比、現行のクレジット表示を確認してから生成し、書き出す前に動画と音声を最後まで確認してください。

APIのワークフロー

  1. wan3.0-videoが利用可能か確認し、現在のAPI料金を確認します。
  2. 有効な方式の組み合わせを1つ選び、POST /v1/generationsへ送信します。
  3. タスクIDと受け付け時の料金情報を保存し、同じタスクをポーリングします。
  4. 結果を検証し、パラメータ、元素材の出所、権利承認を記録します。

Alibabaの上流資料では、非同期でタスクを作成してポーリングします。PixMindが明示していない限り、上流のタスク有効期限をPixMindへそのまま当てはめないでください。PixMind APIクイックスタートでは、クライアントのタイムアウト後に再送信するより、タスクIDを保存する方が安全な理由を説明しています。

対話的なStudio生成と、再現性のあるAPIタスク処理を分けて示したワークフロー図。

制限、権利、公開前チェック

マルチモーダル制御はコンプライアンスを保証するものではないため、Wan 3.0の出力には人による確認が必要です。仕様として公開されたインターフェースから分かるのは、受け付ける入力と設定までです。正確性、信頼性、法的許諾、特定の公開用途への適合性は保証されません。

公開前に次の項目を確認してください。

  • 映像と時間の正確性: 動画全体を承認済みの参照素材と比較し、ずれ、物体の変化、文字の誤り、意図しないカットを確認します。
  • 音声確認: セリフ、声の類似性、タイミング、背景の発話、音楽、効果音を確認します。
  • 事実確認: ファイルやページから生成された主張を元資料と照合します。
  • 権利確認: プロンプト、画像、映像、音声、人物、声、商標、ロゴ、その他の第三者素材について必要な許可があることを確認します。
  • 納品確認: 書き出したファイルの時間、寸法、比率、エンコード、公開先での再生状態を確認します。
  • 記録管理: 受け付け時のタスク詳細、入力素材の出所、同意書またはライセンス、確認担当者、承認結果を保存します。

商用利用の可否は、有料プランの利用資格、適用されるモデル・提供元の規約、プロンプト、参照素材、人物、声、ロゴ、その他の第三者素材に対して利用者が有する権利によって決まります。生成しただけで第三者の権利が自動的に処理されるわけではありません。アカウントと用途に応じて現行の料金条件利用規約を確認し、法的リスクが高い場合は専門家へ相談してください。

よくある質問

開始・終了フレーム生成で音声を使えますか?

Alibabaの上流資料にある開始・終了フレーム方式では、音声入力として利用できません。音声で結果を制御する場合は、公式資料にある参照画像と参照音声の組み合わせを使います。開始・終了フレームが必須の場合は、その方式を維持し、使用許諾を得た音声を別工程で追加してください。

Wan 3.0 APIの生成料金はいくらですか?

2026年9月5日時点の料金スナップショットは、480pが1秒あたり$0.050、720pが1秒あたり$0.090、1080pが1秒あたり$0.18です。日付付きの計画値として扱ってください。タスクが受け付けられた際のレスポンスに、そのタスクの最終料金スナップショットが含まれます。API料金とStudioクレジットは別会計です。

PixMindでwan3.0-video-primeを利用できますか?

PixMindの現行モデルページに掲載されているのはwan3.0-videoであり、wan3.0-video-primeではありません。AlibabaはPrimeを上流のバージョンとして公開していますが、それだけでPixMindから利用できるとは判断できません。

Wan 3.0の出力を商用利用できますか?

商用利用は条件付きであり、自動的に許諾されるものではありません。有料プランの利用資格、適用されるモデル・提供元の規約、タスクと結果に含まれるすべてのプロンプト、参照素材、人物、声、ロゴ、第三者素材について保有する権利によって決まります。

最優先の制約を1つ選び、管理しやすいタスクから始める

Wan 3.0を使い始める最も分かりやすい方法は、最も重要な制約を1つ選び、それに対応する入力方式を指定することです。自由な構図ならテキスト、冒頭を固定するなら開始フレーム、最後まで定めるなら開始・終了フレーム、人物・物体の特徴や音の方向性を再利用するなら参照素材、元資料に基づく構成ならファイルまたはリンクを使います。

最初のタスクは、構造上の問題を確認できる程度に短くします。送信前にモデルID、参照素材、アスペクト比、解像度、時間、音声、料金、権利を確認してください。サムネイルだけで判断せず、結果を最後まで確認します。

方針が決まったら、対話的に作成する場合はWan 3.0ジェネレーター、プログラムから運用する場合はWan 3.0 APIページを開きます。生成時には、公開中の操作項目とタスク受け付け時の料金を改めて確認してください。


Wan 3.0 vs Wan 2.7:移行とモデル選択ガイド

继续浏览中,生成器即将加载...