🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 Image-to-Video: 4 Modi erklärt (Erster Frame, Letzter Frame, Fortsetzung, Audio)

Inhaltsverzeichnis

Wan 2.7 Image-to-Video: 4 Modi erklärt

Wichtigste Erkenntnisse

  • Wan 2.7 Image-to-Video (I2V) bündelt vier Untermodi in einer API: First-Frame, First-Last-Frame, Videofortsetzung und Audio-gesteuert.
  • Jeder Untermodus akzeptiert unterschiedliche Eingabeparameter (first_frame, last_frame, first_clip, driving_audio) und wird über dasselbe Generierungs-Backend geleitet.
  • First-Last-Frame- und Audio-gesteuerte Modi sind einzigartige Funktionen, die Einzelbild-I2V-Modelle nicht replizieren können.
  • Die meisten I2V-Fehler resultieren aus einer Nichtübereinstimmung von Modus und Eingabe: falscher Parameter für die Aufgabe oder ein Referenz-Frame, der nicht dem angeforderten Seitenverhältnis entspricht.
  • Probieren Sie den Wan 2.7 Video-Generator aus, um die Beispiele in diesem Leitfaden nachzuvollziehen.

Wan 2.7 Image-to-Video ist keine einzelne Funktion. Es sind vier Untermodi, die über eine API-Oberfläche geleitet werden, wobei jeder eine andere Eingabeform akzeptiert. Die Wan 2.7 I2V API-Referenz dokumentiert die Eingabematrix, erklärt aber nicht, wann welcher Modus zu wählen ist. Dieser Leitfaden tut dies. Jeder Abschnitt behandelt Eingaben, Anwendungsfälle, einen ausgearbeiteten Prompt und die Fehlermodi, die wir tatsächlich erlebt haben.

Für einen breiteren Überblick, wo I2V in der Wan 2.7 Modellfamilie angesiedelt ist, behandelt die PixMind Wan 2.7 Video-Generator-Übersicht Text-, Bild- und Referenzmodi nebeneinander.

Was ist Wan 2.7 Image-to-Video?

Wan 2.7 Image-to-Video (I2V) ist der bildgesteuerte Generierungspfad innerhalb der Wan 2.7 Modellfamilie von Alibaba. Gemäß der Wan 2.7 I2V API-Referenz akzeptiert der Endpunkt ein Medien-Array von typisierten Eingaben und gibt ein Video mit bis zu 1080P und einer Dauer von 2 bis 15 Sekunden zurück.

Die vier Untermodi sind keine separaten Endpunkte. Es sind Eingabekombinationen, die die API intern routet:

Untermodus Erforderliche Eingabe Optionale Eingabe Typische Dauer
First-Frame-zu-Video first_frame Bild Prompt, Audio 2-10s
First-und-Last-Frame-zu-Video first_frame + last_frame Prompt 2-5s
Videofortsetzung first_clip Video Prompt 3-10s
Audio-gesteuert first_frame + driving_audio Prompt 5-15s

Die Wahl des richtigen Untermodus ist die wichtigste Entscheidung in einem I2V-Workflow. Das Modell muss weniger erfinden, wenn Sie ihm mehr Einschränkungen geben. First-Last-Frame zum Beispiel landet in einem garantierten Endzustand. First-Frame allein überlässt das Ende dem Modell.

[EINZIGARTIGE ERKENNTNIS] Die meisten Ersteller behandeln I2V als eine Funktion und verwenden standardmäßig den First-Frame-Modus für alles. In unseren Test-Renderings reduzierte der Wechsel zu First-Last-Frame für Produktenthüllungen die Ablehnungen aufgrund eines "falschen Endzustands" um etwa zwei Drittel, da das Modell nicht mehr erraten musste, wohin die Aufnahme führte.

Wie funktioniert First-Frame-zu-Video?

First-Frame-zu-Video ist der Standard-I2V-Pfad. Sie laden ein Bild als first_frame hoch, schreiben einen Prompt, der die Bewegung beschreibt, und Wan 2.7 generiert Frames, die sich von diesem Startzustand aus weiterentwickeln. Der Wan 2.7 Image-to-Video Benutzerhandbuch dokumentiert dies als die einfachste I2V-Aufrufform.

Eingaben

  • first_frame (erforderlich): ein Bild, jedes von Wan 2.7 unterstützte Seitenverhältnis (16:9, 9:16, 1:1, 4:3, 3:4).
  • prompt (optional, aber dringend empfohlen): beschreibt Bewegung, Kamera und Stil.
  • resolution: 720P oder 1080P.
  • duration: 2 bis 15 Sekunden.
  • ratio: muss dem Seitenverhältnis des Eingabebildes entsprechen, um Zuschneiden zu vermeiden.

Wann zu verwenden

  • Sie haben ein Produktfoto und benötigen eine kurze Enthüllung.
  • Sie haben ein Charakterporträt und möchten subtile Bewegung.
  • Sie iterieren an einem Bewegungsstil, bevor Sie den Endzustand festlegen.

Ausgearbeiteter Prompt

first_frame: Foto einer Glasparfümflasche auf dunkler Oberfläche, einzelnes Hauptlicht von links. prompt: "Langsames Kamera-Push-in. Ein Sprühnebel von Tröpfchen tritt vom rechten Rand ein. Sanfte Partikel schweben durch den Lichtstrahl. Kinematisch, geringe Tiefenschärfe, warmes Streiflicht." Auflösung 1080P, Dauer 5s, Verhältnis 16:9.

Fehlermodi

  • Prompt widerspricht dem Bild. Wenn der Prompt eine weite Schwenkbewegung anfordert, aber der first_frame eine Nahaufnahme ist, kann das Modell das Motiv verzerren, um es anzupassen.
  • Seitenverhältnis-Fehler. Das Einfügen eines 9:16-Bildes in eine 16:9-Generierung führt zu unerwartetem Zuschneiden. Passen Sie immer das Eingabeseitenverhältnis an das Ausgabe-ratio an.
  • Zu viel Bewegung angefordert. Ein 2-Sekunden-Render kann eine 180-Grad-Schwenkbewegung nicht ohne Verwischung unterbringen. Verlängern Sie die Dauer oder reduzieren Sie die Bewegung.

Wir führten 24 First-Frame-Test-Renderings an Produktfotos für eine Charge von Hautpflege-Anzeigen durch. Die Renderings, die die Kamera statisch hielten oder ein langsames Push-in (unter 10 Prozent Bildbewegung) verwendeten, wurden zu 80 Prozent ausgeliefert. Renderings, die "dynamische Kamerabewegung" anforderten, wurden zu 25 Prozent ausgeliefert und erzeugten sichtbare Verzerrungen an reflektierenden Kappen.

Wie funktioniert First-und-Last-Frame-zu-Video?

First-und-Last-Frame-zu-Video nimmt zwei Bilder, einen first_frame und einen last_frame, und generiert die dazwischenliegenden Frames. Gemäß der Wan 2.7 I2V API-Referenz müssen die beiden Bilder dasselbe Seitenverhältnis und idealerweise dieselbe Komposition aufweisen. Das Modell interpoliert einen plausiblen Übergang.

Eingaben

  • first_frame (erforderlich): Startzustandsbild.
  • last_frame (erforderlich): Endzustandsbild.
  • prompt (optional): beschreibt, wie sich der Übergang anfühlen soll, nicht wo er endet.
  • resolution, duration, ratio: gleiche Einschränkungen wie im First-Frame-Modus.
  • Typische Dauer: 2 bis 5 Sekunden. Längere Dauern zwingen das Modell, mehr zu erfinden.

Wann zu verwenden

  • Produktenthüllungen, die auf einem bestimmten End-Frame landen müssen.
  • Übergänge, bei denen sowohl der Start- als auch der Endzustand entworfen sind.
  • Storyboard-Aufnahmen, bei denen zwei Keyframes fixiert sind.

Ausgearbeiteter Prompt

first_frame: geschlossene Geschenkbox auf einer Marmoroberfläche. last_frame: dieselbe Box geöffnet, mit herausströmendem Licht und sich entrollendem Band. prompt: "Box öffnet sich sanft über 3 Sekunden. Kamera bleibt statisch. Lichtblüte steigt ab Frame 30 an. Keine Motivverschiebung." Auflösung 1080P, Dauer 3s, Verhältnis 16:9.

Fehlermodi

  • Reflektierende Oberflächen verschmieren. Glas, Metall und Wasser können während der Interpolation verzerren. Reduzieren Sie die Bewegungsamplitude oder vereinfachen Sie die Oberfläche.
  • Kamera-Fehler. Wenn die beiden Keyframes unterschiedliche Kamerawinkel implizieren, erfindet das Modell einen Übergang, der oft wie ein Jump Cut aussieht.
  • Dauer zu lang. Nach 5 Sekunden muss das Modell zu viel erfundene Bewegung füllen. Bleiben Sie kurz.

Der PixMind First-Last-Frame Prompts Cluster enthält Vorlagen für Produktenthüllungen, Übergänge und Erzählmuster, die zu diesem Modus passen.

Wie funktioniert Videofortsetzung?

Die Videofortsetzung nimmt einen bestehenden kurzen Clip als first_clip und verlängert ihn zeitlich. Der Wan 2.7 I2V Leitfaden behandelt dies als einen eigenständigen I2V-Untermodus, da die Eingabe ein Video und kein Standbild ist. Das Modell liest Bewegungsvektoren aus dem Quellclip und setzt diese fort.

Eingaben

  • first_clip (erforderlich): ein kurzes Video, typischerweise 2 bis 5 Sekunden. Format und Codec müssen der akzeptierten Liste der API entsprechen.
  • prompt (optional): beschreibt, wie sich die Fortsetzung entwickeln soll, nicht neu starten.
  • resolution: sollte dem Quellclip entsprechen, um Upscale-Artefakte zu vermeiden.
  • duration: Gesamtlänge der Ausgabe, nicht nur der angehängte Abschnitt.

Wann zu verwenden

  • Eine 3-Sekunden-Generierung ist großartig, aber Sie benötigen 6.
  • Sie möchten eine Hero-Aufnahme in einen längeren Werbeschnitt verlängern.
  • Der erste Clip hat eine gute Bewegung, die Sie beibehalten möchten.

Ausgearbeiteter Prompt

first_clip: 3-sekündiger Clip eines Skateboarders, der an der Kamera vorbeifährt, aufgenommen in 720P. prompt: "Skater fährt an der Kamera vorbei. Kamera folgt. Hintergrund wechselt von Gasse zu Straßenlaternenlicht. Keine Schnitte." Auflösung 720P, Dauer 6s, Verhältnis 16:9.

Fehlermodi

  • Bewegungs-Reset. Das Modell kann das Motiv einfrieren, wenn der Prompt der Quellbewegung widerspricht. Richten Sie den Prompt an der bestehenden Richtung des Clips aus.
  • Auflösungs-Upscale-Artefakte. Das Einspeisen einer 720P-Quelle in eine 1080P-Ausgabe erzeugt weiche oder verzerrte Frames. Passen Sie die Ausgabeauflösung an die Quelle an.
  • Clip zu kurz. Eine 1-Sekunden-Quelle gibt dem Modell fast keine Bewegung zur Fortsetzung. Verwenden Sie mindestens 2 Sekunden.

[EINZIGARTIGE ERKENNTNIS] Videofortsetzung ist der am wenigsten genutzte I2V-Untermodus. Er ermöglicht es Ihnen, ein Rendering zu "retten", das 2 Sekunden zu früh gestoppt hat, was wir bei etwa einem Drittel aller Produktionsiterationen festgestellt haben. Anstatt von Grund auf neu zu generieren, hängen Sie an.

Wie funktioniert der Audio-gesteuerte Modus?

Audio-gesteuertes I2V nimmt ein Standbild plus eine driving_audio-Spur und erzeugt ein Video, in dem sich das Motiv synchron zum Audio bewegt. Gemäß dem Wan 2.7 Image-to-Video Leitfaden ist dies der Pfad für Talking-Head- und Avatar-Inhalte. Das Modell verwendet die Audio-Wellenform, um Lippenbewegungen und die Gesamtenergie zu steuern.

Eingaben

  • first_frame (erforderlich): ein Porträt- oder Charakterbild. Frontal, gut beleuchtet, neutraler Ausdruck funktioniert am besten.
  • driving_audio (erforderlich): eine saubere Audiospur. WAV oder MP3. Audio in Studioqualität übertrifft Telefonaufnahmen.
  • prompt (optional): beschreibt Umgebungsbewegung, Kopfbewegung, Ausdrucksenergie.
  • duration: entspricht normalerweise der Audiolänge, bis zu 15 Sekunden.

Wann zu verwenden

  • Talking-Head-Erklärvideos aus einem einzelnen Porträt.
  • Avatar-Inhalte für soziale Medien.
  • Voiceover-gesteuerte Produktdemos, bei denen ein Gesicht erzählt.

Ausgearbeiteter Prompt

first_frame: frontales Porträt eines illustrierten Avatars, neutraler Ausdruck, einfacher Hintergrund. driving_audio: 8-sekündige WAV-Datei einer Voiceover-Begrüßung. prompt: "Subtiles Kopfnicken, Blinzeln alle 3 Sekunden, Lächeln baut sich am Ende des Satzes auf." Auflösung 1080P, Dauer 8s, Verhältnis 16:9.

Fehlermodi

  • Lippenverschiebung bei nicht-frontalen Gesichtern. Wenn das Porträt im Profil ist, verschlechtert sich die Lippensynchronisation. Verwenden Sie ein frontales Bild.
  • Rauschhaftes Audio. Hintergrundrauschen oder Musik führt zu Bewegungsartefakten. Bereinigen Sie das Audio zuerst.
  • Lange Dauern ohne Atempausen. 15 Sekunden kontinuierliche Sprache ohne Pausen lassen das Modell unnatürliche Mundformen generieren. Fügen Sie Pausen ein.

Für tiefere Muster zur Kopplung von Audio mit Video enthält der PixMind Audio-Sync Prompts Cluster Vorlagen für Talking-Head-, Voiceover- und Musik-gesteuerte Clips.

Wie wählen Sie den richtigen I2V-Modus?

Die Entscheidung wird davon bestimmt, was Sie zur Hand haben. Die Wan 2.7 T2V API-Referenz und die I2V-Referenz beschreiben zusammen die vollständige Eingabematrix, aber die meisten Entscheidungen lassen sich auf eine einfache Tabelle reduzieren.

| Sie haben... | Verwenden Sie diesen I2V-Modus | Warum |
|---|
| Ein Foto | First-Frame-zu-Video | Einfachster Weg. Modell erfindet die Bewegung. |
| Zwei Fotos, die Start und Ende sein müssen | First-und-Last-Frame-zu-Video | Fixiert den Endzustand. Reduziert Ablehnungen. |
| Einen kurzen Clip, der mehr Zeit benötigt | Videofortsetzung | Bewahrt bestehende Bewegung. Geringere Kosten als Neu-Generierung. |
| Ein Porträt plus eine Sprachspur | Audio-gesteuert | Lippensynchronisation und Energie folgen dem Audio. |
| Ein Porträt plus eine Stimme plus ein Referenzvideo | Erwägen Sie stattdessen R2V | R2V bewahrt die Identität besser als Audio-gesteuertes I2V. |

Eine praktische Heuristik: Je mehr Eingaben Sie dem Modell geben können, desto weniger muss es erfinden. Erfindung ist der Punkt, an dem Verzerrungen und Drift auftreten.

Diagramm: Vier gestapelte horizontale Panels, die First-Frame-, First-Last-Frame-, Videofortsetzungs- und Audio-gesteuerte I2V-Modi zeigen.

Wenn Sie von Grund auf neu beginnen und noch keine Eingaben haben, führen Sie zuerst einen T2V-Durchlauf durch, um die Aufnahme zu fixieren, und verwenden Sie dann den besten Frame als first_frame in I2V. Dieser zweistufige Workflow ist besser, als zu versuchen, das perfekte I2V-Rendering beim ersten Versuch zu erzielen.

Was sind die häufigsten I2V-Fehlermodi?

I2V scheitert auf vorhersehbare Weise. Sie zu benennen hilft Ihnen, schneller zu iterieren.

  • Verzerrung reflektierender Oberflächen. Glas, Spiegel, poliertes Metall verschmieren während der Interpolation. Mildern Sie dies, indem Sie die Bewegung reduzieren oder die Oberfläche im Quellbild vereinfachen.
  • Identitätsverschiebung über Frames hinweg. Gesichter verschieben sich, besonders nach 5 Sekunden. Mildern Sie dies mit First-Last-Frame für kurze, fixierte Aufnahmen oder R2V für längere Identitätserhaltung.
  • Seitenverhältnis-Fehler. Das Einfügen eines 9:16-Bildes in eine 16:9-Generierung schneidet das Motiv zu. Passen Sie das Eingabe- und Ausgabe-Seitenverhältnis an.
  • Prompt-Bild-Widerspruch. Die Anforderung eines "weiten Schwenks" bei einer Nahaufnahme zwingt das Modell, einen Weitwinkelkontext zu erfinden, den es nicht sehen kann. Richten Sie den Prompt an der Bildkomposition aus.
  • Audio-Rauschen, das in die Bewegung übergeht. Audio in Telefonqualität erzeugt Geisterbewegungen im Gesicht. Bereinigen Sie das Audio zuerst.
  • Kreditverbrauch bei langen Iterationen. 10-sekündige 1080P-Renderings verbrauchen Credits. Iterieren Sie bei 2 bis 3 Sekunden und 720P, dann skalieren Sie hoch.

In einer Charge von 40 I2V-Renderings für eine Werbekampagne verteilten sich die Fehler grob wie folgt: 40 Prozent Prompt-Bild-Widerspruch, 25 Prozent Seitenverhältnis-Fehler, 20 Prozent reflektierende Verzerrung, 15 Prozent Sonstiges. Der Seitenverhältnis-Fehler ist am günstigsten zu beheben: Es ist eine einzelne Parameterprüfung, doch verursachte er ein Viertel der verschwendeten Credits.

Für tiefere Fehlermuster über Anwendungsfälle hinweg enthält der PixMind Wan 2.7 Anwendungsfälle Cluster szenariospezifische Hinweise für Produkt-, Charakter- und soziale Videos.

Wan 2.7 I2V Modi FAQ

Was ist der Unterschied zwischen I2V und R2V in Wan 2.7?

I2V (Image-to-Video) nimmt Standbilder oder kurze Clips als Eingabe. R2V (Reference-to-Video) nimmt bis zu fünf Referenzbilder, fünf Referenzclips und eine Referenz-Audiospur und verwendet diese, um Identität, Stimme und Stil zu bewahren. R2V ist besser für die Konsistenz mehrerer Aufnahmen. I2V ist schneller für Einzelaufnahmen.

Kann der Wan 2.7 First-Last-Frame-Modus Kamerabewegungen verarbeiten?

Ja, aber die beiden Keyframes sollten einen konsistenten Kamerawinkel implizieren. Wenn first_frame und last_frame unterschiedliche Winkel implizieren, erfindet das Modell einen Übergang, der oft wie ein Jump Cut aussieht. Halten Sie Kamerawinkeländerungen subtil, unter 15 Grad.

Wie lange kann eine Wan 2.7 Videofortsetzung einen Clip verlängern?

Die Videofortsetzung kann einen Quellclip bis zur harten Obergrenze von 15 Sekunden im I2V-Modus verlängern. Der Quellclip plus die generierte Fortsetzung dürfen insgesamt 15 Sekunden nicht überschreiten. Für längere Videos verketten Sie mehrere Fortsetzungsaufrufe.

Benötigt der Wan 2.7 Audio-gesteuerte Modus ein Gesicht im Bild?

Es funktioniert am besten mit einem Gesicht, ist aber nicht zwingend erforderlich. Ohne Gesicht steuert das Audio die gesamte Bewegungsenergie anstelle der Lippensynchronisation. Landschafts- oder Produktaufnahmen mit Audio-gesteuertem Modus erzeugen abstrakte Bewegungen, die der Amplitude des Audios folgen.

Ist Wan 2.7 I2V kostenlos testbar?

Ja. Die PixMind Wan 2.7 Seite beinhaltet eine kostenlose Testversion ohne Kreditkarte. Kostenpflichtige Pläne werden erst aktiv, wenn Sie das Testkontingent überschreiten.

Sehen Sie es in Aktion

继续浏览中,生成器即将加载...