Logo

Wan 3.0 Text-zu-Video Generator

Überblick

Was ist Wan 3.0 Text-zu-Video?

Text-zu-Video ist der einfachste Weg, Wan 3.0 zu nutzen, das Videomodell aus Alibabas Tongyi Lab: Du schreibst einen Prompt und schickst kein Bild und keine anderen Medien mit. Bild, Bewegung und Ton plant das Modell allein aus deinem Text.

Ein Prompt kann eine einzelne Einstellung oder ein kurzes Storyboard beschreiben. Für Clips mit mehreren Einstellungen empfiehlt Alibabas Leitfaden Shots von etwa 4 bis 6 Sekunden mit Zeitangaben, insgesamt bis zu 30 Sekunden. Dialog, Atmo und Musik entstehen zusammen mit dem Bild.

Wan3 AI ist eine unabhängige Website und kein Produkt von Alibaba. Wir nutzen Wan 3.0 über eine Drittanbieter-API und zeigen dir die Credit-Kosten jedes Clips vor dem Generieren.

Text-zu-Video auf Wan3 AI

Eingabe
Ein Text-Prompt mit bis zu 5.000 Zeichen
Cliplänge
2–30 Sekunden
Auflösung
480p, 720p oder 1080p
Seitenverhältnis
16:9, 9:16, 1:1, 4:3, 3:4 oder adaptiv
Ton
Wird mit dem Video erzeugt; abschaltbar zum gleichen Preis
Günstigste Option
14 Credits (5 s in 480p)

Fakten am 11. Oktober 2026 mit Alibabas Dokumentation abgeglichen.

So funktioniert's

Text-zu-Video in drei Schritten

  1. 01

    Einstellung beschreiben

    Sag, wer oder was im Bild ist, wo es ist, was sich bewegt und wie die Kamera folgt. Dialoge schreibst du wörtlich in Anführungszeichen.

  2. 02

    Länge und Format wählen

    Wähle 2–30 Sekunden, 480p bis 1080p und ein Seitenverhältnis. Die Credit-Kosten aktualisieren sich vor dem Absenden.

  3. 03

    Generieren und verfeinern

    Sieh dir den Clip an, ändere pro Durchgang nur eine Sache im Prompt und rendere die finale Version in höherer Auflösung. Fehlgeschlagene Generierungen werden automatisch erstattet.

Anwendungen

Was du mit Text-zu-Video machst

Szenen und Kurzdramen

Schreib eine Szene mit Figuren, Handlung und Dialog und bekomm sie als eine Einstellung mit bis zu 30 Sekunden zurück.

Konzepte und Pitches

Teste eine Werbeidee, ein Storyboard oder eine Stimmung, bevor du drehst oder ein einziges Bild gestaltest.

Social-Clips

Rendere Hochformat-Clips in 9:16 für TikTok, Reels und Shorts direkt aus einem Skript.

Erklärvideos mit Sprecher

Beschreib einen Ablauf oder einen Ort und den gewünschten Sprechertext; Stimme und Bild entstehen zusammen.

Prompt-Tipps

Bessere Text-zu-Video-Prompts

01

Motiv, Ort, Bewegung

Beginne damit, wer oder was im Bild ist, dann wo, dann was sich bewegt. Kamera, Stil und Ton ergänzt du, sobald die Grundeinstellung funktioniert.

02

Lange Takes takten

Teile längere Clips in Shots von wenigen Sekunden mit Zeitangaben (0–5 s, 5–10 s …) und sag, wie der Clip endet.

03

Ton mitschreiben

Zitiere Dialoge wörtlich, benenne die Atmo und schreib "keine Hintergrundmusik", wenn du keine willst.

FAQ

Wan 3.0 Text-zu-Video FAQ

Brauche ich für Wan 3.0 Text-zu-Video ein Bild?

Nein. Text-zu-Video nutzt nur deinen Prompt. Soll der Clip mit einem bestimmten Bild beginnen oder enden, nimm Bild-zu-Video; sollen Gesicht, Produkt oder Outfit deinen Fotos entsprechen, nimm Referenz-zu-Video.

Wie lang kann ein Text-zu-Video-Clip sein?

Jede ganze Sekundenzahl von 2 bis 30. Längere Clips kosten mehr Credits und brauchen länger zum Rendern.

Erzeugt es auch Ton?

Ja. Wan 3.0 erzeugt Dialog, Atmo und Musik zusammen mit dem Bild. Du kannst den Ton abschalten; der Preis bleibt gleich.

In welchen Sprachen kann ich Prompts schreiben?

Alibaba dokumentiert Prompts auf Englisch und Chinesisch. Schreib in einer dieser Sprachen, wenn du möglichst vorhersehbare Ergebnisse willst.

Was kostet das?

Ein 5-Sekunden-Clip kostet 14 Credits in 480p, 28 in 720p und 55 in 1080p; 30 Sekunden in 1080p kosten 329. Die genauen Kosten für deine Einstellungen siehst du vor dem Generieren, und fehlgeschlagene Generierungen werden automatisch erstattet.

Schreib deine erste Wan-3.0-Einstellung

Beschreibe eine klare Einstellung, wähle eine Länge und prüfe die Credit-Kosten vor dem Generieren.