Szenen und Kurzdramen
Schreib eine Szene mit Figuren, Handlung und Dialog und bekomm sie als eine Einstellung mit bis zu 30 Sekunden zurück.
Wan3 AIBeschreibe eine Einstellung, und Wan 3.0 rendert 2–30 Sekunden in bis zu 1080p mit Ton. Kein Bild nötig.
Text-zu-Video ist der einfachste Weg, Wan 3.0 zu nutzen, das Videomodell aus Alibabas Tongyi Lab: Du schreibst einen Prompt und schickst kein Bild und keine anderen Medien mit. Bild, Bewegung und Ton plant das Modell allein aus deinem Text.
Ein Prompt kann eine einzelne Einstellung oder ein kurzes Storyboard beschreiben. Für Clips mit mehreren Einstellungen empfiehlt Alibabas Leitfaden Shots von etwa 4 bis 6 Sekunden mit Zeitangaben, insgesamt bis zu 30 Sekunden. Dialog, Atmo und Musik entstehen zusammen mit dem Bild.
Wan3 AI ist eine unabhängige Website und kein Produkt von Alibaba. Wir nutzen Wan 3.0 über eine Drittanbieter-API und zeigen dir die Credit-Kosten jedes Clips vor dem Generieren.
Fakten am 11. Oktober 2026 mit Alibabas Dokumentation abgeglichen.
Der Generator steht oben auf dieser Seite, Text-zu-Video ist bereits ausgewählt.
Sag, wer oder was im Bild ist, wo es ist, was sich bewegt und wie die Kamera folgt. Dialoge schreibst du wörtlich in Anführungszeichen.
Wähle 2–30 Sekunden, 480p bis 1080p und ein Seitenverhältnis. Die Credit-Kosten aktualisieren sich vor dem Absenden.
Sieh dir den Clip an, ändere pro Durchgang nur eine Sache im Prompt und rendere die finale Version in höherer Auflösung. Fehlgeschlagene Generierungen werden automatisch erstattet.
Schreib eine Szene mit Figuren, Handlung und Dialog und bekomm sie als eine Einstellung mit bis zu 30 Sekunden zurück.
Teste eine Werbeidee, ein Storyboard oder eine Stimmung, bevor du drehst oder ein einziges Bild gestaltest.
Rendere Hochformat-Clips in 9:16 für TikTok, Reels und Shorts direkt aus einem Skript.
Beschreib einen Ablauf oder einen Ort und den gewünschten Sprechertext; Stimme und Bild entstehen zusammen.
Gewohnheiten auf Basis von Alibabas Prompt-Empfehlungen für Wan 3.0.
Beginne damit, wer oder was im Bild ist, dann wo, dann was sich bewegt. Kamera, Stil und Ton ergänzt du, sobald die Grundeinstellung funktioniert.
Teile längere Clips in Shots von wenigen Sekunden mit Zeitangaben (0–5 s, 5–10 s …) und sag, wie der Clip endet.
Zitiere Dialoge wörtlich, benenne die Atmo und schreib "keine Hintergrundmusik", wenn du keine willst.
Nein. Text-zu-Video nutzt nur deinen Prompt. Soll der Clip mit einem bestimmten Bild beginnen oder enden, nimm Bild-zu-Video; sollen Gesicht, Produkt oder Outfit deinen Fotos entsprechen, nimm Referenz-zu-Video.
Jede ganze Sekundenzahl von 2 bis 30. Längere Clips kosten mehr Credits und brauchen länger zum Rendern.
Ja. Wan 3.0 erzeugt Dialog, Atmo und Musik zusammen mit dem Bild. Du kannst den Ton abschalten; der Preis bleibt gleich.
Alibaba dokumentiert Prompts auf Englisch und Chinesisch. Schreib in einer dieser Sprachen, wenn du möglichst vorhersehbare Ergebnisse willst.
Ein 5-Sekunden-Clip kostet 14 Credits in 480p, 28 in 720p und 55 in 1080p; 30 Sekunden in 1080p kosten 329. Die genauen Kosten für deine Einstellungen siehst du vor dem Generieren, und fehlgeschlagene Generierungen werden automatisch erstattet.
Animiere ein Foto als erstes Frame, mit optionalem letzten Frame.
Bild-zu-Video öffnenHalte Gesichter, Produkte und Outfits aus bis zu 9 Bildern in einer neuen Szene konsistent.
Referenz-zu-Video öffnenAlle Wan-Modelle an einem Ort, auch Wan 2.6.
Zum GeneratorStöbere durch Prompts mit Vorschau-Clips und öffne jeden davon direkt im Generator.
Prompts ansehenBeschreibe eine klare Einstellung, wähle eine Länge und prüfe die Credit-Kosten vor dem Generieren.