Die meisten Anleitungen behandeln jeweils eine Funktion. Diese hier ist anders: Sie zeigt, wie du drei separate Modi — Text-zu-Sprache, Bild-zu-Video und direktes Veröffentlichen — zu einem einzigen Workflow verkettest, der aus einem Foto und einem geschriebenen Skript ein veröffentlichtes Video macht, ohne je einen klassischen Videoeditor anzufassen.
Warum Modi verketten, statt sie einzeln zu nutzen
Jeder Modus für sich löst ein eng begrenztes Problem. Zusammen verkettet lösen sie ein größeres: von „Ich habe ein Foto und etwas zu sagen" zu „Es ist live auf TikTok", ohne Dateien zwischen separaten Tools zu exportieren und wieder zu importieren.
Schritt 1 — Skript schreiben und Voiceover generieren
Beginne mit Text-zu-Sprache. Schreibe auf, was gesagt werden soll — bis zu 5.000 Zeichen — und wähle eine Sprache (20 werden unterstützt), eine Stimme (weiblich oder männlich) und eine Geschwindigkeit (normal oder langsam, nützlich für dichtere oder technischere Skripte, die verständlich bleiben müssen). Das Ergebnis ist eine saubere MP3-Datei, bereit zur Verwendung als Erzählung.
Halte das Skript umgangssprachlich und kürze es auf das, was wirklich gesagt werden muss — ein zu dichtes Voiceover ist schwerer zu folgen als eines, das etwas knapper ist, besonders auf einer Plattform, auf der Menschen manchmal ohne Ton zuschauen.
Schritt 2 — Ein Foto mit diesem Voiceover in ein Video verwandeln
Nimm die in Schritt 1 generierte MP3-Datei und kombiniere sie mit einem einzelnen Bild über Bild-zu-Video. Da sich die Videodauer automatisch an die Audiospur anpasst, musst du nichts manuell timen — das Video läuft exakt so lange wie dein Voiceover.
Ein paar Entscheidungen, die hier wichtig sind:
- Aktiviere einen Bewegungseffekt (Ken Burns funktioniert für die meisten Bilder), damit das Foto nicht statisch dasteht, während das Voiceover läuft.
- Wenn dein Skript eine Schlüsselphrase enthält, die visuell hervorgehoben werden soll, füge sie als Wort-für-Wort-Textoverlay hinzu, das ungefähr synchron zur Sprache läuft.
- Wähle den Anpassungsmodus „Abdecken" (cover), wenn du ein vertikales Format wie TikTok oder Reels anstrebst und dein Ausgangsfoto nicht bereits vertikal ist.
Schritt 3 — Direkt veröffentlichen
Sobald dein Video generiert ist, veröffentliche es direkt vom gleichen Bildschirm aus auf deinen verbundenen TikTok- und/oder YouTube-Konten — kein Download, kein manuelles erneutes Hochladen. Lege deine Beschreibung fest, wähle die Datenschutzstufe, und fertig.
Wann dieser Workflow sinnvoll ist
Diese Verkettung ist besonders nützlich für:
- Ankündigungen und Zitate — ein einzelnes einprägsames Bild mit einer kurzen gesprochenen Botschaft, schnell veröffentlicht.
- Produkt-Highlights — ein Produktfoto, eine kurze gesprochene Beschreibung, veröffentlicht ohne zu filmen.
- Wiederkehrende Content-Formate — hast du dich einmal auf einen Stil festgelegt (gleicher Anpassungsmodus, gleicher Bewegungseffekt, gleiche Stimme), geht das Wiederholen des Workflows mit neuem Foto und Skript jedes Mal schnell.
Häufig gestellte Fragen
Muss ich jedes Mal alle drei Schritte nutzen?
Nein — jeder Modus funktioniert unabhängig. Dieser Workflow ist ein Vorschlag für den Fall, dass du kein Filmmaterial, aber ein Foto und etwas zu sagen hast.
Kann ich meine eigene aufgenommene Stimme statt Text-zu-Sprache verwenden?
Ja — Bild-zu-Video akzeptiert jede MP3-Datei, egal ob sie von Text-zu-Sprache generiert oder selbst aufgenommen wurde. Text-zu-Sprache erspart dir lediglich das manuelle Aufnehmen und Bearbeiten der Erzählung.
Was, wenn ich mehrere Fotos statt nur eines kombinieren möchte?
Generiere pro Foto ein Bild-zu-Video-Ergebnis (jeweils mit eigenem kurzem Voiceover-Abschnitt) und füge die entstandenen Clips anschließend vor dem Veröffentlichen mit dem Fusion-Modus zusammen.