RapidVideoMaker
Kostenlos registrieren

So fügst du einem Video animierte Wort-für-Wort-Untertitel hinzu (kostenlos)

So fügst du einem Video animierte Wort-für-Wort-Untertitel hinzu (kostenlos)

Kurzvideos halten die Aufmerksamkeit aus einem Grund mehr als aus jedem anderen: Untertitel, die sich bewegen. Keine statischen Untertitel am unteren Bildrand — Wörter, die einzeln nacheinander erscheinen, synchron zur Stimme, so wie es TikToks natives Untertitel-Tool und Apps wie CapCut populär gemacht haben. Das nennt man Wort-für-Wort-Texteinblendung (oder „Karaoke-Stil"), und sie ist direkt in den Bild-zu-Video-Modus von RapidVideoMaker eingebaut.

Was die Wort-für-Wort-Einblendung tatsächlich macht

Anstatt einen ganzen Satz auf einmal zu zeigen, zeigt die Wort-für-Wort-Einblendung dein Text-Overlay ein Wort nach dem anderen, in einem festen Tempo, das du steuerst. Jedes Wort erscheint, bleibt kurz stehen und wird durch das nächste ersetzt — derselbe Rhythmus, an den Zuschauer von Kurzvideo-Untertiteln bereits gewöhnt sind, ohne das manuelle Keyframing, das ein klassischer Editor erfordern würde.

Technisch gesehen erzeugt das eine Abfolge von Overlay-Ebenen, von denen jede die bisher eingeblendeten Wörter zeigt — je mehr Wörter dein Text hat, desto mehr Ebenen stapeln sich, weshalb es eine praktische Obergrenze (50 Wörter) für die Länge einer einzelnen Einblendung gibt.

Einblendgeschwindigkeit und Animation

Zwei Einstellungen steuern, wie die Wörter erscheinen:

  • Einblendgeschwindigkeit — von 0,3 bis 5 Wörtern pro Sekunde, Standard 1,5. Langsamere Geschwindigkeiten passen zu einer nachdenklichen Stimme aus dem Off oder einem Zitat, das in Ruhe gelesen werden soll; schnellere Geschwindigkeiten passen zu einer energischen, prägnanten Erzählung.
  • Fade-Animation — jedes Wort kann sofort erscheinen oder beim Ersetzen sanft ein- und ausblenden. Fade wirkt auf einem fertigen Video hochwertiger; die sofortige Einblendung wirkt prägnanter und passt zu schnell geschnittenem Content.

Gut zu wissen: Die Wort-für-Wort-Einblendung schließt sich mit den anderen Text-Eingangsanimationen (Slide, Bounce) und mit den allgemeinen Bildschirmtext-Effekten gegenseitig aus — ihre Aktivierung deaktiviert automatisch die anderen, da das Timing auf Wortebene den Eingang bereits für dich übernimmt.

Untertitel mit einer Stimme aus dem Off synchronisieren

Die Wort-für-Wort-Einblendung ist am effektivsten, wenn das Tempo der Wörter ungefähr dem Sprechtempo darunter entspricht. Falls du noch keine Stimme aus dem Off hast, kann der Text-zu-Sprache-Modus von RapidVideoMaker eine aus einem Skript generieren, mit 48 Stimmen in 20 Sprachen — generiere zuerst die Stimme, höre dir ihr Tempo an, und stelle dann die Einblendgeschwindigkeit so ein, dass sie ungefähr einem Wort pro gesprochenem Wort entspricht.

So fügst du mit RapidVideoMaker Wort-für-Wort-Untertitel hinzu

  1. Lade ein Bild (JPG/PNG) und eine MP3 hoch — die Stimme oder den Musiktrack, um den das Video herum aufgebaut wird.
  2. Füge ein Text-Overlay hinzu: Tippe deinen Untertitel ein, wähle seine Position (oben, Mitte, unten) und wähle einen Hintergrund, falls das Bild visuell überladen ist.
  3. Stelle den Einblendmodus auf Wort-für-Wort, wähle eine Einblendgeschwindigkeit und aktiviere optional die Fade-Animation.
  4. Wähle einen Bewegungseffekt für das Bild (oder lasse es statisch) und wähle deinen Anpassungsmodus.
  5. Generieren — die Ausgabedauer entspricht genau deiner MP3, wobei die Wörter synchron zur Wiedergabe erscheinen.

Dieselben Optionen sind über die API-Dokumentation als Parameter des image_to_video-Modus verfügbar — nützlich, um beschriftete Videos im großen Maßstab aus einem Stapel von Skripten zu generieren.

Praktische Tipps

  • Halte Untertitel kurz. Mit einer Obergrenze von 50 Wörtern und einem lesbaren Tempo funktioniert die Wort-für-Wort-Einblendung am besten für einen prägnanten Aufhänger oder ein Schlüsselzitat — nicht für einen ganzen Absatz.
  • Passe die Einblendgeschwindigkeit an das tatsächliche Tempo deiner Stimme an, anstatt zu raten; eine Diskrepanz zwischen gesprochenen und eingeblendeten Wörtern lenkt mehr ab als gar keine Untertitel.
  • Verwende einen Hintergrund hinter dem Text bei Fotos mit überladenem oder hellem Hintergrund — ohne ihn wird Wort-für-Wort-Text über einem hellen Bild unleserlich, besonders auf kleineren Mobilbildschirmen.

Häufig gestellte Fragen

Kann ich die Wort-für-Wort-Einblendung mit einem langen Absatz verwenden?
Nicht wirklich — dieser Modus hat eine Obergrenze von 50 Wörtern, da jedes zusätzliche Wort eine weitere Rendering-Ebene hinzufügt. Halte den Bildschirmtext bei längerer Erzählung auf ein kurzes Highlight oder einen Schlüsselsatz, und lass die Stimme aus dem Off den Rest tragen.

Funktioniert die Wort-für-Wort-Einblendung mit jeder Schriftart oder jedem Animationsstil?
Ja, bei Position, Hintergrund und Farbe — der Einblendmodus und die Fade-Animation sind die beiden Einstellungen, die speziell für Wort-für-Wort gelten. Andere Eingangsanimationen (Slide, Bounce) werden automatisch deaktiviert, da Wort-für-Wort den Eingang bereits übernimmt.

Brauche ich eine Stimme aus dem Off, damit es gut aussieht?
Nein — es funktioniert auch nur mit Musik, auch wenn Untertitel, die zu nichts Bestimmtem synchronisiert sind, meist besser als kurzes Zitat oder Aufhänger wirken statt als langer Textfluss. Die Synchronisation mit einer Stimme aus dem Off macht den Effekt am überzeugendsten.

Ist das dasselbe wie automatische Untertitel per Spracherkennung?
Nein. Die Wort-für-Wort-Einblendung zeigt Text, den du selbst schreibst, in einer Geschwindigkeit, die du selbst einstellst — sie transkribiert Audio nicht automatisch. Kombiniere sie mit dem Text-zu-Sprache-Modus von RapidVideoMaker, wenn Stimme und Untertitel aus genau demselben Skript stammen sollen.

Bereit, deine eigenen Videos zu erstellen?

RapidVideoMaker testen