Nagranie czystego lektora wymaga przyzwoitego mikrofonu, cichego pomieszczenia i — jeśli pomylisz się w połowie trzyminutowego scenariusza — cierpliwości. Zamiana tekstu na mowę omija to wszystko: wpisz swój scenariusz, wybierz głos i uzyskaj plik MP3 w kilka sekund.
Jak działa silnik zamiany tekstu na mowę
Tryb text_to_mp3 w RapidVideoMaker wykorzystuje edge-tts, ten sam silnik głosów neuronowych, który stoi za funkcją „Czytaj na głos" Microsoftu. W przeciwieństwie do starszych, mechanicznie brzmiących syntezatorów mowy, są to głosy neuronowe — naturalnie radzą sobie z tempem, intonacją i pauzami przy znakach interpunkcyjnych, co stanowi różnicę między „wyraźnie komputerem" a „wystarczająco dobrym, by opublikować".
Co możesz wygenerować
- Tekst: do 5000 znaków na żądanie (mniej więcej 800–1000 słów, kilka minut mowy)
- 48 głosów w 20 językach, każdy język oferuje od 2 do 3 głosów (męski/żeński, czasem akcenty regionalne — np. angielski amerykański i brytyjski, portugalski europejski i brazylijski)
- Opcja „wolno", która zmniejsza tempo mowy o 25%, przydatna w poradnikach lub treściach do nauki języka
- Wynik: gotowy do użycia plik MP3 — film nie jest wymagany, więc możesz wrzucić go bezpośrednio do własnego edytora, jeśli wolisz
Jak wygenerować lektora w RapidVideoMaker
- Otwórz zakładkę „Tekst na MP3" i wpisz lub wklej swój scenariusz (do 5000 znaków).
- Wybierz język, a następnie konkretny głos — możesz odsłuchać podgląd każdego głosu przed wygenerowaniem.
- Opcjonalnie włącz „wolno" dla bardziej wyważonego tempa.
- Wygeneruj. Twój plik MP3 jest od razu gotowy do pobrania.
To samo generowanie jest dostępne przez dokumentację API w trybie text_to_mp3 — wyślij text, lang (lub konkretne ID voice), bez konieczności przesyłania jakiegokolwiek pliku. Ułatwia to automatyzację generowania lektorów dla partii filmów, na przykład tworzenie narracji dla kilku klipów produktowych na podstawie arkusza scenariuszy.
Łączenie zamiany tekstu na mowę z zamianą zdjęcia w film
Typowy proces: wygeneruj lektora ze swojego scenariusza za pomocą text_to_mp3, a następnie wprowadź ten plik MP3 do image_to_video razem z jednym zdjęciem, aby uzyskać film z narracją i animowanym tekstem — bez żadnej kamery czy nagrywania.
Kilka praktycznych wskazówek
- Krótkie zdania i wyraźna interpunkcja dają bardziej naturalne tempo niż jeden długi, nieprzerwany akapit — silnik robi pauzy przy kropkach i przecinkach.
- Jeśli scenariusz musi brzmieć szczególnie wyraźnie (poradniki, instrukcje), opcja „wolno" poświęca odrobinę naturalności na rzecz zrozumiałości.
- Odsłuchaj głos na krótkiej próbce, zanim zdecydujesz się na długi scenariusz — akcenty i ton wyraźnie różnią się między 2–3 dostępnymi głosami w danym języku.
Najczęściej zadawane pytania
Czy istnieje limit znaków?
Tak, 5000 znaków na żądanie. Przy dłuższym scenariuszu podziel go na kilka żądań i połącz powstałe pliki MP3, albo zmiksuj je bezpośrednio za pomocą narzędzi audio RapidVideoMaker.
Co jeśli nie wybiorę konkretnego głosu?
Automatycznie użyty zostanie pierwszy dostępny głos dla wybranego języka.
Czy mogę wykorzystać wygenerowany głos komercyjnie?
Głosy pochodzą z silnika neuronowego edge-tts firmy Microsoft; sprawdź warunki Microsoftu dla swojego konkretnego zastosowania, jeśli planujesz redystrybuować dźwięk poza własnymi treściami wideo.