Enregistrer une voix off propre demande un micro correct, une pièce silencieuse, et — si vous vous trompez au milieu d'un script de 3 minutes — de la patience. La synthèse vocale évite tout ça : tapez votre texte, choisissez une voix, et obtenez un fichier MP3 en quelques secondes.
Comment fonctionne le moteur de synthèse vocale
Le mode text_to_mp3 de RapidVideoMaker utilise edge-tts, le même moteur de voix neuronales que la fonction « Lire à voix haute » de Microsoft. Contrairement aux anciennes voix synthétiques robotiques, ce sont des voix neuronales — elles gèrent naturellement le rythme, l'intonation et les pauses à la ponctuation, ce qui fait toute la différence entre « clairement un ordinateur » et « assez bon pour être publié ».
Ce que vous pouvez générer
- Texte : jusqu'à 5 000 caractères par requête (environ 800 à 1 000 mots, plusieurs minutes de voix)
- 48 voix réparties sur 20 langues, chaque langue proposant 2 à 3 voix (homme/femme, parfois des accents régionaux — ex : anglais US et UK, portugais européen et brésilien)
- Une option « lent » qui réduit le débit de 25%, utile pour des tutoriels ou du contenu d'apprentissage de langue
- Sortie : un fichier MP3 prêt à l'emploi — pas besoin de vidéo, vous pouvez l'intégrer directement dans votre propre logiciel de montage si vous préférez
Comment générer une voix off avec RapidVideoMaker
- Ouvrez l'onglet « Texte en MP3 » et tapez ou collez votre texte (jusqu'à 5 000 caractères).
- Choisissez une langue, puis une voix précise — vous pouvez écouter un aperçu de chaque voix avant de générer.
- Activez éventuellement l'option « lent » pour un débit plus posé.
- Générez. Votre MP3 est prêt à télécharger immédiatement.
La même génération est accessible via la documentation API avec le mode text_to_mp3 — envoyez text, lang (ou un voice précis), aucun fichier à uploader. Cela permet d'automatiser facilement la création de voix off pour un lot de vidéos, par exemple générer la narration de plusieurs vidéos produit à partir d'un tableur de scripts.
Combiner synthèse vocale et image vers vidéo
Un flux courant : générez une voix off à partir de votre script avec text_to_mp3, puis utilisez ce MP3 dans image_to_video avec une seule image pour produire une vidéo narrée avec texte animé — sans caméra ni enregistrement.
Quelques conseils pratiques
- Des phrases courtes et une ponctuation claire donnent un rythme plus naturel qu'un long paragraphe sans coupure — le moteur marque une pause sur les points et virgules.
- Si un script doit être particulièrement clair (tutoriels, instructions), l'option « lent » sacrifie un peu de naturel au profit de la compréhension.
- Écoutez un aperçu de la voix sur un court extrait avant de valider un long script — l'accent et le ton varient sensiblement entre les 2-3 voix disponibles par langue.
Questions fréquentes
Y a-t-il une limite de caractères ?
Oui, 5 000 caractères par requête. Pour un script plus long, découpez-le en plusieurs requêtes et concaténez les MP3 obtenus, ou fusionnez-les directement avec les outils audio de RapidVideoMaker.
Que se passe-t-il si je ne choisis pas de voix précise ?
La première voix disponible pour la langue sélectionnée est utilisée automatiquement.
Puis-je utiliser la voix générée à des fins commerciales ?
Les voix proviennent du moteur de voix neuronales edge-tts de Microsoft ; vérifiez les conditions d'utilisation de Microsoft pour votre cas d'usage précis si vous comptez redistribuer l'audio en dehors de votre propre contenu vidéo.