きれいなナレーションを録音するには、まともなマイク、静かな部屋、そして——3分の原稿の途中でミスをしてしまった場合の——忍耐力が必要です。テキスト読み上げなら、そのすべてを省けます。原稿を入力し、声を選べば、数秒でMP3ファイルが手に入ります。
テキスト読み上げエンジンの仕組み
RapidVideoMakerのtext_to_mp3モードは、Microsoftの「読み上げ」機能の背後にあるのと同じニューラル音声エンジン、edge-ttsを使用しています。従来の機械的なTTSとは異なり、これらはニューラル音声です——自然な間の取り方、抑揚、句読点での間を扱えるため、「明らかにコンピューター」と「そのまま公開しても十分」の違いを生み出します。
生成できるもの
- テキスト:1リクエストあたり最大5,000文字(おおよそ800〜1,000語、数分間の音声)
- 20言語にわたる48種類の音声。各言語につき2〜3種類の音声を提供(男性・女性、地域によるアクセント違いもあります——例:米国英語と英国英語、ヨーロッパポルトガル語とブラジルポルトガル語)
- 話す速度を25%落とす「slow」オプション。チュートリアルや語学学習コンテンツに便利です
- 出力:そのまま使えるMP3ファイル——動画は不要なので、お好みで自分の編集ソフトに直接読み込むこともできます
RapidVideoMakerでナレーションを生成する方法
- 「Text to MP3」タブを開き、原稿を入力または貼り付けます(最大5,000文字)。
- 言語を選び、次に具体的な音声を選びます——生成前に各音声をプレビューできます。
- 必要に応じて「slow」を有効にし、よりゆっくりとした話し方にします。
- 生成します。MP3はすぐにダウンロードできます。
同じ生成処理は、APIドキュメントのtext_to_mp3モードからも利用できます——text、lang(または具体的なvoiceID)を送るだけで、ファイルのアップロードは一切不要です。複数の動画のナレーションを、原稿を並べたスプレッドシートから一括生成するなど、自動化しやすくなります。
テキスト読み上げと画像から動画への組み合わせ
よくあるワークフロー:原稿からtext_to_mp3でナレーションを生成し、そのMP3を1枚の画像とともにimage_to_videoに読み込み、アニメーションテキスト付きのナレーション動画を作成する——カメラも録音も一切不要です。
実践的なヒント
- 短い文とはっきりした句読点は、途切れのない長い段落よりも自然な間合いを生みます——エンジンは句点や読点で間を取ります。
- 原稿を特に聞き取りやすくしたい場合(チュートリアル、説明など)、「slow」オプションは自然さを少し犠牲にする代わりに理解しやすさを高めます。
- 長い原稿を確定する前に、短いサンプルで音声をプレビューしましょう——言語ごとに用意された2〜3種類の音声の間で、アクセントやトーンにはっきりとした違いがあります。
よくある質問
文字数に制限はありますか?
はい、1リクエストあたり5,000文字です。より長い原稿の場合は、複数のリクエストに分割して生成したMP3を連結するか、RapidVideoMakerの音声ツールで直接結合してください。
特定の音声を選ばなかった場合はどうなりますか?
選択した言語で利用可能な最初の音声が自動的に使用されます。
生成した音声を商用利用できますか?
音声はMicrosoftのedge-ttsニューラルエンジンによるものです。動画コンテンツの外で音声を再配布する予定がある場合は、具体的な用途についてMicrosoftの利用規約をご確認ください。