RapidVideoMaker
免費註冊

免費影片文字轉語音:48 種音色,20 種語言

免費影片文字轉語音:48 種音色,20 種語言

要錄一段乾淨的配音,需要一支像樣的麥克風、一個安靜的房間——而且如果在 3 分鐘的腳本唸到一半出錯,還得有耐心重來。文字轉語音省去了這一切:輸入腳本、選擇音色,幾秒鐘內就能拿到一個 MP3 檔案。

文字轉語音引擎如何運作

RapidVideoMaker 的 text_to_mp3 模式使用 edge-tts,跟微軟「朗讀」功能背後的神經網路語音引擎相同。跟舊式生硬的語音合成不同,這些是神經網路音色——能自然處理語速、語調,並在標點符號處適當停頓,這正是「一聽就知道是機器」和「自然到可以直接發布」之間的差別。

你可以產生什麼

  • 文字:每次請求最多 5000 個字元(大約 800–1000 個英文單字,幾分鐘的語音長度)
  • 20 種語言、共 48 種音色,每種語言提供 2 到 3 種音色(男聲/女聲,部分還有地區口音區分——例如美式與英式英語,歐洲葡萄牙語與巴西葡萄牙語)
  • 「慢速」選項,將語速降低 25%,適合教學或語言學習類內容
  • 輸出:一個可直接使用的 MP3 檔案——不需要影片,你也可以直接把它匯入自己的剪輯軟體

如何用 RapidVideoMaker 產生配音

  1. 打開「文字轉 MP3」分頁,輸入或貼上你的腳本(最多 5000 個字元)。
  2. 選擇一種語言,再選擇具體的音色——產生前可以先試聽每種音色。
  3. 需要更從容的語速時,可以開啟「慢速」選項。
  4. 產生。MP3 檔案立刻就能下載。

同樣的產生功能也能透過API 文件text_to_mp3 模式呼叫——傳送 textlang(或指定的 voice ID),完全不需要上傳任何檔案。這讓批次自動化產生配音變得很容易,例如根據一份腳本表格,為多支商品短片批次產生旁白。

把文字轉語音跟圖片轉影片搭配使用

一個常見的工作流程:先用 text_to_mp3 依腳本產生配音,再把這個 MP3 輸入 image_to_video,搭配一張圖片,產生一支帶動畫文字的旁白影片——完全不需要攝影機或實地錄製。

幾個實用小技巧

  • 短句和清楚的標點符號,會比一整段沒有斷句的長文字節奏更自然——引擎會在句號和逗號處停頓。
  • 如果腳本需要格外清楚(教學、操作說明),「慢速」選項會犧牲一點自然度來換取更好的理解度。
  • 在決定使用長腳本之前,先用一小段樣本試聽某個音色——同一語言底下 2 到 3 種音色之間的口音和語氣差異可能相當明顯。

常見問題

有字元數限制嗎?
有,每次請求最多 5000 個字元。如果腳本更長,可以拆成多次請求,再把產生出來的多個 MP3 接在一起,或是直接用 RapidVideoMaker 的音訊工具合併它們。

如果我不選擇特定音色會怎樣?
系統會自動使用你所選語言中第一個可用的音色。

產生的語音可以用於商業用途嗎?
這些音色來自微軟 edge-tts 神經網路引擎;如果你打算把音訊用在自己影片內容以外的地方重新散布,請查閱微軟針對你實際使用情境的相關條款。

準備好製作您自己的影片了嗎?

試用 RapidVideoMaker