要錄一段乾淨的配音,需要一支像樣的麥克風、一個安靜的房間——而且如果在 3 分鐘的腳本唸到一半出錯,還得有耐心重來。文字轉語音省去了這一切:輸入腳本、選擇音色,幾秒鐘內就能拿到一個 MP3 檔案。
文字轉語音引擎如何運作
RapidVideoMaker 的 text_to_mp3 模式使用 edge-tts,跟微軟「朗讀」功能背後的神經網路語音引擎相同。跟舊式生硬的語音合成不同,這些是神經網路音色——能自然處理語速、語調,並在標點符號處適當停頓,這正是「一聽就知道是機器」和「自然到可以直接發布」之間的差別。
你可以產生什麼
- 文字:每次請求最多 5000 個字元(大約 800–1000 個英文單字,幾分鐘的語音長度)
- 20 種語言、共 48 種音色,每種語言提供 2 到 3 種音色(男聲/女聲,部分還有地區口音區分——例如美式與英式英語,歐洲葡萄牙語與巴西葡萄牙語)
- 「慢速」選項,將語速降低 25%,適合教學或語言學習類內容
- 輸出:一個可直接使用的 MP3 檔案——不需要影片,你也可以直接把它匯入自己的剪輯軟體
如何用 RapidVideoMaker 產生配音
- 打開「文字轉 MP3」分頁,輸入或貼上你的腳本(最多 5000 個字元)。
- 選擇一種語言,再選擇具體的音色——產生前可以先試聽每種音色。
- 需要更從容的語速時,可以開啟「慢速」選項。
- 產生。MP3 檔案立刻就能下載。
同樣的產生功能也能透過API 文件以 text_to_mp3 模式呼叫——傳送 text、lang(或指定的 voice ID),完全不需要上傳任何檔案。這讓批次自動化產生配音變得很容易,例如根據一份腳本表格,為多支商品短片批次產生旁白。
把文字轉語音跟圖片轉影片搭配使用
一個常見的工作流程:先用 text_to_mp3 依腳本產生配音,再把這個 MP3 輸入 image_to_video,搭配一張圖片,產生一支帶動畫文字的旁白影片——完全不需要攝影機或實地錄製。
幾個實用小技巧
- 短句和清楚的標點符號,會比一整段沒有斷句的長文字節奏更自然——引擎會在句號和逗號處停頓。
- 如果腳本需要格外清楚(教學、操作說明),「慢速」選項會犧牲一點自然度來換取更好的理解度。
- 在決定使用長腳本之前,先用一小段樣本試聽某個音色——同一語言底下 2 到 3 種音色之間的口音和語氣差異可能相當明顯。
常見問題
有字元數限制嗎?
有,每次請求最多 5000 個字元。如果腳本更長,可以拆成多次請求,再把產生出來的多個 MP3 接在一起,或是直接用 RapidVideoMaker 的音訊工具合併它們。
如果我不選擇特定音色會怎樣?
系統會自動使用你所選語言中第一個可用的音色。
產生的語音可以用於商業用途嗎?
這些音色來自微軟 edge-tts 神經網路引擎;如果你打算把音訊用在自己影片內容以外的地方重新散布,請查閱微軟針對你實際使用情境的相關條款。