DocsToAudio 新增 Gemini 模型:更多聲音,更低成本
Google Gemini TTS 整合至 DocsToAudio,點數消耗低於同檔 ElevenLabs,適合有聲書製作、Podcast 多語言配音。支援法語、德語等 30 餘種語言,30 種聲音可線上試聽選配。
DocsToAudio 現已整合 Google Gemini 語音合成模型。除了先前支援的 ElevenLabs 模型,你現在可以在調音步驟中選擇 Gemini 系列——三檔模型、30 種聲音,廣泛涵蓋英語及主流歐洲語言,同時支援 30 餘種其他語言。
為什麼加入 Gemini?
ElevenLabs 在英語情感表現和聲音複製方面表現出色,但有兩個場景它並不佔優:多語言內容和對成本敏感的批次轉換。
Gemini TTS 是 Google 原生多語言模型,在法語、德語、西班牙語、葡萄牙語等歐洲語言上的自然度與 ElevenLabs 旗鼓相當,點數消耗卻明顯更低。對於需要批量製作多語言有聲書、錄製 Podcast 腳本配音,或為線上課程製作多語言版本的創作者,Gemini Flash 能在保證播出品質的同時,大幅節省點數預算。
三檔 Gemini 模型
| 模型 | 定位 | 適合場景 |
|---|---|---|
| Gemini 2.5 Flash | 速度快、成本低 | 日常轉換、長文件批次處理 |
| Gemini 2.5 Pro | 品質最高 | 有聲書、公開發布的專業音訊 |
| Gemini 2.5 Flash(最新預覽版) | 速度與品質平衡 | 追求更新模型能力的使用者 |
如果你不確定選哪個,Gemini 2.5 Flash 是性價比最高的起點。想要更自然的語調和更細膩的情感,再升級到 Pro。
30 種聲音任意搭配
Gemini 提供 30 種預設聲音,名字取自天文學中的星體和衛星——Aoede、Puck、Zephyr、Kore、Fenrir、Charon 等。每種聲音都有不同的音色風格,從明亮輕快到沉穩厚重都有涵蓋。
在調音步驟中,可以點選聲音名稱旁邊的播放按鈕直接試聽樣本,確認音色風格後再開始轉換,不需要先消耗積分。
覆蓋 30+ 種語言
Gemini 廣泛支援英語及主流歐洲語言,包括法語、德語、西班牙語、葡萄牙語、義大利語、荷蘭語、波蘭語、俄語等,同時涵蓋阿拉伯語、印地語等 30 餘種語言。
如果你的內容需要轉換為多個語言版本,或文件本身不是英文,Gemini 是成本更優的選擇。
如何在 DocsToAudio 中使用 Gemini 模型
- 上傳文件,完成章節分割
- 在調音步驟中,切換到 Gemini 模型區域
- 選擇模型檔位(Flash / Pro)
- 瀏覽聲音清單,點選試聽,選擇你喜歡的聲音
- 查看積分預估後開始轉換
整個流程與 ElevenLabs 模式一致,無需重新上傳文件。
ElevenLabs 還是 Gemini?
| ElevenLabs | Gemini | |
|---|---|---|
| 英語情感表現 | 優秀 | 良好 |
| 多語言內容 | 良好(Multilingual v2) | 良好,成本更低 |
| 聲音複製 | 支援 | 不支援 |
| 積分消耗 | 較高 | 較低 |
| 聲音選擇數量 | 多(含社群聲音) | 30 種預設 |
簡單說:英語內容、需要情感表現或聲音複製,選 ElevenLabs;多語言內容、批次處理或預算優先,選 Gemini。
Gemini 模型現已在 DocsToAudio 正式上線,支援所有付費方案使用者使用。
還在 Gemini 和 ElevenLabs 之間權衡?請參見《Gemini TTS vs ElevenLabs 詳細比較》。
準備好將文件轉為音頻了嗎?
免費試用 DocsToAudio →