Premium 新功能:現在可以使用你的克隆聲音,將超長文件、多個章節或整本電子書轉換為音訊。錄製或上傳一段聲音樣本,即可建立專屬 AI 聲音。
DocsToAudioDocs to Audio
複製聲音定價
← 部落格

DocsToAudio 新增 Gemini 模型:更多聲音,更低成本

Google Gemini TTS 整合至 DocsToAudio,點數消耗低於同檔 ElevenLabs,適合有聲書製作、Podcast 多語言配音。支援法語、德語等 30 餘種語言,30 種聲音可線上試聽選配。

DocsToAudio 現已整合 Google Gemini 語音合成模型。除了先前支援的 ElevenLabs 模型,你現在可以在調音步驟中選擇 Gemini 系列——三檔模型、30 種聲音,廣泛涵蓋英語及主流歐洲語言,同時支援 30 餘種其他語言。

為什麼加入 Gemini?

ElevenLabs 在英語情感表現和聲音複製方面表現出色,但有兩個場景它並不佔優:多語言內容對成本敏感的批次轉換

Gemini TTS 是 Google 原生多語言模型,在法語、德語、西班牙語、葡萄牙語等歐洲語言上的自然度與 ElevenLabs 旗鼓相當,點數消耗卻明顯更低。對於需要批量製作多語言有聲書、錄製 Podcast 腳本配音,或為線上課程製作多語言版本的創作者,Gemini Flash 能在保證播出品質的同時,大幅節省點數預算。

三檔 Gemini 模型

模型 定位 適合場景
Gemini 2.5 Flash 速度快、成本低 日常轉換、長文件批次處理
Gemini 2.5 Pro 品質最高 有聲書、公開發布的專業音訊
Gemini 2.5 Flash(最新預覽版) 速度與品質平衡 追求更新模型能力的使用者

如果你不確定選哪個,Gemini 2.5 Flash 是性價比最高的起點。想要更自然的語調和更細膩的情感,再升級到 Pro。

30 種聲音任意搭配

Gemini 提供 30 種預設聲音,名字取自天文學中的星體和衛星——Aoede、Puck、Zephyr、Kore、Fenrir、Charon 等。每種聲音都有不同的音色風格,從明亮輕快到沉穩厚重都有涵蓋。

在調音步驟中,可以點選聲音名稱旁邊的播放按鈕直接試聽樣本,確認音色風格後再開始轉換,不需要先消耗積分。

覆蓋 30+ 種語言

Gemini 廣泛支援英語及主流歐洲語言,包括法語、德語、西班牙語、葡萄牙語、義大利語、荷蘭語、波蘭語、俄語等,同時涵蓋阿拉伯語、印地語等 30 餘種語言。

如果你的內容需要轉換為多個語言版本,或文件本身不是英文,Gemini 是成本更優的選擇。

如何在 DocsToAudio 中使用 Gemini 模型

  1. 上傳文件,完成章節分割
  2. 調音步驟中,切換到 Gemini 模型區域
  3. 選擇模型檔位(Flash / Pro)
  4. 瀏覽聲音清單,點選試聽,選擇你喜歡的聲音
  5. 查看積分預估後開始轉換

整個流程與 ElevenLabs 模式一致,無需重新上傳文件。

ElevenLabs 還是 Gemini?

ElevenLabs Gemini
英語情感表現 優秀 良好
多語言內容 良好(Multilingual v2) 良好,成本更低
聲音複製 支援 不支援
積分消耗 較高 較低
聲音選擇數量 多(含社群聲音) 30 種預設

簡單說:英語內容、需要情感表現或聲音複製,選 ElevenLabs;多語言內容、批次處理或預算優先,選 Gemini。

Gemini 模型現已在 DocsToAudio 正式上線,支援所有付費方案使用者使用。

還在 Gemini 和 ElevenLabs 之間權衡?請參見《Gemini TTS vs ElevenLabs 詳細比較》。

準備好將文件轉為音頻了嗎?

免費試用 DocsToAudio →