Premium 新功能:现在可以使用你的克隆声音,将超长文档、多个章节或整本电子书转换为音频。录制或上传一段声音样本,即可创建专属AI 声音。
DocsToAudioDocs to Audio
克隆声音定价
← 博客

DocsToAudio 新增 Gemini 模型:更多声音,更低成本

Google Gemini TTS 接入 DocsToAudio,积分消耗低于同档 ElevenLabs,适合有声书制作、播客多语言配音。支持法语、德语等 30 余种语言,30 种声音可在线试听选配。

DocsToAudio 现已接入 Google Gemini 语音合成模型。除了此前支持的 ElevenLabs 模型,你现在可以在调音步骤中选择 Gemini 系列——三档模型、30 种声音,广泛覆盖英语及主流欧洲语言,同时支持 30 余种其他语言。

为什么加入 Gemini?

ElevenLabs 在英语情感表现和声音克隆方面表现突出,但有两个场景它并不占优:多语言内容对成本敏感的批量转换

Gemini TTS 是 Google 原生多语言模型,在法语、德语、西班牙语、葡萄牙语等欧洲语言上的自然度与 ElevenLabs 旗鼓相当,积分消耗却明显更低。对于需要批量生产多语言有声书、录制播客脚本配音,或为在线课程制作多语言版本的创作者,Gemini Flash 能在保证播出质量的同时,大幅节省积分预算。

三档 Gemini 模型

模型 定位 适合场景
Gemini 2.5 Flash 速度快、成本低 日常转换、长文档批量处理
Gemini 2.5 Pro 质量最高 有声书、公开发布的专业音频
Gemini 2.5 Flash(最新预览版) 速度与质量平衡 追求更新模型能力的用户

如果你不确定选哪个,Gemini 2.5 Flash 是性价比最高的起点。想要更自然的语调和更细腻的情感,再升级到 Pro。

30 种声音任意搭配

Gemini 提供 30 种预设声音,名字取自天文学中的星体和卫星——Aoede、Puck、Zephyr、Kore、Fenrir、Charon 等。每种声音都有不同的音色风格,从明亮轻快到沉稳厚重都有覆盖。

在调音步骤中,可以点击声音名称旁边的播放按钮直接试听样本,确认音色风格后再开始转换,不需要先消耗积分。

覆盖 30+ 语言

Gemini 广泛支持英语及主流欧洲语言,包括法语、德语、西班牙语、葡萄牙语、意大利语、荷兰语、波兰语、俄语等,同时覆盖阿拉伯语、印地语等 30 余种语言。

如果你的内容需要转换为多个语言版本,或文档本身不是英文,Gemini 是成本更优的选择。

如何在 DocsToAudio 中使用 Gemini 模型

  1. 上传文档,完成章节分割
  2. 调音步骤中,切换到 Gemini 模型区域
  3. 选择模型档位(Flash / Pro)
  4. 浏览声音列表,点击试听,选择你喜欢的声音
  5. 查看积分预估后开始转换

整个流程与 ElevenLabs 模式一致,无需重新上传文档。

ElevenLabs 还是 Gemini?

ElevenLabs Gemini
英语情感表现 优秀 良好
多语言内容 良好(Multilingual v2) 良好,成本更低
声音克隆 支持 不支持
积分消耗 较高 较低
声音选择数量 多(含社区声音) 30 种预设

简单说:英语内容、需要情感表现或声音克隆,选 ElevenLabs;多语言内容、批量处理或预算优先,选 Gemini。

Gemini 模型现已在 DocsToAudio 正式上线,支持所有付费套餐用户使用。

还在 Gemini 和 ElevenLabs 之间权衡?参见《Gemini TTS vs ElevenLabs 详细对比》。

准备好将文档转为音频了吗?

免费试用 DocsToAudio →