DocsToAudio 新增 Gemini 模型:更多声音,更低成本
Google Gemini TTS 接入 DocsToAudio,积分消耗低于同档 ElevenLabs,适合有声书制作、播客多语言配音。支持法语、德语等 30 余种语言,30 种声音可在线试听选配。
DocsToAudio 现已接入 Google Gemini 语音合成模型。除了此前支持的 ElevenLabs 模型,你现在可以在调音步骤中选择 Gemini 系列——三档模型、30 种声音,广泛覆盖英语及主流欧洲语言,同时支持 30 余种其他语言。
为什么加入 Gemini?
ElevenLabs 在英语情感表现和声音克隆方面表现突出,但有两个场景它并不占优:多语言内容和对成本敏感的批量转换。
Gemini TTS 是 Google 原生多语言模型,在法语、德语、西班牙语、葡萄牙语等欧洲语言上的自然度与 ElevenLabs 旗鼓相当,积分消耗却明显更低。对于需要批量生产多语言有声书、录制播客脚本配音,或为在线课程制作多语言版本的创作者,Gemini Flash 能在保证播出质量的同时,大幅节省积分预算。
三档 Gemini 模型
| 模型 | 定位 | 适合场景 |
|---|---|---|
| Gemini 2.5 Flash | 速度快、成本低 | 日常转换、长文档批量处理 |
| Gemini 2.5 Pro | 质量最高 | 有声书、公开发布的专业音频 |
| Gemini 2.5 Flash(最新预览版) | 速度与质量平衡 | 追求更新模型能力的用户 |
如果你不确定选哪个,Gemini 2.5 Flash 是性价比最高的起点。想要更自然的语调和更细腻的情感,再升级到 Pro。
30 种声音任意搭配
Gemini 提供 30 种预设声音,名字取自天文学中的星体和卫星——Aoede、Puck、Zephyr、Kore、Fenrir、Charon 等。每种声音都有不同的音色风格,从明亮轻快到沉稳厚重都有覆盖。
在调音步骤中,可以点击声音名称旁边的播放按钮直接试听样本,确认音色风格后再开始转换,不需要先消耗积分。
覆盖 30+ 语言
Gemini 广泛支持英语及主流欧洲语言,包括法语、德语、西班牙语、葡萄牙语、意大利语、荷兰语、波兰语、俄语等,同时覆盖阿拉伯语、印地语等 30 余种语言。
如果你的内容需要转换为多个语言版本,或文档本身不是英文,Gemini 是成本更优的选择。
如何在 DocsToAudio 中使用 Gemini 模型
- 上传文档,完成章节分割
- 在调音步骤中,切换到 Gemini 模型区域
- 选择模型档位(Flash / Pro)
- 浏览声音列表,点击试听,选择你喜欢的声音
- 查看积分预估后开始转换
整个流程与 ElevenLabs 模式一致,无需重新上传文档。
ElevenLabs 还是 Gemini?
| ElevenLabs | Gemini | |
|---|---|---|
| 英语情感表现 | 优秀 | 良好 |
| 多语言内容 | 良好(Multilingual v2) | 良好,成本更低 |
| 声音克隆 | 支持 | 不支持 |
| 积分消耗 | 较高 | 较低 |
| 声音选择数量 | 多(含社区声音) | 30 种预设 |
简单说:英语内容、需要情感表现或声音克隆,选 ElevenLabs;多语言内容、批量处理或预算优先,选 Gemini。
Gemini 模型现已在 DocsToAudio 正式上线,支持所有付费套餐用户使用。
还在 Gemini 和 ElevenLabs 之间权衡?参见《Gemini TTS vs ElevenLabs 详细对比》。
准备好将文档转为音频了吗?
免费试用 DocsToAudio →