在线 TTS 服务对比:5 款可免费使用的文字转语音工具
从 TTSMaker 到 ElevenLabs,对比 5 款在线 TTS 服务的注册要求、免费额度、单次字数、模型、文件保存和商用授权,并介绍可在浏览器本地运行的 DORODORA TTS。
视频配音、朗读内容、播报提示、直播打赏提醒——需要声音的场景比想象中更多。没有录音环境也不用请配音员,在线文字转语音(Text to Speech, TTS)是最快把文字变成声音的办法。
不过每家服务的注册要求、免费额度、提供模型和商用条件都不一样,光看名字很难选。这篇文章会围绕实际使用中最重要的几个维度,逐一对比 5 款代表性的在线 TTS 服务。
逐一对比后会发现,云端服务往往共享类似的限制,比如需要注册或有字数限额。因此最后还会介绍一款跳出这种模式的工具——DORODORA 的 TTS。它不在云端转换,而是在浏览器中下载模型文件并在本地直接运行,自然解决了在线 TTS 常见的一些不便。
该怎么选 TTS?
选择 TTS 时需要确认的其实很简单。
- 是否无需注册即可使用
- 免费额度有多少
- 提供哪些模型和声音
- 生成的音频能否商用
- 能否保存为文件
- 单次最多可输入多少字
下面会按照这 6 个检查点逐一介绍各服务。
TTSMaker
TTSMaker 的优势在于免费额度充足。
- 注册:无需注册
- 免费额度:每周 20,000 字(部分声音无限制)
- 单次字数:单次 1,000 字(Pro 为 20,000 字以上)
- 模型与声音:各语言的多种 AI 声音
- 文件保存:支持 MP3 · WAV · OGG · AAC · OPUS 下载
- 商用授权:可用(无需署名)
最大的优点是商用授权。对生成的音频提供 100% 商用使用权且不强制署名,可直接用于 YouTube、TikTok、播客等。语速、音高、音量调节、句间停顿插入、背景音乐(BGM)合成等设置也很丰富。
注意事项
- 生成的音频会在 30 分钟后自动删除,请及时下载。
- 部分精细设置仅 Pro 可用。
适合需要定期把长文案转为语音的创作者,是稳妥的首选。
TTSFree
TTSFree 无需登录即可开始转换。
- 注册:免费转换无需注册
- 免费额度:游客每日 50 次(注册后每月 500,000 字)
- 单次字数:单次 500 字(注册后 2,000 字)
- 模型与声音:Google/Microsoft 神经网络系,支持 140 种语言 700+ 声音
- 文件保存:MP3 下载
- 商用授权:可用
号称采用 Google 和 Microsoft 最新的神经网络技术,读音清晰稳定。Wavenet、Neural2 等更高等级的声音也有部分免费开放。支持语速、音高、音量、SSML 和背景音乐添加。
注意事项
- 高级声音需付费套餐。
- 生成的文件会在 24 小时内删除。
想把一句话最快转成语音时的轻量选择。
Luvvoice
Luvvoice 的优势在于声音选择丰富。
- 注册:可免费使用(登录后功能扩展)
- 免费额度:每月 20,000 字
- 单次字数:单次 3,000 字(付费登录用户为 20,000 字)
- 模型与声音:70 种语言 200+ 声音 + 自定义声音
- 文件保存:MP3 下载
- 商用授权:Premium 套餐包含
亮点是文件转换。支持上传 PDF 和 TXT 文档并一次性转为语音,适合把长篇文章或稿件做成朗读文件。默认提供语速和音高调节,登录用户还可使用句间停顿插入功能。最近还运营着很有个性的自定义声音市场。
注意事项
- 商用授权绑定在 Premium 套餐,需根据用途确认套餐。
- 生成的音频仅保留 72 小时。
特别适合文档朗读这类篇幅较大的任务。
TTS.ai
TTS.ai 有点不同。它不是销售单一模型,而是把开源模型集中在一处的平台。
- 注册:免费模型无需注册
- 免费额度:每日 5,000 字(注册后每月 10,000 字 + 奖励 15,000 字)
- 单次字数:单次 500 字(注册后 5,000 字)
- 模型与声音:36+ 开源模型,314+ 声音,55+ 语言
- 文件保存:WAV 下载(可用内置转换器转为 MP3 等)
- 商用授权:可用
从 Kokoro、Piper、MeloTTS 等轻量模型,到 Chatterbox、GPT-SoVITS 等支持声音克隆的模型都有,可用同一段文字对比多个模型的效果。还从免费套餐起就提供兼容 OpenAI 的 API,对开发者也很友好。
注意事项
- 支持的语言和每字消耗量因模型而异。
- 要认真使用,通常需要考虑 $9/月起的付费套餐。
适合“想直接对比多个 TTS 模型”的需求。
ElevenLabs
ElevenLabs 是音质压倒性的服务。
- 注册:需要(提供免费套餐)
- 免费额度:每月 10,000 积分(约 10 分钟)
- 单次字数:因模型而异(Eleven v3 为 5,000 字,Multilingual v2 为 10,000 字)
- 模型与声音:Eleven v3、Multilingual v2、Flash v2.5、Turbo v2.5 / 11,000+ 声音
- 文件保存:MP3 · WAV 下载
- 商用授权:仅付费套餐可用(免费需署名)
宣称能理解情感和上下文并调整表达方式,自然度很高,还提供用约 1 分钟样本克隆声音的即时声音克隆功能。支持 32 种以上语言(Eleven v3 为 70 种以上)。
注意事项
- 商用授权和声音克隆从付费套餐($5–$6/月起)开始。
- 积分消耗较快,长文需做好成本核算。
如果是音质直接决定成果的商用项目,值得优先考虑。
在线 TTS 共同的遗憾
把 5 款服务并列来看,各有鲜明优点,但也共享一些结构性特点。
- 输入的文本会为转换而发送到服务器。
- 有周/月字数配额,反复测试时会有负担。
- 结果文件保留期很短(30 分钟至 72 小时),需及时保存。
大多数情况下不是大问题,但想朗读敏感内容,或想用同一句话在不同模型上测试几十次时,这种结构就会碍事。
这时不妨换个思路,试试直接在浏览器中运行的 TTS。
DORODORA 的 TTS
由 DORODORA 提供的 TTS 同样使用开源模型,这点与 TTS.ai 相似。但它不在云端处理转换,而是把模型文件下载到浏览器并在设备上直接运行。
用同样的检查点整理如下。
- 注册:无需注册
- 免费额度:无限制
- 单次字数:单次 1,000 字
- 模型与声音:以下 4 款本地模型
- 文件保存:WAV 下载
- 商用授权:可用
因此输入的文本和生成的音频不会发送到 DORODORA 服务器,也无需担心字数配额。只需打开页面即可使用,生成的音频可保存为 WAV 并用于商用。
模型组成
- SuperTonic — 399MB · 10 个声音 · 31+ 语言
- Pocket — 199MB · 8 个声音 · 英语、德语、意大利语、葡萄牙语、西班牙语
- Kokoro — 92MB · 28 个声音 · 英语
- Kitten — 28MB · 8 个声音 · 英语
SuperTonic 覆盖 31 种以上语言,因此多语言直播或内容也可用同一工具测试。
Pocket 模型还提供声音克隆选项。上传一段 1–3 秒的干净音频即可生成该声音的 TTS,自定义声音会保存在浏览器中,下次访问时可重复使用。
此外还支持有趣的 Animalese 效果——一个可切换的选项,能把生成的音频变成快速可爱的角色声音。
适合哪些人?
- 想在直播中使用 AI 声音作为打赏提醒前先试听的主播
- 不希望文本被发送到外部服务器的用户
- 想无视字数配额自由对比模型和声音的用户
- 想将结果保存为 WAV 并直接用于剪辑的创作者
反之,需要预先下载模型文件(28MB–399MB),且部分模型仅支持英语,这一点需要考虑。
按场景的推荐组合
与其执着于一款,不如按用途搭配使用。
长文案与文档朗读
Luvvoice 的文件转换或 TTSMaker 充裕的每周额度很有用,适合把整份稿件一次性转为语音。
商用项目配音
如果成片质量决定成果,ElevenLabs 的付费套餐是首选。想免费解决,则可组合明确允许商用的 TTSMaker、TTS.ai、DORODORA 来覆盖。
模型对比与实验
在 TTS.ai 对比云端开源模型,在 DORODORA 的 TTS 对比浏览器本地模型的质感,可快速缩小候选范围。
打赏提醒准备
想让打赏消息由 AI 声音朗读,需要先确认实际听感。在 DORODORA 的 TTS 中挑选模型和声音组合后,通过 DORODORA 控制台的 TTS 设置关联,流程就很顺畅。还支持 Voice Cloning TTS,可让打赏消息用自己的声音朗读。
FAQ
哪些地方可完全免费且商用?
TTSMaker、TTS.ai、DORODORA 符合。ElevenLabs 和 Luvvoice 的商用授权绑定在付费套餐,需按用途确认套餐。
哪些无需注册即可使用?
TTSFree 和 TTS.ai(免费模型)、DORODORA 无需注册即可开始转换。
有不把文本发送到服务器的吗?
只有 DORODORA。它将模型下载到浏览器并在设备上处理,因此文本和生成的音频不会发送到服务器。其他云服务会为转换而将文本发送到服务器。
如何准备打赏提醒的 TTS?
先在 DORODORA 的 TTS 中找到喜欢的模型和声音。之后在 DORODORA 控制台开启 TTS,打赏消息就会由 AI 声音朗读,并可通过 OBS 浏览器源在直播画面中显示提醒。
撰写时的参考信息
本文基于各服务截至 2026 年 8 月 26 日的公开页面撰写。免费额度、声音数量、商用条件可能随时变更,使用前请确认最新信息。
- TTSMaker: https://ttsmaker.com/zh-CN
- TTSFree: https://ttsfree.com/zh-CN
- Luvvoice: https://luvvoice.com/zh-CN
- TTS.ai: https://tts.ai/
- ElevenLabs Text to Speech: https://elevenlabs.io/text-to-speech
- DORODORA TTS: https://dorodora.com/playground
DORODORA 所提供模型的商用情况
在 DORODORA 的 TTS 中运行的 4 款模型均基于公开的开源项目。就生成音频能否商用的角度,按原项目整理如下。
- SuperTonic(Supertone):代码为 MIT,模型权重为 OpenRAIL-M。允许商用,需署名并遵守禁止滥用等使用限制。
- Pocket(Kyutai):各声音的来源和授权不同。像 CC0、CC BY 4.0 这样可商用的声音,与基于 Expresso 数据集的 CC BY-NC 4.0(仅限非商用)声音并存。
DORODORA仅提供可商用的声音,因此可直接用于变现内容而无需额外确认。 - Kokoro(hexgrad):权重以 Apache 2.0 发布,无商用限制。
- KittenTTS(KittenML):以 Apache 2.0 发布,无商用限制。
总结来说,4 款模型均无商用限制。而用 Custom 声音克隆自己声音时,则不存在他人数据的授权问题。
无论哪款模型,未经同意复刻他人声音或用于欺骗性用途均被禁止,因此在发布或变现前再次确认各模型与声音的最新授权会更安心。
总结
在线 TTS 的选择已足够丰富。额度与设置自由度看 TTSMaker,无需注册的快捷看 TTSFree,文档朗读看 Luvvoice,模型实验看 TTS.ai,顶级音质看 ElevenLabs,各有长处。
如果还要求“不经过服务器、无配额、无需注册”,在浏览器本地运行的 DORODORA 是很好的补充。免费且可商用,需要为打赏提醒挑选声音或为内容准备音频时不妨一试。
可在 dorodora.com/playground 立即体验 TTS。