EmotiVoice 2026:带真实情感的开源中文语音合成
中文语音合成太机械,讲故事尤其明显。网易有道的EmotiVoice能生成带可控情感的中文语音。
💡 你将学到
中文语音合成太机械,讲故事尤其明显。网易有道的EmotiVoice能生成带可控情感的中文语音。
EmotiVoice 2026:为中文TTS注入真实情感的开源项目(8.5k Stars)
EmotiVoice:有情感的中文语音合成
EmotiVoice 由网易有道开源(截至2026年8月GitHub获得8507颗星),是一个专注于中文TTS模型通常忽视的方面的文本转语音系统:情感。它让你指定情感标签——快乐、悲伤、愤怒、惊讶、恐惧、厌恶、中性——并控制情感强度,生成的中文语音听起来富有表现力而非平淡。
为什么情感对TTS很重要
有声书、游戏角色、配音和语音助手,如果输出单调,效果都会大打折扣。大多数开源中文TTS(如Coqui中的旧版中文TTS模型)能正确朗读文本,但语调单一平淡。EmotiVoice的双重方法——基础语音模型加上情感控制模块——让富有表现力的输出成为你可以设置的参数,而非偶然的运气。
如何使用
git clone https://github.com/netease-youdao/EmotiVoice
git submodule update --init --recursive
# run the web demo and type text + choose emotion
它附带一个Gradio Web界面和一个命令行合成脚本。模型权重很大(几个GB),但推理可以在单个消费级GPU上运行,CPU推理也适用于短片段。
实际对比
| 需求 | 工具 |
|---|---|
| 富有表现力的中文(带情感控制) | EmotiVoice |
| 英语+中文通用TTS | Edge-TTS / Azure / ElevenLabs |
| 语音克隆 | OpenVoice / RVC |
| 最快的中文TTS(情感较少) | 原生云API |
需要注意的限制
- 长文本合成可能失去情感一致性——请保持段落简短。
- 早期版本中,某些情感(惊讶、恐惧)不如快乐/悲伤自然。
- 主要支持中文;英语支持存在但并非重点。
常见问题
EmotiVoice 免费吗? 是的,开源(根据仓库的Apache-2.0风格许可证);你只需为计算付费。
它支持语音克隆吗? 不支持——那是另一个工具(参见OpenVoice)。
我可以在商业中使用吗? 可以,用于你自己生成的音频;请确认仓库中的许可证条款。
我需要多少显存? 完整模型大约8-12GB;量化版本需要更少。
相关文章
❓ 常见问题
Is EmotiVoice free?
Yes, open source (Apache-2.0 style license per the repo); you pay for compute.
Does it support voice cloning?
No - that is a different tool (see OpenVoice).
Can I use it commercially?
Yes, for your own generated audio; verify the license terms in the repo.
How much VRAM do I need?
Around 8-12GB for the full model; quantized versions run on less.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
