开源 AI 有声书生成器 2026:自托管 TTS 朗读你的书库
云端有声书工具按小时收费还扣着你的文件。自托管 TTS 栈免费朗读你的整个书库——带真实项目和真实 star 的管道在这里。
💡 你将学到
云端有声书工具按小时收费还扣着你的文件。自托管 TTS 栈免费朗读你的整个书库——带真实项目和真实 star 的管道在这里。
自托管的理由
如果你有个人电子书、论文和文章库,云端有声书服务在真实量级下真的很花钱——而且你的阅读清单是你的数据。自托管栈用电费把任何文本变成语音,长度无限制。质量之争 2025 年就结束了:开源 TTS 好到决策点变成控制权而不是质量。(star 数 2026-08-13 实测)
引擎
Coqui TTS(45,883 stars):全功能参考:XTTS 多语言音色克隆、微调支持、最广生态。什么都能做的重型选项。
Kokoro(8,398 stars):现代宠儿:82M 参数、语调自然、登顶开源榜单。CPU 友好,批量够快。
Piper(11,279 stars):轻量主力:快、小,是许多自托管阅读项目的默认引擎。质量好但不旗舰——批量旁白正合适。
ChatTTS(39,776 stars):内容对话多时选它;天然处理多说话人轮次。
完整管道
上面五步就是完整流程:Calibre 提取文本 → csplit 按段切块 → piper 逐块合成 → sox 合并 → ffmpeg 加章节元数据。
Web UI 层
不想丢自托管又想有托管体验,两个项目给这些引擎套了 Web UI:Open WebUI(148,592 stars)管聊天加文档朗读,AnythingLLM(65,000 stars)把你的文档变成可查询库并给答案配 TTS。都跑 Docker,一切留在本地。
要紧的设置
- 跨章节音色一致:全程同一个模型和种子,一本书绝不混引擎
- 段落边界切块:句中切断会让旁白磕巴
- 采样率一致:从一开始就定 22050 Hz(或引擎原生率),否则合并步重采样劣化
- 备份脚本而不是只备份音频:换语音模型后重新生成一章应该是一次脚本运行,不是手工活
整套免费、离线、无限制——唯一成本是一个下午的配置,结果是一个会自己朗读的书库。
