📦 10 Parts + Conclusion
👉 滑动浏览
PART 01
硬件配置
CPU 就能跑
PART 02
八步制作
从测试到成品
PART 03
离线使用
隐私保护模式
PART 04
踩坑汇总
7 个常见问题
PART ///
写在最后
版权与起步
你有没有过这种想法——手里攒了一堆 EPUB、PDF 或者几万字的 TXT 文件,想在通勤路上、做家务的时候“听”完它们,但一想到要把文件传到某个配音平台上、按字数掏钱,就打了退堂鼓。要是碰到还没出版的书稿、公司的内部材料或者自己写的笔记,上传到别人服务器这件事就更让人不放心了。
Abogen 就是来解决这个问题的。它能让你在自己的电脑上,把电子书直接变成有声书,全程不用联网(除了第一次下载模型),也不用花钱。
这篇文章会手把手带你走完整个过程。我知道你可能是第一次接触这类工具,所以我会尽量讲得直白一些,跳过那些让人头大的术语,让你看完就能动手。
01
PART
Abogen 能干什么
FEATURES · WHAT IT DOES
简单说,Abogen 就是一个“文字转语音”的桌面工具。你给它一本书(电子版),它给你一段音频。目前最新正式版是 v1.3.1,支持以下功能:
支持把 EPUB、PDF、TXT、Markdown 文件转成有声书,字幕文件(SRT、ASS、VTT)也能直接配音。可以按章节或页码选择转换范围,每一章单独保存也可以合并成完整的一本书。
输出格式覆盖 MP3、M4B、WAV、FLAC、OPUS 五种,还能同步生成字幕文件。它支持多音色混合,可以把几个声音按不同比例调出你喜欢的感觉。一次可以排好几本书,按顺序自动处理。
它有 桌面版和网页版两种操作方式。桌面版更稳定,网页版功能更新更快,多了人物识别、多角色配音这些高级功能。
02
PART
我的电脑能跑得动吗
HARDWARE · SYSTEM REQUIREMENTS
普通电脑就能跑,不需要独立显卡。 先转一小段试试速度,心里就有数了。
最基本的条件
1
操作系统:Windows、Linux、macOS 都行
2
Python 版本:3.10、3.11 或 3.12(推荐 3.12,macOS 别用 3.13 会报错)
3
系统依赖:eSpeak NG(免费小工具,装起来很简单)
4
网络:第一次安装和下载模型、音色需要联网,之后不需要
显卡加速对照表
| 系统 | NVIDIA | AMD | 无显卡 |
|---|---|---|---|
| Windows | CUDA(推荐 12.8) | 不支持 | CPU |
| Linux | CUDA | ROCm 6.4 | CPU |
| macOS | - | - | Apple Silicon → MPSIntel → CPU |
说白了就是:旧电脑先转一章试听一下,速度能接受就用,不能接受再考虑上显卡。
03
PART
支持哪些文件格式
FORMATS · INPUT & OUTPUT
输入格式方面,桌面版支持拖入或粘贴:.epub .pdf .txt .md .markdown .srt .ass .vtt。网页版支持上传 .txt .pdf .md .markdown .epub,上限 400MB。
输出音频格式有五种,各有侧重:WAV 体积大但无损,适合后期剪辑;FLAC 无损压缩,体积更小;MP3 兼容性最好,手机车机都能播;OPUS 压缩效率高;M4B 能内嵌章节和封面,做完整有声书首选。
中文字幕目前只支持句子级和逗号级的时间轴,没有逐字高亮功能。想要歌词那种跟着朗读一个字一个字亮起来的效果,这套方案暂时做不到。
04
PART
安装教程
INSTALL · STEP BY STEP
不管用什么系统,第一步都是装 eSpeak NG。
方案一:一键脚本(推荐新手用)
先去下载 :https://github.com/espeak-ng/espeak-ng/releases/latest,
找到 .msi 文件下载安装。
然后下载 Abogen 源码压缩包:https://github.com/denizsafak/abogen/archive/refs/heads/main.zip
解压后双击 WINDOWS_INSTALL.bat,脚本会自动装好 Python 3.12 和所有依赖,还会自动检测你有没有 NVIDIA 显卡。装完后程序在 python_embedded\Scripts\abogen.exe,直接双击就能用。
!踩坑提示 🕳
这个脚本会联网下载东西。如果你在公司电脑上操作,可以先看看脚本内容再决定是否运行。
方案二:用 uv 命令行安装
没有 NVIDIA 显卡:
...bash
uv tool install --python 3.12 abogen
有 NVIDIA 显卡(CUDA 12.8):
...bash
uv tool install --python 3.12 "abogen[cuda]" \
--extra-index-url https://download.pytorch.org/whl/cu128 \
--index-strategy unsafe-best-match
安装完成后,命令行输入 abogen 就能启动。
Linux 安装
Ubuntu 或 Debian:
...bash
sudo apt update
sudo apt install espeak-ng
uv tool install --python 3.12 abogen
Arch Linux:
...bash
sudo pacman -S espeak-ng
uv tool install --python 3.12 abogen
Fedora:
...bash
sudo dnf install espeak-ng
uv tool install --python 3.12 abogen
装完之后如果命令行找不到 abogen,运行这两行:
...bash
echo "export PATH=\"/home/$USER/.local/bin:\$PATH\"" >> ~/.bashrc
source ~/.bashrc
macOS 安装
...bash
brew install espeak-ng
uv tool install --python 3.12 abogen \
--with "kokoro @ git+https://github.com/hexgrad/kokoro.git,numpy<2"
注意要用 Python 3.12,别用 3.13,会报错。
05
PART
普通话有声书制作:八步走
AUDIOBOOK · 8-STEP GUIDE
先拿一小段文字跑通流程,确认没问题了再转整本书。 不然等了好几个小时发现音色不喜欢,那才叫崩溃。
STEP 01
准备一小段测试文字
新建一个 TXT 文件,编码选 UTF-8(这个很重要),写入以下测试内容:
...txt
这是普通话语音测试。
重庆银行今天发布了新的公告。
项目版本是二点零,价格是一百二十八元。
这段话能帮你一次性检查:普通话自然度、多音字(“重庆”“银行”)、数字和标点停顿。
STEP 02
启动程序
命令行输入 abogen,或者直接双击桌面图标。把测试 TXT 拖进窗口,也可以直接粘贴文字。
STEP 03
选择语言
这一步很多人搞错。语言一定要选 Mandarin Chinese,Kokoro 对应代码是 z。记住:语言和音色要一起切换,光换音色不改语言,读出来会怪怪的。
STEP 04
挑一个你喜欢的中文音色
目前有 8 个中文音色。女声用 zf_ 开头,男声用 zm_ 开头:
女声:
zf_xiaobei、zf_xiaoni、zf_xiaoxiao、zf_xiaoyi
男声:
zm_yunjian、zm_yunxi、zm_yunxia、zm_yunyang
建议每个音色都点 Voice Preview(试听),重点听:人名地名读得对不对、多音字有没有读错、数字和日期处理得怎么样、中英文混在一起好不好听、标点停顿自不自然。
STEP 05
调整语速
普通话建议从 0.9 到 1.0 这个范围开始试。小说对白可以稍快一点,教材知识类内容最好慢一些。用同一段样音对比着听,选你觉得舒服的。
STEP 06
检查文本内容
转换前先检查这些容易忽略的地方:
1
页眉页脚会不会被反复读出来(很影响听感)
2
目录和页码要不要保留
3
脚注内容会不会打断正文
4
英文缩写需不需要手动改成全称
5
多音字和专有名词要不要提前替换
扫描版 PDF(图片格式的)如果选不中文字,说明没有文字层。Abogen 不带 OCR 功能,需要先用其他 OCR 工具转成可检索的 PDF 或 TXT。
STEP 07
选输出格式
M4B
带章节·完整有声书
WAV
无损·后期剪辑
MP3
兼容性最好
字幕选 Sentence 或 Sentence + Comma
STEP 08
先转一章,满意了再转全书
这是最重要的原则。 先生成一章试听,把多音字、音量、语速、断句、章节标题都确认一遍,没问题了再把整本书加入处理队列。转长书的时候尤其用 CPU 跑的要有耐心,软件支持查看进度、取消任务、逐章保存,中间出问题不会白跑。
06
PART
网页版(Web UI)怎么用
WEB UI · ADVANCED FEATURES
桌面版不够用的时候可以试试网页版。启动命令是:
...bash
abogen-web
然后浏览器打开 http://localhost:8808。
网页版比桌面版多了 人物识别、多角色配音、发音覆盖等高级功能。
!踩坑提示 🕳
这个网页服务默认监听所有网络接口(0.0.0.0:8808),而且没有登录验证。如果你只是自己在本机用,建议把端口限制为本地访问,别把它暴露到公网上。
07
PART
能不能克隆声音
VOICE · MIXER & CLONING
Voice Mixer(音色混合器)可以把几个已有的音色按不同比例混合,调出一种新的声音感觉。但它不能上传真人录音然后训练出一个新声音——没有声音克隆功能。
混合音色的时候也建议先用短句试听。不同组合出来的效果差别可能很大,有的组合甚至会含混不清或者发音不稳定。
08
PART
关于 LLM(大语言模型)
LLM · OPTIONAL ONLY
做普通话有声书完全不需要 LLM。
Abogen 的核心 TTS 引擎是 Kokoro。你导入文档、选择中文音色、生成音频,整个过程不需要 ChatGPT、Claude 或任何大语言模型。
LLM 只在网页版里作为一个可选功能出现,用来做文本规范化,比如处理缩写、撇号和特殊文本替换。但目前的规则明显偏向英语,中文内容开了反而可能帮倒忙。
...env
ABOGEN_LLM_BASE_URL=http://localhost:11434
ABOGEN_LLM_API_KEY=***
ABOGEN_LLM_MODEL=llama3.1:8b
ABOGEN_LLM_TIMEOUT=45
ABOGEN_LLM_CONTEXT_MODE=sentence
只做普通话有声书的话,关了 LLM 更省事,也更保护隐私。
09
PART
如何完全离线使用
OFFLINE · PRIVACY MODE
第一次安装和下载模型、音色需要联网。下载完之后,在设置里点两个按钮:
1
Pre-download models and voices for offline use(提前下载好模型和音色)
2
Disable Kokoro's internet access(禁用 Kokoro 的网络访问)
之后程序就会在完全离线的状态下运行,语音生成和可选的 LLM 处理都留在你电脑本地。
需要注意,以下操作还是会联网:
1
使用远程 OpenAI 兼容 LLM
2
首次下载模型和音色
3
SuperTonic 的首次自动下载
4
自动检查更新
5
Calibre OPDS 和 Audiobookshelf 集成
10
PART
新手常见问题汇总
FAQ · TROUBLESHOOTING
这里把我见过的坑都列出来,你遇到了不用慌:
1
选了中文音色但出来的是英文发音
语言没改过来。记得把语言改成 Mandarin Chinese(代码 z),音色用 zf_ 或 zm_ 开头的。
2
扫描 PDF 转换后没有声音
这种 PDF 是图片格式,里面没有文字。先用 OCR 工具转成可检索的版本。
3
想要歌词那种一个字一个字亮起来的效果
做不到。中文目前只有句子级和逗号级的时间轴,逐词高亮只对英文有效。
4
macOS 装了 Python 3.13 报错
项目要求 Python 小于 3.13,换成 3.12 就行了。
5
网页版上传字幕文件没反应
字幕转语音目前桌面版处理得更好,切回桌面版试试。
6
长书转换要等很久
这是正常的,尤其是用 CPU 跑。先转一章确认设置,再挂那让它慢慢跑。
7
多音字或者人名读错了
先在短样音里发现这些问题,然后用网页版的 发音覆盖 功能修正,或者在转换前直接在文本里替换。
///
LAST
写在最后
LEGAL · FINAL THOUGHTS
隐私方面,如果你开了远程 LLM 规范化功能,你的文本会发到对应的服务器。未出版的书稿、公司材料、个人隐私内容,一定把远程 LLM 关掉,或者改用本机跑 Ollama。
Web UI 的密钥、密码等信息存在本地配置文件里,没有专门加密,所以这个配置目录要当作敏感文件对待,别把它上传到 Git 仓库。
版权方面,Abogen 用的是 MIT 开源协议,Kokoro 用的是 Apache-2.0。但软件开源不等于你转出来的有声书可以随意公开传播。想在公开渠道或商业场景使用有声书之前,先确认原书的版权和音色模型的许可。
如果你的需求很简单——把自己的笔记、买过的电子书或者有授权的材料转成普通话有声书——推荐的起步配置:Python 3.12 + Kokoro + Mandarin Chinese + 任选一个 zf_ 或 zm_ 音色 + 语速 0.9 到 1.0 + 输出 M4B 或 MP3 + 先关掉 LLM。
先跑通一小段,再转整本书。
这八个字能帮你躲掉 90% 的麻烦。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
点赞在看转发
THANKS FOR READING