把电子书变成能听的有声书


腾讯orkbuddy注册即可得2000积分,可以干不少活。下载链接:https://www.workbuddy.cn/

百度Dumate智能体,也是工作搭配好工具:邀请码及下载地址:百度 Dumate邀请码: 7D8DUYG

字节TraeWork免费4500积分,点击下载字节跳动TraeWork免费4500积分

Tabbit AI浏览器,在浏览器里用AITabbit AI浏览器,点击下载

MonkeyCode 长亭百智云Monkeycode-AI,点击在线使用

\n

📦 10 Parts + Conclusion

👉 滑动浏览

PART 01

硬件配置

CPU 就能跑

PART 02

八步制作

从测试到成品

PART 03

离线使用

隐私保护模式

PART 04

踩坑汇总

7 个常见问题

PART ///

写在最后

版权与起步

你有没有过这种想法——手里攒了一堆 EPUB、PDF 或者几万字的 TXT 文件,想在通勤路上、做家务的时候“听”完它们,但一想到要把文件传到某个配音平台上、按字数掏钱,就打了退堂鼓。要是碰到还没出版的书稿、公司的内部材料或者自己写的笔记,上传到别人服务器这件事就更让人不放心了。

Abogen 就是来解决这个问题的。它能让你在自己的电脑上,把电子书直接变成有声书,全程不用联网(除了第一次下载模型),也不用花钱。

这篇文章会手把手带你走完整个过程。我知道你可能是第一次接触这类工具,所以我会尽量讲得直白一些,跳过那些让人头大的术语,让你看完就能动手。

01

PART

Abogen 能干什么

FEATURES · WHAT IT DOES

简单说,Abogen 就是一个“文字转语音”的桌面工具。你给它一本书(电子版),它给你一段音频。目前最新正式版是 v1.3.1,支持以下功能:

支持把 EPUB、PDF、TXT、Markdown 文件转成有声书,字幕文件(SRT、ASS、VTT)也能直接配音。可以按章节或页码选择转换范围,每一章单独保存也可以合并成完整的一本书。

输出格式覆盖 MP3、M4B、WAV、FLAC、OPUS 五种,还能同步生成字幕文件。它支持多音色混合,可以把几个声音按不同比例调出你喜欢的感觉。一次可以排好几本书,按顺序自动处理。

它有 桌面版和网页版两种操作方式。桌面版更稳定,网页版功能更新更快,多了人物识别、多角色配音这些高级功能。

02

PART

我的电脑能跑得动吗

HARDWARE · SYSTEM REQUIREMENTS

普通电脑就能跑,不需要独立显卡。 先转一小段试试速度,心里就有数了。

最基本的条件

1

操作系统:Windows、Linux、macOS 都行

2

Python 版本:3.10、3.11 或 3.12(推荐 3.12,macOS 别用 3.13 会报错)

3

系统依赖:eSpeak NG(免费小工具,装起来很简单)

4

网络:第一次安装和下载模型、音色需要联网,之后不需要

显卡加速对照表

系统NVIDIAAMD无显卡
WindowsCUDA(推荐 12.8)不支持CPU
LinuxCUDAROCm 6.4CPU
macOS--Apple Silicon → MPSIntel → CPU

说白了就是:旧电脑先转一章试听一下,速度能接受就用,不能接受再考虑上显卡。

03

PART

支持哪些文件格式

FORMATS · INPUT & OUTPUT

输入格式方面,桌面版支持拖入或粘贴:.epub .pdf .txt .md .markdown .srt .ass .vtt。网页版支持上传 .txt .pdf .md .markdown .epub,上限 400MB。

输出音频格式有五种,各有侧重:WAV 体积大但无损,适合后期剪辑;FLAC 无损压缩,体积更小;MP3 兼容性最好,手机车机都能播;OPUS 压缩效率高;M4B 能内嵌章节和封面,做完整有声书首选。

中文字幕目前只支持句子级和逗号级的时间轴,没有逐字高亮功能。想要歌词那种跟着朗读一个字一个字亮起来的效果,这套方案暂时做不到。

04

PART

安装教程

INSTALL · STEP BY STEP

不管用什么系统,第一步都是装 eSpeak NG。

方案一:一键脚本(推荐新手用)

先去下载 :https://github.com/espeak-ng/espeak-ng/releases/latest,

找到 .msi 文件下载安装。

然后下载 Abogen 源码压缩包:https://github.com/denizsafak/abogen/archive/refs/heads/main.zip

解压后双击 WINDOWS_INSTALL.bat,脚本会自动装好 Python 3.12 和所有依赖,还会自动检测你有没有 NVIDIA 显卡。装完后程序在 python_embedded\Scripts\abogen.exe,直接双击就能用。

!踩坑提示 🕳

这个脚本会联网下载东西。如果你在公司电脑上操作,可以先看看脚本内容再决定是否运行。

方案二:用 uv 命令行安装

没有 NVIDIA 显卡:

...bash

uv tool install --python 3.12 abogen

有 NVIDIA 显卡(CUDA 12.8):

...bash

uv tool install --python 3.12 "abogen[cuda]" \

  --extra-index-url https://download.pytorch.org/whl/cu128 \

  --index-strategy unsafe-best-match

安装完成后,命令行输入 abogen 就能启动。

Linux 安装

Ubuntu 或 Debian:

...bash

sudo apt update

sudo apt install espeak-ng

uv tool install --python 3.12 abogen

Arch Linux:

...bash

sudo pacman -S espeak-ng

uv tool install --python 3.12 abogen

Fedora:

...bash

sudo dnf install espeak-ng

uv tool install --python 3.12 abogen

装完之后如果命令行找不到 abogen,运行这两行:

...bash

echo "export PATH=\"/home/$USER/.local/bin:\$PATH\"" >> ~/.bashrc

source ~/.bashrc

macOS 安装

...bash

brew install espeak-ng

uv tool install --python 3.12 abogen \

  --with "kokoro @ git+https://github.com/hexgrad/kokoro.git,numpy<2"

注意要用 Python 3.12,别用 3.13,会报错。

05

PART

普通话有声书制作:八步走

AUDIOBOOK · 8-STEP GUIDE

先拿一小段文字跑通流程,确认没问题了再转整本书。 不然等了好几个小时发现音色不喜欢,那才叫崩溃。

STEP 01

准备一小段测试文字

新建一个 TXT 文件,编码选 UTF-8(这个很重要),写入以下测试内容:

...txt

这是普通话语音测试。

重庆银行今天发布了新的公告。

项目版本是二点零,价格是一百二十八元。

这段话能帮你一次性检查:普通话自然度、多音字(“重庆”“银行”)、数字和标点停顿。

STEP 02

启动程序

命令行输入 abogen,或者直接双击桌面图标。把测试 TXT 拖进窗口,也可以直接粘贴文字。

STEP 03

选择语言

这一步很多人搞错。语言一定要选 Mandarin Chinese,Kokoro 对应代码是 z。记住:语言和音色要一起切换,光换音色不改语言,读出来会怪怪的。

STEP 04

挑一个你喜欢的中文音色

目前有 8 个中文音色。女声用 zf_ 开头,男声用 zm_ 开头:

女声:

zf_xiaobei、zf_xiaoni、zf_xiaoxiao、zf_xiaoyi

男声:

zm_yunjian、zm_yunxi、zm_yunxia、zm_yunyang

建议每个音色都点 Voice Preview(试听),重点听:人名地名读得对不对、多音字有没有读错、数字和日期处理得怎么样、中英文混在一起好不好听、标点停顿自不自然。

STEP 05

调整语速

普通话建议从 0.9 到 1.0 这个范围开始试。小说对白可以稍快一点,教材知识类内容最好慢一些。用同一段样音对比着听,选你觉得舒服的。

STEP 06

检查文本内容

转换前先检查这些容易忽略的地方:

1

页眉页脚会不会被反复读出来(很影响听感)

2

目录和页码要不要保留

3

脚注内容会不会打断正文

4

英文缩写需不需要手动改成全称

5

多音字和专有名词要不要提前替换

扫描版 PDF(图片格式的)如果选不中文字,说明没有文字层。Abogen 不带 OCR 功能,需要先用其他 OCR 工具转成可检索的 PDF 或 TXT。

STEP 07

选输出格式

M4B

带章节·完整有声书

WAV

无损·后期剪辑

MP3

兼容性最好

字幕选 Sentence 或 Sentence + Comma

STEP 08

先转一章,满意了再转全书

这是最重要的原则。 先生成一章试听,把多音字、音量、语速、断句、章节标题都确认一遍,没问题了再把整本书加入处理队列。转长书的时候尤其用 CPU 跑的要有耐心,软件支持查看进度、取消任务、逐章保存,中间出问题不会白跑。

06

PART

网页版(Web UI)怎么用

WEB UI · ADVANCED FEATURES

桌面版不够用的时候可以试试网页版。启动命令是:

...bash

abogen-web

然后浏览器打开 http://localhost:8808。

网页版比桌面版多了 人物识别、多角色配音、发音覆盖等高级功能。

!踩坑提示 🕳

这个网页服务默认监听所有网络接口(0.0.0.0:8808),而且没有登录验证。如果你只是自己在本机用,建议把端口限制为本地访问,别把它暴露到公网上。

07

PART

能不能克隆声音

VOICE · MIXER & CLONING

Voice Mixer(音色混合器)可以把几个已有的音色按不同比例混合,调出一种新的声音感觉。但它不能上传真人录音然后训练出一个新声音——没有声音克隆功能。

混合音色的时候也建议先用短句试听。不同组合出来的效果差别可能很大,有的组合甚至会含混不清或者发音不稳定。

08

PART

关于 LLM(大语言模型)

LLM · OPTIONAL ONLY

做普通话有声书完全不需要 LLM。

Abogen 的核心 TTS 引擎是 Kokoro。你导入文档、选择中文音色、生成音频,整个过程不需要 ChatGPT、Claude 或任何大语言模型。

LLM 只在网页版里作为一个可选功能出现,用来做文本规范化,比如处理缩写、撇号和特殊文本替换。但目前的规则明显偏向英语,中文内容开了反而可能帮倒忙。

...env

ABOGEN_LLM_BASE_URL=http://localhost:11434

ABOGEN_LLM_API_KEY=***

ABOGEN_LLM_MODEL=llama3.1:8b

ABOGEN_LLM_TIMEOUT=45

ABOGEN_LLM_CONTEXT_MODE=sentence

只做普通话有声书的话,关了 LLM 更省事,也更保护隐私。

09

PART

如何完全离线使用

OFFLINE · PRIVACY MODE

第一次安装和下载模型、音色需要联网。下载完之后,在设置里点两个按钮:

1

Pre-download models and voices for offline use(提前下载好模型和音色)

2

Disable Kokoro's internet access(禁用 Kokoro 的网络访问)

之后程序就会在完全离线的状态下运行,语音生成和可选的 LLM 处理都留在你电脑本地。

需要注意,以下操作还是会联网:

1

使用远程 OpenAI 兼容 LLM

2

首次下载模型和音色

3

SuperTonic 的首次自动下载

4

自动检查更新

5

Calibre OPDS 和 Audiobookshelf 集成

10

PART

新手常见问题汇总

FAQ · TROUBLESHOOTING

这里把我见过的坑都列出来,你遇到了不用慌:

1

选了中文音色但出来的是英文发音

语言没改过来。记得把语言改成 Mandarin Chinese(代码 z),音色用 zf_ 或 zm_ 开头的。

2

扫描 PDF 转换后没有声音

这种 PDF 是图片格式,里面没有文字。先用 OCR 工具转成可检索的版本。

3

想要歌词那种一个字一个字亮起来的效果

做不到。中文目前只有句子级和逗号级的时间轴,逐词高亮只对英文有效。

4

macOS 装了 Python 3.13 报错

项目要求 Python 小于 3.13,换成 3.12 就行了。

5

网页版上传字幕文件没反应

字幕转语音目前桌面版处理得更好,切回桌面版试试。

6

长书转换要等很久

这是正常的,尤其是用 CPU 跑。先转一章确认设置,再挂那让它慢慢跑。

7

多音字或者人名读错了

先在短样音里发现这些问题,然后用网页版的 发音覆盖 功能修正,或者在转换前直接在文本里替换。

///

LAST

写在最后

LEGAL · FINAL THOUGHTS

隐私方面,如果你开了远程 LLM 规范化功能,你的文本会发到对应的服务器。未出版的书稿、公司材料、个人隐私内容,一定把远程 LLM 关掉,或者改用本机跑 Ollama。

Web UI 的密钥、密码等信息存在本地配置文件里,没有专门加密,所以这个配置目录要当作敏感文件对待,别把它上传到 Git 仓库。

版权方面,Abogen 用的是 MIT 开源协议,Kokoro 用的是 Apache-2.0。但软件开源不等于你转出来的有声书可以随意公开传播。想在公开渠道或商业场景使用有声书之前,先确认原书的版权和音色模型的许可。

如果你的需求很简单——把自己的笔记、买过的电子书或者有授权的材料转成普通话有声书——推荐的起步配置:Python 3.12 + Kokoro + Mandarin Chinese + 任选一个 zf_ 或 zm_ 音色 + 语速 0.9 到 1.0 + 输出 M4B 或 MP3 + 先关掉 LLM。

先跑通一小段,再转整本书。

这八个字能帮你躲掉 90% 的麻烦。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞在看转发

THANKS FOR READING

暂无评论,快来发表第一条评论吧!

📮 需求咨询