选电子书格式常被当成「哪个更新更好」的问题,其实不是——五种格式解决的是不同问题,选错的代价是读起来痛苦或者信息丢失。
判断的第一刀,也是最重要的一刀,只有一个问题:版面本身携带信息吗?
第一刀:重排式 vs 固定版式
| 重排式(EPUB / MOBI / AZW3 / TXT) | 固定版式(PDF) | |
|---|---|---|
| 内部存的是 | 内容 + 样式规则 | 排好版的页面,每字符有绝对坐标 |
| 换屏幕大小 | 自动重新分页 | 只能整页缩放 |
| 改字号 | 内容重排 | 改不了 |
| 「第几页」 | 动态概念,不稳定 | 固定 |
| 六寸屏体验 | 好 | 要么字太小,要么要横向拖动 |
这就是六寸墨水屏几乎不用 PDF 的根本原因——屏幕越小,重排式的优势越大。
反过来,凡是「版式即内容」的东西,PDF 是唯一正确选择:
- 论文里公式与正文的排布关系
- 乐谱
- 扫描件
- 图文精确对位的画册、说明书
把这些转成重排式,必然破坏信息。
五种格式的定位
| 格式 | 本质 | 最适合 | 主要短板 |
|---|---|---|---|
| EPUB | ZIP + HTML + CSS,开放标准 | 通用主力,长期归档 | 各阅读器呈现有差异 |
| AZW3 (KF8) | 亚马逊格式,支持较完整 CSS | 老 Kindle 书库 | 生态封闭 |
| MOBI | 老亚马逊格式,整块 HTML | 已基本淘汰 | 排版能力弱 |
| 固定版式 | 版面携带信息的内容 | 小屏几乎不可读 | |
| TXT | 纯文本 | 程序处理、极限兼容 | 无目录无样式,编码是坑 |
Kindle 现在该发什么格式
直接发 EPUB。
亚马逊已经逐步淘汰 MOBI 作为推送格式,「发送到 Kindle」现在直接接受 EPUB,由服务端自动转成 Kindle 内部格式——效果通常比你本地转的更好,因为它掌握目标格式的全部细节。
几点补充:
- 手上已有的
.mobi/.azw3老书拷进设备一般仍能读,只是排版是老格式的水平 - 想统一书库到 EPUB,注意 MOBI6 和 KF8 内部结构完全不同,转换效果差别很大,细节见Kindle 书搬家到 EPUB
- 从商店买的带 DRM 的书,浏览器端工具解不了也不该去解——换设备用官方同步机制
TXT 什么时候是最优解
当你要的是文字本身,而不是阅读体验:
- 统计字数、词频分析、生成词云
- 导入笔记软件或知识库
- 老式阅读器 / 车机 / 单片机屏幕只认纯文本
- 做校对——纯文本 diff 起来最方便
TXT 的不可替代之处是可被程序处理,且永不过时。代价是没有目录、没有样式、没有插图,而且编码是最大的坑——中文 TXT 在 GBK 和 UTF-8 之间反复横跳,记事本打开乱码是家常便饭。
所以正确姿势是两份并存而不是二选一:日常阅读用 EPUB,需要处理文字时用EPUB 转 TXT临时导出一份。导出时的编码选择、章节标题从哪来、换行怎么产生,见EPUB 转 TXT 的章节顺序与编码。
转换时必然丢失什么
丢失是单向的——从表达能力强的格式转到弱的,中间的信息回不来。
| 转换方向 | 会丢什么 |
|---|---|
| 任意 → TXT | 目录、样式、插图、注释、内部跳转全丢 |
| EPUB → MOBI | 复杂 CSS、部分字体样式、精细排版被简化 |
| PDF → 重排格式 | 最易翻车:分栏打乱、页眉页脚混进正文、跨页表格断裂、公式变乱码;扫描版根本没有文字层 |
| 任意 → EPUB | 通常最安全,表达能力足够容纳多数来源 |
三条实务原则:
- 永远保留原始文件,转换产物当作副本
- 需要多种格式时,从能力最强的那份分别导出,不要链式转换——
A→B→C会叠加两次损失 - 转换后必须抽查:重点看目录、章节顺序、插图位置、首尾几页
同一本 EPUB 为什么各处显示不一样
因为 EPUB 是「内容 + 样式建议」,最终呈现由阅读器决定。变量有四个:
- 阅读器 CSS 支持程度不同——EPUB 3 的很多特性不是所有阅读器都实现,不支持就忽略
- 用户设置优先——你设的字号、行距、字体通常会覆盖书里的样式,这是特性不是 bug
- 默认字体不同——书里指定的字体没内嵌就回退到设备默认,中文书尤其明显
- 分页算法不同——所以「第 87 页」在不同阅读器里指向不同位置
区分是书的问题还是阅读器的问题,方法很简单:换一个阅读器打开,两个都错就是书的问题。
属于书本身的典型问题:章节顺序错乱(看 spine 定义)、目录点不动(锚点失效)、图片错位(路径或体积问题)。
给制作方的一条建议:样式尽量克制,别和用户设置对着干——强行锁死字号和字体的书,在小屏上往往最难读。
归档策略
EPUB 做主档,原始文件做备份,需要时再导出 TXT。
EPUB 适合做主档的理由很实在:本质是 ZIP + HTML,二十年后哪怕没有阅读器,解压出来也能看。
三件事决定书库是资产还是负债:
- 保留原件——转换有损,原件是唯一能重来的机会
- 元数据写全——书名、作者、系列、序号。各阅读器的排序和分组全靠它,文件名起得再好也没用。批量整理用EPUB 元数据编辑,具体字段怎么填才被各阅读器认,见EPUB 元数据与阅读器兼容
- 定期校验——ZIP 结构损坏的 EPUB 平时看不出来,等打不开时往往已经没备份了
自己写的稿子想做成 EPUB,用TXT 转 EPUB,章节识别的正则怎么调见网文 TXT 转 EPUB 的章节识别。