EPUB / MOBI / AZW3 / PDF / TXT 到底怎么选:按设备和用途倒推的电子书格式决策表

· 约 5 分钟 📖 EPUB 转 TXT

选电子书格式常被当成「哪个更新更好」的问题,其实不是——五种格式解决的是不同问题,选错的代价是读起来痛苦或者信息丢失。

判断的第一刀,也是最重要的一刀,只有一个问题:版面本身携带信息吗?

第一刀:重排式 vs 固定版式

重排式(EPUB / MOBI / AZW3 / TXT)固定版式(PDF)
内部存的是内容 + 样式规则排好版的页面,每字符有绝对坐标
换屏幕大小自动重新分页只能整页缩放
改字号内容重排改不了
「第几页」动态概念,不稳定固定
六寸屏体验要么字太小,要么要横向拖动

这就是六寸墨水屏几乎不用 PDF 的根本原因——屏幕越小,重排式的优势越大

反过来,凡是「版式即内容」的东西,PDF 是唯一正确选择:

  • 论文里公式与正文的排布关系
  • 乐谱
  • 扫描件
  • 图文精确对位的画册、说明书

把这些转成重排式,必然破坏信息。

五种格式的定位

格式本质最适合主要短板
EPUBZIP + HTML + CSS,开放标准通用主力,长期归档各阅读器呈现有差异
AZW3 (KF8)亚马逊格式,支持较完整 CSS老 Kindle 书库生态封闭
MOBI老亚马逊格式,整块 HTML已基本淘汰排版能力弱
PDF固定版式版面携带信息的内容小屏几乎不可读
TXT纯文本程序处理、极限兼容无目录无样式,编码是坑

Kindle 现在该发什么格式

直接发 EPUB。

亚马逊已经逐步淘汰 MOBI 作为推送格式,「发送到 Kindle」现在直接接受 EPUB,由服务端自动转成 Kindle 内部格式——效果通常比你本地转的更好,因为它掌握目标格式的全部细节。

几点补充:

  • 手上已有的 .mobi / .azw3 老书拷进设备一般仍能读,只是排版是老格式的水平
  • 想统一书库到 EPUB,注意 MOBI6 和 KF8 内部结构完全不同,转换效果差别很大,细节见Kindle 书搬家到 EPUB
  • 从商店买的带 DRM 的书,浏览器端工具解不了也不该去解——换设备用官方同步机制

TXT 什么时候是最优解

当你要的是文字本身,而不是阅读体验:

  • 统计字数、词频分析、生成词云
  • 导入笔记软件或知识库
  • 老式阅读器 / 车机 / 单片机屏幕只认纯文本
  • 做校对——纯文本 diff 起来最方便

TXT 的不可替代之处是可被程序处理,且永不过时。代价是没有目录、没有样式、没有插图,而且编码是最大的坑——中文 TXT 在 GBK 和 UTF-8 之间反复横跳,记事本打开乱码是家常便饭。

所以正确姿势是两份并存而不是二选一:日常阅读用 EPUB,需要处理文字时用EPUB 转 TXT临时导出一份。导出时的编码选择、章节标题从哪来、换行怎么产生,见EPUB 转 TXT 的章节顺序与编码

转换时必然丢失什么

丢失是单向的——从表达能力强的格式转到弱的,中间的信息回不来。

转换方向会丢什么
任意 → TXT目录、样式、插图、注释、内部跳转全丢
EPUB → MOBI复杂 CSS、部分字体样式、精细排版被简化
PDF → 重排格式最易翻车:分栏打乱、页眉页脚混进正文、跨页表格断裂、公式变乱码;扫描版根本没有文字层
任意 → EPUB通常最安全,表达能力足够容纳多数来源

三条实务原则:

  1. 永远保留原始文件,转换产物当作副本
  2. 需要多种格式时,从能力最强的那份分别导出,不要链式转换——A→B→C 会叠加两次损失
  3. 转换后必须抽查:重点看目录、章节顺序、插图位置、首尾几页

同一本 EPUB 为什么各处显示不一样

因为 EPUB 是「内容 + 样式建议」,最终呈现由阅读器决定。变量有四个:

  • 阅读器 CSS 支持程度不同——EPUB 3 的很多特性不是所有阅读器都实现,不支持就忽略
  • 用户设置优先——你设的字号、行距、字体通常会覆盖书里的样式,这是特性不是 bug
  • 默认字体不同——书里指定的字体没内嵌就回退到设备默认,中文书尤其明显
  • 分页算法不同——所以「第 87 页」在不同阅读器里指向不同位置

区分是书的问题还是阅读器的问题,方法很简单:换一个阅读器打开,两个都错就是书的问题

属于书本身的典型问题:章节顺序错乱(看 spine 定义)、目录点不动(锚点失效)、图片错位(路径或体积问题)。

给制作方的一条建议:样式尽量克制,别和用户设置对着干——强行锁死字号和字体的书,在小屏上往往最难读。

归档策略

EPUB 做主档,原始文件做备份,需要时再导出 TXT。

EPUB 适合做主档的理由很实在:本质是 ZIP + HTML,二十年后哪怕没有阅读器,解压出来也能看

三件事决定书库是资产还是负债:

  1. 保留原件——转换有损,原件是唯一能重来的机会
  2. 元数据写全——书名、作者、系列、序号。各阅读器的排序和分组全靠它,文件名起得再好也没用。批量整理用EPUB 元数据编辑,具体字段怎么填才被各阅读器认,见EPUB 元数据与阅读器兼容
  3. 定期校验——ZIP 结构损坏的 EPUB 平时看不出来,等打不开时往往已经没备份了

自己写的稿子想做成 EPUB,用TXT 转 EPUB,章节识别的正则怎么调见网文 TXT 转 EPUB 的章节识别

❓ 常见问题

重排式和固定版式的根本区别是什么?

重排式存的是内容和样式规则,固定版式存的是排好版的页面——决定了它们在小屏上的命运完全不同重排式(EPUB / MOBI / AZW3 / TXT):(1) 内部是 HTML 加 CSS,文字是流动的;(2) 阅读器根据屏幕宽度、字号、边距当场重新计算分页;(3) 所以你改字号、换设备,内容会自动适配,「第几页」是动态的。固定版式(PDF):(1) 每一页的每个字符都有绝对坐标,页面是一张排好版的定稿;(2) 阅读器只能整页缩放,不能重新排;(3) 所以在六寸屏上要么字小到看不清,要么放大后需要横向拖动。推论:(1) 屏幕越小,重排式的优势越大——这是六寸墨水屏几乎不用 PDF 的根本原因;(2) 反过来,凡是「版式即内容」的东西(论文的公式排布、乐谱、扫描件、有精确图文位置的画册),PDF 是唯一正确选择,转成重排式必然破坏信息;(3) 判断标准很简单:版面本身携带信息吗?携带就用 PDF,不携带就用 EPUB。

Kindle 现在还认 MOBI 吗?该用什么格式发书?

亚马逊已经逐步淘汰 MOBI 作为推送格式,现在推荐直接发 EPUB背景:(1) MOBI 是很老的格式,内部是整块 HTML 加字节偏移,排版能力弱;(2) AZW3(KF8)是它的继任者,支持更完整的 CSS;(3) 后来亚马逊在「发送到 Kindle」中直接接受 EPUB,由服务端自动转成 Kindle 内部格式。实务建议:(1) 自己的书发 Kindle,首选 EPUB,让亚马逊去做转换,效果通常比你本地转的好;(2) 手上已有的 .mobi / .azw3 老书,直接拷进设备一般仍能读,但排版是老格式的水平;(3) 想统一书库到 EPUB,用 MOBI/AZW3 转 EPUB 工具处理,注意 MOBI6 和 KF8 内部结构不同、转换效果差别很大。一个容易踩的坑:从亚马逊商店买的书带 DRM,任何浏览器端工具都解不了,也不应该去解——那是账号授权的内容,换设备请用官方的同步机制。

什么时候 TXT 反而是最优解?

当你要的是文字本身,而不是阅读体验的时候TXT 的优势:(1) 没有任何格式包袱——任何设备、任何编辑器、任何脚本都能直接读;(2) 体积最小,一本长篇小说往往只有几百 KB;(3) 可被程序处理——搜索、统计、分词、喂给其他工具,都不需要先解包;(4) 永不过时,二十年后一定还能打开。典型场景:(1) 想统计字数、做词频分析、生成词云;(2) 要把内容导入笔记软件或知识库;(3) 老式阅读器 / 车机 / 单片机屏幕只认纯文本;(4) 做校对——纯文本 diff 起来最方便。代价:(1) 没有目录,长书里跳章节全靠搜索;(2) 没有加粗斜体、没有注释、没有插图;(3) 编码是最大的坑——中文 TXT 在 GBK 和 UTF-8 之间反复横跳,记事本打开乱码是家常便饭。建议:日常阅读用 EPUB,需要处理文字时临时导出一份 TXT,两份并存而不是二选一。

格式互转时,哪些东西必然会丢?

丢失是单向的——从表达能力强的格式转到弱的,中间的信息回不来能力排序(粗略):PDF(固定版式,另一维度)> EPUB ≈ AZW3 > MOBI > TXT。逐项:(1) 转 TXT——目录、样式、插图、注释、内部跳转全部丢失,只剩纯文字和你选择保留的换行;(2) EPUB 转 MOBI——复杂 CSS、部分字体样式、精细排版会被简化;(3) PDF 转任何重排格式——这是最容易翻车的方向:分栏会被打乱、页眉页脚混进正文、跨页的表格断裂、公式变成乱码或图片、扫描版 PDF 根本没有文字层(需要先 OCR);(4) 转 EPUB 通常是最安全的方向,因为它的表达能力足够容纳大多数来源。实务原则:(1) 永远保留原始文件,转换产物当作副本;(2) 需要多种格式时,从能力最强的那份分别导出,而不是链式转换(A→B→C 会叠加两次损失);(3) 转换后必须抽查——重点看目录、章节顺序、插图位置、以及首尾几页。

为什么同一本 EPUB 在不同阅读器里显示不一样?

因为 EPUB 是「内容加样式建议」,最终怎么呈现由阅读器决定变量来源:(1) 阅读器的 CSS 支持程度不同——EPUB 3 的很多特性不是所有阅读器都实现,不支持的就忽略;(2) 用户设置优先——你设的字号、行距、字体、边距通常会覆盖书里的样式,这是特性不是 bug;(3) 默认字体不同——书里指定的字体如果没内嵌,就回退到设备默认,中文书在这一点上尤其明显;(4) 分页算法不同——所以「第 87 页」在不同阅读器里指向不同位置,EPUB 里页码本来就不是稳定概念。哪些是书本身的问题:(1) 章节顺序错乱——看 spine 定义,不是阅读器的锅;(2) 目录点不动——目录文件里的锚点失效;(3) 图片错位或不显示——路径或体积问题。排查思路:换一个阅读器打开,两个都错就是书的问题,只有一个错就是阅读器兼容性问题。给制作方的建议:样式尽量克制,别和用户设置对着干——强行锁死字号和字体的书,在小屏上往往最难读。

一本书我该存哪种格式做长期归档?

EPUB 做主档,原始文件做备份,需要时再导出 TXT——不要只留一份转换产物为什么 EPUB 做主档:(1) 开放标准,本质是 ZIP 加 HTML,二十年后哪怕没有阅读器,解压出来也能看;(2) 表达能力够用,目录、样式、插图、元数据都能容纳;(3) 生态最广,几乎所有平台都能读或能转。为什么还要留原始文件:转换是有损的,原始件是你唯一能重来的机会。元数据同样重要:(1) 归档时把书名、作者、系列、序号写规范,否则几百本之后书库会彻底失控;(2) 各阅读器排序和分组全靠元数据,文件名起得再好也没用。目录结构建议:(1) 按「作者 / 系列 / 序号 书名」组织;(2) 同一本书的不同格式放同一目录,用后缀区分;(3) 定期校验——ZIP 结构损坏的 EPUB 平时看不出来,等到打不开时往往已经没有备份了。一句话:主档 EPUB、原件保留、元数据写全,这三件做到,书库才是资产而不是负债。

📖 打开 EPUB 转 TXT 电子书提取纯文本·保留章节目录·书名作者·简繁转换·BOM/CRLF·多本批量·本地处理

📖 同一工具的其他教程

🔗 相关阅读

全部教程 →