EPUB 转 TXT 把电子书还原成纯文本。EPUB 本质是一个装着 XHTML 网页的 ZIP 包,本工具解析它的 OPF 清单和 spine 阅读顺序,按正确次序抽出每章正文、去掉 HTML 标签,输出干净的 TXT,并尽量保留书名、作者和章节目录。
| 输入 | 输出 |
|---|---|
| 标准 EPUB 2 / EPUB 3 电子书 | 纯文本 TXT(UTF-8,可选 BOM) |
| 多本可一次拖入 | 单本直接下载,多本打包 ZIP |
| 自带 TOC / 正文标题 | 保留章节标题与顺序 |
META-INF/container.xml 定位 OPF 入口;<p>、<div>、<h1~6>、<li> 等)和 <br> 产生换行,<script>/<style> 被忽略;《书名》 与 作者:;不会。工具严格按 EPUB 的 spine(阅读顺序) 读取每个文档,而不是按文件名排序,因此章节顺序与在阅读器里翻页的顺序一致。目录标题优先取 EPUB 自带的 TOC(nav.xhtml 或 toc.ncx),取不到时退回正文里的首个标题。
这是纯文本导出,图片和插图会被丢弃(TXT 无法承载图像)。表格会被拆成一行行文字,公式若是图片则丢失、若是文字则保留。以文字小说 / 文档为主的 EPUB 转换效果最好;重排版的技术书、漫画不适合转 TXT。
有些 EPUB 每章正文里并没有把标题写成可见文字(标题只存在于目录)。选补齐章节标题后,工具会在每章开头插入一行目录标题;若该章正文首行已经是这个标题则不重复插入。选"仅空行分隔"则只用空行断章、不补标题,"不分隔"则各章文字直接相连。
勾选 UTF-8 BOM 让记事本正确识别编码,并把"换行符"切到 CRLF(Windows)——老版记事本只认 \r\n,用 LF 会让全文挤成一行。macOS、手机阅读器、VS Code 等用默认的 LF 即可。
基于 OpenCC 字典逐字转换(如"電腦"→"电脑"),对正文和章节标题同时生效。适合原文字形单一的书;若原文简繁混排或含特定人名地名写法,可能个别字误转,转完建议抽查预览再下载。
不会。EPUB 的解压、解析、文本提取全部在你的浏览器本地用 JavaScript 完成,文件不出本机,断网也能用。