扫描书在电脑上看起来很清楚,放到手机上却可能需要不断放大、左右拖动。问题往往不在屏幕,而在文件仍然围绕固定页面组织。把扫描 PDF 转成 EPUB 的价值,是让识别后的文字适应阅读窗口,而不只是把文件扩展名换掉。
先确定你要保留什么
PDF 适合保留固定页面,流式 EPUB 更适合调整字号后继续阅读。EPUB 标准也允许固定版式,因此不能仅凭扩展名判断一本书是否可以自由重排。
小说、以正文为主的教材,通常更看重阅读连贯性;插图与标注位置紧密关联的手册,则应保留 PDF 作为参照。像素级还原和流式阅读是不同目标,转换前先选定优先级。
判断源文件需要哪些处理
尝试选中一段文字:如果只能选中整块图片,通常需要 OCR。即便能选择文字,也要复制一段检查是否乱码、缺字或顺序混乱。已有文字层并不代表文字层可靠。
至少检查章节开头、普通正文、最复杂的一页。注意书脊阴影、倾斜、裁掉的页边、模糊小字和跨页段落。优先使用清晰原件;单纯放大低分辨率图片不会自动找回已经丢失的细节。
先用有代表性的文件试转换
在 PDF Craft 转换页面选择 EPUB 输出。先处理一个较短但包含典型难点的文件,再决定是否处理整套资料。书里有脚注、表格或公式,样本里就应包含这些元素,不要只用封面验证。
PDF Craft 将识别和文档转换放在同一流程中,目标是得到可以继续阅读的产物,而不是一份松散的文字堆积。扫描质量和复杂排版仍会影响结果,不能把“任务完成”理解成“识别完全正确”。如果目的是编辑段落和整理笔记,可以先看 PDF 转 Markdown 指南。
在实际阅读器里验收
打开 EPUB,调大字号、缩小窗口,检查段落能否自然重排。查看目录是否能定位到对应章节,标题有没有混入正文,插图及说明是否仍能一起理解。
对照原 PDF 读过一处分页位置,特别留意页眉重复、跨页断词、多栏串行以及脚注标号错配。建议逐项确认:
- 抽查章节的开头和结尾都在。
- 段落顺序和原书一致。
- 关键人名、数字、符号没有明显错误。
- 调大字号后不需要持续横向滚动。
- 注释与插图仍能找到对应正文。
保留原件作为引用依据
流式排版会改变文字在屏幕上的位置,EPUB 页码不一定对应印刷页码。做摘录时记录原书版本和原 PDF 页码,不要只保留转换后的阅读位置。
如果样本仍需要大量修正,先改善扫描质量或继续使用 PDF,再投入整本书的处理。技术类资料可以继续使用公式与脚注检查清单。好的转换结果,应当既读得下去,也查得回原文。