面向图片型 PDF
通过 OCR 把 PDF 转成 EPUB
先从图片型 PDF 里恢复文字,再得到更方便检查、搜索和阅读的 EPUB。
- 导出更可读的 EPUB
- 先在桌面端检查
将 PDF 或 EPUB 拖到这里
将 PDF 转换为 EPUB 或 Markdown。也可以翻译 PDF 或 EPUB 电子书。
每次处理一个文件先做 OCR,再把 PDF 变成更可读的 EPUB
这类任务的关键在于把文字从图片页里尽量恢复出来。只有 OCR 足够可用,导出的 EPUB 才更适合搜索、检查和连续阅读。
适合那些必须先恢复文字的 PDF
扫描书、归档文档、课堂笔记等 PDF,如果文字还困在图片里,通常都要先经过 OCR,内容才真正适合阅读或查阅。
OCR 会改变 EPUB 最终能做到什么
只有把文字识别出来,结果才更接近可搜索、可检查、可持续阅读的内容,而不是一组静态图片页。
在长时间阅读前,先看一遍结果很重要
做完 OCR 和导出后,通常还要检查明显识别错误,看看语句是否通顺,再决定这份 EPUB 是否适合长期阅读。
适合先核对识别结果,再决定是否留用
下载桌面端后,可以先看 OCR 后的正文是否通顺、结构是否完整,再把这份 EPUB 留作阅读或资料整理。