跳到主要内容

在线处理 PDF 与 EPUB

PDF Craft:扫描版 PDF OCR 与转换

将扫描版 PDF 识别为可搜索、可编辑的 Markdown 或 EPUB,并尽量保留版面、公式、表格和阅读结构。也支持翻译 PDF 和 EPUB 电子书。

  • 公式、表格、复杂版面都能做 OCR
  • Markdown、EPUB 或翻译后的 PDF 都能导出

PDFEPUB 拖到这里

将 PDF 转换为 EPUB 或 Markdown。也可以翻译 PDF 或 EPUB 电子书。

每次处理一个文件

处理扫描版 PDF,最该看这 4 点

重点不只是把扫描件识别成文字,而是把它整理成后面还能搜索、编辑和继续阅读的内容。OCR 质量、版面保留和导出可用性,都会直接影响结果。

  1. 哪些 PDF 最值得转

    书籍、论文、教材、讲义、双栏排版,以及带公式、表格、脚注的扫描件,都是这类能力最能拉开差距的场景。

  2. 最后拿到什么

    你会拿到更适合搜索、复制、校对和再加工的 EPUB 或 Markdown,而不是只看得见、改不动的图片页面。

  3. 转完之后怎么接着用

    先在桌面端检查识别和排版,再继续导出、归档或阅读;如果想换设备,也能在 iPhone 和 iPad 上接着看。

  4. 为什么不只是基础 OCR

    能把字认出来还不够。真正可用的结果,还要尽量保住公式、表格、版面和阅读顺序,并方便后续搜索、编辑和再加工。

桌面端 + iOS

转换结束后,在本地继续校对、阅读和导出

桌面端更适合处理扫描 PDF、检查 OCR 结果和整理导出;iOS 更适合随手继续阅读。内容和阅读记录留在本地,同一个客户端还能继续打开 EPUB、PDF、TXT、漫画 ZIP 和 M4B。

EPUB PDF ZIP M4B
查看客户端下载

常见问题

关于格式选择、转换结果和费用,按需查看。

EPUB 和 Markdown 应该选哪个?

希望以可调整字号的电子书形式阅读,选择 EPUB;需要编辑文本、继续处理文档或准备知识库内容,选择 Markdown。两者都不应被视为 PDF 版面的完全复制。

转换后应该检查哪些地方?

对照 PDF 检查标题、段落顺序和章节边界。论文还应检查双栏阅读顺序、公式、表格和脚注。再次使用文本前,请修正识别错误。

哪些情况会影响 OCR 质量?

扫描模糊、页面倾斜、字号过小或版面复杂,都可能增加识别难度。请保留原始 PDF,方便核对不确定的文字;任务完成不代表输出没有错误。

转换费用和处理时间怎么看?

当前计费方式请查看定价页。处理时间会受到文档情况和服务负载影响,请以任务状态为准,不要预设固定完成时间。

详细指南:格式对照、检查流程与参考资料

先选好输出格式,再检查文档中最重要的部分。OCR 识别和版面重建可能产生错误,处理成功并不等于内容完全准确。

指南更新

怎样按用途选择输出格式?

输出格式与用途下载后重点检查什么?
EPUB:连续阅读与调整字号用目标阅读器打开文件,调整字号,检查目录能否定位章节、段落是否顺序连贯。原 PDF 的页码和分页可能不适合重排后的内容,引用原文时请回查原件。
Markdown:编辑与后续处理在实际使用的编辑器或知识库流程中检查标题层级、列表和图片引用。核对公式、表格中的数字与单位,再决定如何切分段落;纯文本可读取不等于语义和结构已准确还原。

一次转换应该怎样完成检查?

  1. 先检查原件:挑选包含正文、表格或公式的代表性页面,记录最需要保留的信息,并保留原 PDF 供对照。不要只根据封面判断整份文档的扫描质量。
  2. 按阅读或编辑用途选择输出格式并提交任务。以任务列表中的实际状态为准;若任务失败,记录错误信息后再处理,避免在原因不明时反复提交同一文件。
  3. 下载后先核对代表性页面,再检查章节之间是否有漏段、重复或顺序颠倒。将不确定的字符、数值和脚注与原件逐一对照,完成修订后再用于引用或知识库。

这些格式说明依据什么?

W3C 的 EPUB 3.3 规范将 EPUB 定义为数字出版物的分发与交换格式。它描述出版物的打包和阅读结构,并不保证某个转换工具的识别或翻译质量。

W3C:EPUB 3.3 规范

distribution and interchange format for digital publications and documents

W3C 原文摘录

CommonMark 可用于理解 Markdown 的基础语法。表格、公式等扩展的呈现还取决于你使用的编辑器或后续处理工具。

CommonMark:Markdown 语法规范