在线处理 PDF 与 EPUB
PDF Craft:扫描版 PDF OCR 与转换
将扫描版 PDF 识别为可搜索、可编辑的 Markdown 或 EPUB,并尽量保留版面、公式、表格和阅读结构。也支持翻译 PDF 和 EPUB 电子书。
- 公式、表格、复杂版面都能做 OCR
- Markdown、EPUB 或翻译后的 PDF 都能导出
将 PDF 或 EPUB 拖到这里
将 PDF 转换为 EPUB 或 Markdown。也可以翻译 PDF 或 EPUB 电子书。
每次处理一个文件处理扫描版 PDF,最该看这 4 点
重点不只是把扫描件识别成文字,而是把它整理成后面还能搜索、编辑和继续阅读的内容。OCR 质量、版面保留和导出可用性,都会直接影响结果。
哪些 PDF 最值得转
书籍、论文、教材、讲义、双栏排版,以及带公式、表格、脚注的扫描件,都是这类能力最能拉开差距的场景。
最后拿到什么
你会拿到更适合搜索、复制、校对和再加工的 EPUB 或 Markdown,而不是只看得见、改不动的图片页面。
转完之后怎么接着用
先在桌面端检查识别和排版,再继续导出、归档或阅读;如果想换设备,也能在 iPhone 和 iPad 上接着看。
为什么不只是基础 OCR
能把字认出来还不够。真正可用的结果,还要尽量保住公式、表格、版面和阅读顺序,并方便后续搜索、编辑和再加工。
常见问题
关于格式选择、转换结果和费用,按需查看。
EPUB 和 Markdown 应该选哪个?
希望以可调整字号的电子书形式阅读,选择 EPUB;需要编辑文本、继续处理文档或准备知识库内容,选择 Markdown。两者都不应被视为 PDF 版面的完全复制。
转换后应该检查哪些地方?
对照 PDF 检查标题、段落顺序和章节边界。论文还应检查双栏阅读顺序、公式、表格和脚注。再次使用文本前,请修正识别错误。
哪些情况会影响 OCR 质量?
扫描模糊、页面倾斜、字号过小或版面复杂,都可能增加识别难度。请保留原始 PDF,方便核对不确定的文字;任务完成不代表输出没有错误。
转换费用和处理时间怎么看?
当前计费方式请查看定价页。处理时间会受到文档情况和服务负载影响,请以任务状态为准,不要预设固定完成时间。
详细指南:格式对照、检查流程与参考资料
先选好输出格式,再检查文档中最重要的部分。OCR 识别和版面重建可能产生错误,处理成功并不等于内容完全准确。
指南更新
怎样按用途选择输出格式?
| 输出格式与用途 | 下载后重点检查什么? |
|---|---|
| EPUB:连续阅读与调整字号 | 用目标阅读器打开文件,调整字号,检查目录能否定位章节、段落是否顺序连贯。原 PDF 的页码和分页可能不适合重排后的内容,引用原文时请回查原件。 |
| Markdown:编辑与后续处理 | 在实际使用的编辑器或知识库流程中检查标题层级、列表和图片引用。核对公式、表格中的数字与单位,再决定如何切分段落;纯文本可读取不等于语义和结构已准确还原。 |
一次转换应该怎样完成检查?
- 先检查原件:挑选包含正文、表格或公式的代表性页面,记录最需要保留的信息,并保留原 PDF 供对照。不要只根据封面判断整份文档的扫描质量。
- 按阅读或编辑用途选择输出格式并提交任务。以任务列表中的实际状态为准;若任务失败,记录错误信息后再处理,避免在原因不明时反复提交同一文件。
- 下载后先核对代表性页面,再检查章节之间是否有漏段、重复或顺序颠倒。将不确定的字符、数值和脚注与原件逐一对照,完成修订后再用于引用或知识库。
这些格式说明依据什么?
W3C 的 EPUB 3.3 规范将 EPUB 定义为数字出版物的分发与交换格式。它描述出版物的打包和阅读结构,并不保证某个转换工具的识别或翻译质量。
distribution and interchange format for digital publications and documents
W3C 原文摘录
CommonMark 可用于理解 Markdown 的基础语法。表格、公式等扩展的呈现还取决于你使用的编辑器或后续处理工具。