# PDF 转 Markdown：把研究资料变成可编辑、可追溯的笔记

围绕标题、段落、表格、图片和引用来源，建立 PDF 转 Markdown 后的整理流程，让资料进入笔记系统前先保住内容含义。

当你想从 PDF 中整理提纲、摘录段落、补充笔记，或者把资料交给检索系统，Markdown 往往比固定页面更好编辑。不过，得到一个 .md 文件只是起点：真正重要的是它是否保留了原文的层次、顺序和来源。

## 先按用途选择输出格式

持续阅读一本书，可以优先考虑 EPUB；需要重组章节、修订文字、整理研究笔记，则适合 Markdown。两种格式可以同时保留，但都不应替代原 PDF 的视觉参照作用。

[CommonMark](https://spec.commonmark.org/0.31.2/)定义了一套核心语法，而不同编辑器对表格、公式和脚注的扩展支持可能不同。同一个文件在不同工具里看起来不一样，并不一定是转换时损坏了。

## 用最能暴露问题的样本试转

在 [PDF Craft](https://pdfcraft.ai/zh-CN/pdf-craft/)选择 Markdown 输出。样本除了普通正文，还应包含一页表格、公式、脚注或双栏内容。干净的标题页无法说明复杂论文的阅读顺序是否正确。

开始处理大文件前，查看当前选项和[计费说明](https://pdfcraft.ai/zh-CN/pricing/)。先确认结果能在目标笔记软件中使用，再扩大处理范围，可以减少重复整理的成本。

## 检查提纲，再检查段落

先只读所有标题，判断它们是否构成原文的章节结构。PDF 中字号较大的一行未必是真正的标题，重复页眉也不应该被误当作新章节。

接着精读一个小节。正文不应保持“印刷一行对应一个段落”的碎片状态；列表应保留顺序与层级；表格里的数值必须仍然对应正确的行、列和单位。每个数字都识别正确，也可能因为错列而改变含义。

不确定的数字和专有名词应标记待核对，不要为了让文档顺眼就直接改成自己预期的内容。格式修正和事实修正需要区分。

## 把原件、Markdown 和素材放在一起

如果输出包含图片引用，移动文件时同时保留相应素材，并在导入后打开几个链接检查。不要假设 PDF 里的每张图片都会自动变成长期可访问的网络地址。

在笔记中记录文档名称、版本或日期、原文件名及页码范围。以后将文档拆成多个笔记时，也把来源信息带过去。单独摘出一张表格，最好连同表头、单位和原页码一起保留，否则很难判断某个孤立数值究竟来自哪里。

## 进入知识库之前保留上下文

按章节或完整论述切分内容，把定义和依赖它的段落放在一起；表格与说明文字不要分离，脚注也不要随意拆成无来源的独立材料。

PDF Craft 提供的是可编辑的中间产物，不代表每句话已经核实。检索或 AI 回答可能继续传播识别错误，所以原件链接依然重要。最后在目标工具中预览文档、搜索一句有辨识度的话、打开图片引用，并抽查复杂表格。公式较多时，再走一遍[技术文档验收清单](https://pdfcraft.ai/zh-CN/blog/check-formulas-footnotes-after-ocr/)。
