# PDF 轉 Markdown：把研究資料變成可編輯、可追溯的筆記

圍繞標題、段落、表格、圖片和引用來源，建立 PDF 轉 Markdown 後的整理流程，讓資料進入筆記系統前先保住內容含義。

當你想從 PDF 中整理提綱、摘錄段落、補充筆記，或者把資料交給檢索系統，Markdown 往往比固定頁面更好編輯。不過，得到一個 .md 檔案只是起點：真正重要的是它是否保留了原文的層次、順序和來源。

## 先按用途選擇輸出格式

持續閱讀一本書，可以優先考慮 EPUB；需要重組章節、修訂文字、整理研究筆記，則適合 Markdown。兩種格式可以同時保留，但都不應替代原 PDF 的視覺參照作用。

[CommonMark](https://spec.commonmark.org/0.31.2/)定義了一套核心語法，而不同編輯器對錶格、公式和腳註的擴充套件支援可能不同。同一個檔案在不同工具裡看起來不一樣，並不一定是轉換時損壞了。

## 用最能暴露問題的樣本試轉

在 [PDF Craft](https://pdfcraft.ai/zh-Hant/pdf-craft/)選擇 Markdown 輸出。樣本除了普通正文，還應包含一頁表格、公式、腳註或雙欄內容。乾淨的標題頁無法說明覆雜論文的閱讀順序是否正確。

開始處理大檔案前，檢視當前選項和[計費說明](https://pdfcraft.ai/zh-Hant/pricing/)。先確認結果能在目標筆記軟體中使用，再擴大處理範圍，可以減少重複整理的成本。

## 檢查提綱，再檢查段落

先只讀所有標題，判斷它們是否構成原文的章節結構。PDF 中字號較大的一行未必是真正的標題，重複頁首也不應該被誤當作新章節。

接著精讀一個小節。正文不應保持“印刷一行對應一個段落”的碎片狀態；列表應保留順序與層級；表格裡的數值必須仍然對應正確的行、列和單位。每個數字都識別正確，也可能因為錯列而改變含義。

不確定的數字和專有名詞應標記待核對，不要為了讓文件順眼就直接改成自己預期的內容。格式修正和事實修正需要區分。

## 把原件、Markdown 和素材放在一起

如果輸出包含圖片引用，移動檔案時同時保留相應素材，並在匯入後開啟幾個連結檢查。不要假設 PDF 裡的每張圖片都會自動變成長期可訪問的網路地址。

在筆記中記錄文件名稱、版本或日期、原檔名及頁碼範圍。以後將文件拆成多個筆記時，也把來源資訊帶過去。單獨摘出一張表格，最好連同表頭、單位和原頁碼一起保留，否則很難判斷某個孤立數值究竟來自哪裡。

## 進入知識庫之前保留上下文

按章節或完整論述切分內容，把定義和依賴它的段落放在一起；表格與說明文字不要分離，腳註也不要隨意拆成無來源的獨立材料。

PDF Craft 提供的是可編輯的中間產物，不代表每句話已經核實。檢索或 AI 回答可能繼續傳播識別錯誤，所以原件連結依然重要。最後在目標工具中預覽文件、搜尋一句有辨識度的話、開啟圖片引用，並抽查複雜表格。公式較多時，再走一遍[技術文件驗收清單](https://pdfcraft.ai/zh-Hant/blog/check-formulas-footnotes-after-ocr/)。
