普通段落錯一個字,讀者有時還能猜出意思;公式錯一個符號,推導卻可能完全改變。技術文件不能只看轉換有沒有完成、排版是不是整齊,更需要檢查符號、標籤和解釋之間的關係。
把識別與翻譯分開看
OCR 把掃描影象轉成文字或結構化內容,翻譯再處理識別結果。如果識別時已經丟了下標,或者把負號當成普通橫線,就不能指望後續翻譯可靠地猜回原式。
PDF Craft 提供文件識別與轉換流程,也有與公式、腳註有關的處理選項。保留公式應理解為儘量保留已識別的表達,不是保證原掃描中的每個符號都正確。複雜資料可以先在 PDF 轉換頁面處理樣本,再決定是否繼續翻譯。
對照原圖逐項核符號
挑一條同時包含上下標、分數、希臘字母或求和範圍的公式,與原頁影象比較,不要只和自己記憶中的公式比較。
特別注意數字 0 與字母 O、數字 1 與小寫 l、乘號與字母 x。檢查括號是否配對、負號是否存在、小數分隔是否正確,以及公式編號有沒有混入表示式。還應在實際閱讀器或編輯器中預覽,區分“內容識別錯了”和“工具不支援這種數學表示”。
從正文追到腳註,再返回
腳註是標記與說明之間的對應關係。抽查幾處正文標記,找到完整註釋,再確認編號和含義能夠對應。
頁尾可能混入正文,較短的註釋可能丟失,長註釋也可能在分頁處被截斷。即使連結可以點選,也要讀一下連線的內容。根據任務決定是否保留腳註:研究材料中的註釋可能包含論述限定或引用來源,並非都可省略。
檢查表格與雙欄順序
連續讀過一處跨欄段落,確認輸出沒有在左欄未結束時跳到右欄。抽查表格值時同時看行標題、列標題和單位,只看數字是不夠的。
| 原文位置 | 元素 | 核對內容 | 處理結論 |
|---|---|---|---|
| 章節樣本 | 公式 | 符號、下標、範圍 | 接受或修正 |
| 註釋樣本 | 腳註 | 標記、完整正文 | 接受或修正 |
| 表格樣本 | 資料 | 數值、標籤、單位 | 接受或修正 |
表格應填寫真實觀察結果,不要把幾個抽查點換算成沒有依據的“全文準確率”。
決定接受、修訂還是重做
如果錯誤集中在模糊、變形的頁上,優先尋找更清楚的來源;如果表達正確而顯示異常,先換工具或格式驗證,再決定是否重新處理。
用於筆記時參考 Markdown 整理流程,用於閱讀時參考 EPUB 轉換指南。公式、腳註和引用承載主要含義時,始終保留原 PDF 供複核。