普通段落错一个字,读者有时还能猜出意思;公式错一个符号,推导却可能完全改变。技术文档不能只看转换有没有完成、排版是不是整齐,更需要检查符号、标签和解释之间的关系。
把识别与翻译分开看
OCR 把扫描图像转成文字或结构化内容,翻译再处理识别结果。如果识别时已经丢了下标,或者把负号当成普通横线,就不能指望后续翻译可靠地猜回原式。
PDF Craft 提供文档识别与转换流程,也有与公式、脚注有关的处理选项。保留公式应理解为尽量保留已识别的表达,不是保证原扫描中的每个符号都正确。复杂资料可以先在 PDF 转换页面处理样本,再决定是否继续翻译。
对照原图逐项核符号
挑一条同时包含上下标、分数、希腊字母或求和范围的公式,与原页图像比较,不要只和自己记忆中的公式比较。
特别注意数字 0 与字母 O、数字 1 与小写 l、乘号与字母 x。检查括号是否配对、负号是否存在、小数分隔是否正确,以及公式编号有没有混入表达式。还应在实际阅读器或编辑器中预览,区分“内容识别错了”和“工具不支持这种数学表示”。
从正文追到脚注,再返回
脚注是标记与说明之间的对应关系。抽查几处正文标记,找到完整注释,再确认编号和含义能够对应。
页脚可能混入正文,较短的注释可能丢失,长注释也可能在分页处被截断。即使链接可以点击,也要读一下连接的内容。根据任务决定是否保留脚注:研究材料中的注释可能包含论述限定或引用来源,并非都可省略。
检查表格与双栏顺序
连续读过一处跨栏段落,确认输出没有在左栏未结束时跳到右栏。抽查表格值时同时看行标题、列标题和单位,只看数字是不够的。
| 原文位置 | 元素 | 核对内容 | 处理结论 |
|---|---|---|---|
| 章节样本 | 公式 | 符号、下标、范围 | 接受或修正 |
| 注释样本 | 脚注 | 标记、完整正文 | 接受或修正 |
| 表格样本 | 数据 | 数值、标签、单位 | 接受或修正 |
表格应填写真实观察结果,不要把几个抽查点换算成没有依据的“全文准确率”。
决定接受、修订还是重做
如果错误集中在模糊、变形的页上,优先寻找更清楚的来源;如果表达正确而显示异常,先换工具或格式验证,再决定是否重新处理。
用于笔记时参考 Markdown 整理流程,用于阅读时参考 EPUB 转换指南。公式、脚注和引用承载主要含义时,始终保留原 PDF 供复核。