
如果你要从一篇论文里摘出结论和数据,理想的笔记应能编辑,也能让你随时找到原文:这句话出自哪一节、表格的数字对应什么单位、疑问应回到哪一页核对。PDF 转 Markdown 的意义就在这里。它把固定页面变成便于整理的文字,但只有标题、段落、图表和来源关系保留下来,这份文字才适合进入笔记或检索系统。
先按用途选择输出格式
持续阅读一本书,可以优先考虑 EPUB;需要重组章节、修订文字、整理研究笔记,则适合 Markdown。两种格式可以同时保留,但都不应替代原 PDF 的视觉参照作用。
不同笔记软件对 Markdown 表格、公式和脚注的显示方式可能不同。同一个文件在两处看起来不一样,先检查文字和对应关系是否完整,再判断是转换问题还是显示问题。需要查语法细节时,可以参考 CommonMark 规范。
用最能暴露问题的样本试转
在 PDF Craft选择 Markdown 输出。样本除了普通正文,还应包含一页表格、公式、脚注或双栏内容。干净的标题页无法说明复杂论文的阅读顺序是否正确。
开始处理大文件前,查看当前选项和计费说明。先确认结果能在目标笔记软件中使用,再扩大处理范围,可以减少重复整理的成本。
检查提纲,再检查段落
先只读所有标题,判断它们是否构成原文的章节结构。PDF 中字号较大的一行未必是真正的标题,重复页眉也不应该被误当作新章节。
接着精读一个小节。正文不应保持“印刷一行对应一个段落”的碎片状态;列表应保留顺序与层级;表格里的数值必须仍然对应正确的行、列和单位。每个数字都识别正确,也可能因为错列而改变含义。
不确定的数字和专有名词应标记待核对,不要为了让文档顺眼就直接改成自己预期的内容。格式修正和事实修正需要区分。
把原件、Markdown 和素材放在一起
如果输出包含图片引用,移动文件时同时保留相应素材,并在导入后打开几个链接检查。不要假设 PDF 里的每张图片都会自动变成长期可访问的网络地址。
在笔记中记录文档名称、版本或日期、原文件名及页码范围。以后将文档拆成多个笔记时,也把来源信息带过去。单独摘出一张表格,最好连同表头、单位和原页码一起保留,否则很难判断某个孤立数值究竟来自哪里。
用一条笔记检查能否回到原件
假设你要保存一段研究结论和支撑它的一张表。笔记里除了结论,还应放入文献题名或版本、原 PDF 页码、表头、单位,以及所需图片素材的路径。不确定的数字先标为“待核对”。然后暂时关掉原件,只凭这条笔记找回原页:能找到结论,并看懂表格中每个数字指什么,才算通过。若找不到来源或表格失去表头,先补齐信息,再交给检索系统。
flowchart TB
accTitle: 可追溯的研究笔记
accDescr: 从原 PDF 得到 Markdown,先核对标题、表格和来源。核对通过后再拆成笔记;否则补正结构与引用。
A[原 PDF 与页码] --> B[转换成 Markdown]
B --> C{结构与来源可核对?}
C -- 是 --> D[进入笔记系统]
C -- 否 --> E[补正结构与引用]
E --> C
进入知识库之前保留上下文
按章节或完整论述切分内容,把定义和依赖它的段落放在一起;表格与说明文字、脚注与其正文标记也应一同保留。这样搜索结果带出的才是能理解、能核对的一段内容。
PDF Craft 提供的是可编辑的中间产物,不代表每句话已经核实。检索或 AI 回答可能继续传播识别错误,所以原件链接依然重要。最后在目标工具中预览文档、搜索一句有辨识度的话、打开图片引用,并抽查复杂表格。公式较多时,再走一遍技术文档验收清单。

