
如果你要把一批旧书做成 EPUB,或把一组论文整理成 Markdown,目标是一批能阅读、能查回原件的文件,而不只是所有任务都显示完成。先试转不同类型的文件,可以避免把同一种错误带到整批资料;逐份记录结果,则能让你知道哪些可以交付、哪些需要修正、哪些要重试。
提交前先分组
先按预期产物分组:准备长期阅读的书籍选择 EPUB,用于摘录和编辑的论文选择 Markdown。再把公式、多栏或脚注特别复杂的文件标出来,给它们安排更细的验收。这样同一批文件才会采用合适的设置和检查方式。
给原件保留稳定文件名;名称有歧义时,另外记录书名、版本或年份。原文件与输出文件分开存放。文件限制和处理价格以当前界面及定价页为准,不要依赖记忆中的旧数字。
用小样本确定验收标准
样本要同时包含普通文件和困难文件。资料集中有公式和表格,就不能只用纯文字文档试转。使用计划批量应用的选项,检查 EPUB 的章节顺序,或 Markdown 的标题和表格结构。
记录能得到可接受产物的设置,再扩大范围。PDF Craft 的单次转换与批量处理在这里形成配合:先验证输出,再重复已确认的处理方式。
启动批次并跟踪单个结果
登录后进入批量转换工作区,检查文件列表和选项后再启动。保留批次或任务编号,便于稍后回来查找。
批次提交成功不代表每个文件都已完成。处理过程中查看已有任务状态,不要因为关闭过浏览器标签就重新提交相同资料。
需要程序化集成时,参考公开 API 文档。网页中存在某项功能,不代表一定有对应的公开 API 端点,集成应以文档明确列出的能力为准。
区分任务失败和结果不合格
失败任务需要查看报错,判断输入、设置或服务状态是否需要处理;已经生成文件但含识别错误,则需要内容检查。两类问题不应该采用完全相同的重试方式。
解决原因后,只重试确有必要的文件。原样重复提交可能再次失败,也可能产生额外处理消耗。建议记录原文件名、转换选项、任务编号、结果文件名、审阅状态和问题摘要。这是你自己的验收记录,不意味着系统已经自动完成了人工校对。
用一张清单给每份文件作结论
为每个文件留一行记录:原文件名、预期用途、转换选项、任务编号、产物名、抽查结果和下一步。结论只需清楚区分三种情况:处理失败,先查报错;文件已生成但内容待修,先回原页定位;验收通过,归档并保留原件。若多个文件出现同类错误,暂停后续提交,重新检查样本设置。
flowchart TB
accTitle: 批量任务的验收闭环
accDescr: 先分组和试样,再提交批次,按文件核对结果。通过的归档;失败或内容有问题的只处理受影响文件。
A[分组与代表性试样] --> B[提交批次]
B --> C[逐文件核对结果]
C --> D{内容和任务都通过?}
D -- 是 --> E[归档并保留原件]
D -- 否 --> F[定位原因并处理受影响文件]
下载文件,确认交付物可用
抽样打开下载文件,确认名称能对应来源,相关图片与素材没有丢失。EPUB 至少试读一段并测试目录;Markdown 至少查看一处标题、表格和原页信息。较大的资料集应按不同源文件类型分别抽样,不要用一本普通书代表所有复杂资料。
把已接受结果与待修订文件分开,保留原 PDF 和处理说明。复杂页继续使用技术 OCR 检查清单。批量工作的完成标准应是“结果可用且能够追溯”,不只是进度条已经走完。

