2026年7月14日 杂记

2026/7/1487 阅读
2026年7月14日 杂记

今天做了什么

  • 两本扫描版教材的中文OCR与Markdown转换跑通了
  • 在Windows笔记本上搭了一套本地转换流程
  • 两本书加起来675页,六十多万字符
  • 建了一套可重复使用的通用流程

关于OCR这件事

今天把两本扫描版教材转成了Markdown。一本360页,一本315页,加起来675页,都是扫描版PDF,没有文本层,只能靠OCR硬识别。

关于环境搭建

先在Windows笔记本上装了一圈东西:Rust、Cargo、Visual Studio C++ Build Tools,然后装pdfly,再配RapidOCR、PP-OCRv6、ONNX Runtime。

pdfly对有文本层的PDF好用,但它的OCR后端不支持中文。所以换成RapidOCR处理中文扫描书。

关于这套流程

两本书跑完之后,电脑上已经有一套可复用的本地转换能力了。

中文扫描PDF自动OCR、每页断点保存意外中断能续跑、自动识别章节和多级标题、输出全文版和分章版、保留PDF页码便于回查原书、生成TXT和原始OCR坐标。章名和目录结束页可以针对不同教材单独配置。

下次再来一本书,直接复用就行。

关于资源消耗

大规模OCR主要靠笔记本本地CPU和内存跑,模型tokens只花在方案设计、脚本开发、结构修正和质量检查上。正文由本地OCR直接写入文件,没有把几十万字逐页喂给对话模型,这个策略是对的,不然tokens会炸。

后续

流程可以继续封装成批处理工具。几十本PDF扔进一个文件夹,自动逐本转换、断点续跑,输出成功清单和异常报告。特殊排版的再单独处理。

评论

暂无评论