项目Projects

Scriptorium

Scriptorium 是一个面向历史文献的本地 OCR 工具。它在浏览器中打开 PDF 页面,识别正文与注释,并让读者对照扫描图像校订文字。

项目关注的问题

历史印刷文献的正文、页下注释和左右侧注分布在页面的不同位置。Scriptorium 按页处理文献,区分这些区域,整理阅读顺序,并尽量保留原文的自然段。

工作过程

打开需要的 PDF 页面后,工具将页面转换为图像,识别文字位置和内容。读者可以同时查看扫描图像、识别文字、PDF 页序和印刷页码,随后修改识别结果,再复制或导出已经处理的页面文字。

识别过程在本机进行。macOS 默认使用 Apple Vision;Windows 使用 Tesseract.js。两种识别方式处理同一页面时可能产生不同结果。

当前范围

项目目前主要使用法语历史印刷文献验证。复杂版式、低质量扫描、手写批注,以及正文与注释的分类仍需要读者对照原页检查。原始拼写、日期数字和页码以扫描原页为准。

查看 Scriptorium 源代码与使用说明 ↗