免费资源
PDF Inspector:先判断 PDF 类型,再决定是否 OCR
先检查 PDF 的文本、图片和页面信号,再提取原生文本并只把必要页面交给可选 OCR,最终得到可检索的 Ma
资源介绍
PDF Inspector:先判断 PDF 类型,再决定是否 OCR 资源介绍 PDF Inspector 是一个本地运行的 PDF 分类与文本提取工具。它会先检查每页的文本密度、图片覆盖和内容信号,把文档分成原生文本、扫描、图片或混合类型,再列出真正需要 OCR 的页面。这样可以避免把整份 PDF 都交给较慢的 OCR 流程。 它能帮你做什么 在导入知识库前判断 PDF 属于哪一种类型。 把原生文本 PDF 快速转换成结构清晰的 Markdown。 找出扫描页和异常编码页,只对这些页面执行 OCR。 在 Rust、Python、Node.js 或浏览器 WASM 项目中复用同一套检测与提取能力。 完成第一次原生文本 PDF 解析 先选一份可以正常复制文字的 PDF,安装 Python 包、Node 包或…
资源信息
- 资源类型
- 开源项目
- 版本
- v1.15.0
- 最近核验
- 2026.08.30