标签: OCR

清除筛选

PDF 转 Markdown:pdf-inspector 分类与 OCR 路由

PDF 处理系统经常把所有文件交给同一个解析器,遇到扫描件、图片型报告或混合文档时,再用 OCR 兜底。这样做会让本来带有文本层的 PDF 也进入高延迟流程。Firecrawl 开源的 pdf-inspector 把判断步骤独立出来:先识别文档类型,再决定哪些页面可以本地提取,哪些页面需要 OCR,最后把可提取内容整理为 Markdown。 pdf-insp…

RustOCRPDF

PaddleOCR 超越 Tesseract,成为 GitHub 星标最高的 OCR 项目

PaddleOCR 百度旗下的 PaddleOCR 已超过 Tesseract,成为 GitHub 上星标数最高的 OCR 开源项目。截至 2026 年 3 月,该项目已获得超过 6 万个 star。 从 OCR 工具到文档 AI 引擎 PaddleOCR 最初定位为轻量级 OCR 工具包,经过数年迭代,目前已扩展为面向生产环境的文档 AI 引擎。3.0 版…