PDF 转 Markdown:pdf-inspector 分类与 OCR 路由
PDF 处理系统经常把所有文件交给同一个解析器,遇到扫描件、图片型报告或混合文档时,再用 OCR 兜底。这样做会让本来带有文本层的 PDF 也进入高延迟流程。Firecrawl 开源的 pdf-inspector 把判断步骤独立出来:先识别文档类型,再决定哪些页面可以本地提取,哪些页面需要 OCR,最后把可提取内容整理为 Markdown。 pdf-insp…
PDF 处理系统经常把所有文件交给同一个解析器,遇到扫描件、图片型报告或混合文档时,再用 OCR 兜底。这样做会让本来带有文本层的 PDF 也进入高延迟流程。Firecrawl 开源的 pdf-inspector 把判断步骤独立出来:先识别文档类型,再决定哪些页面可以本地提取,哪些页面需要 OCR,最后把可提取内容整理为 Markdown。 pdf-insp…