Skip to content

fix(pdf): prevent unusable image-only ingestion - #2402

Open
WHUTcjh-2024 wants to merge 3 commits into
Tencent:mainfrom
WHUTcjh-2024:codex/fix-issue-2341-pdf-ocr
Open

fix(pdf): prevent unusable image-only ingestion#2402
WHUTcjh-2024 wants to merge 3 commits into
Tencent:mainfrom
WHUTcjh-2024:codex/fix-issue-2341-pdf-ocr

Conversation

@WHUTcjh-2024

@WHUTcjh-2024 WHUTcjh-2024 commented Jul 29, 2026

Copy link
Copy Markdown
Contributor

背景

修复扫描/图片型 PDF 在未开启多模态时,被标记为“解析成功”但只生成图片引用分块、无法参与问答的问题。

Closes #2341

改动

  • 对“扫描型 PDF + 无可用文本 + 未开启多模态”在分块前明确失败,返回 MULTIMODAL_OCR_REQUIRED,提示用户配置 VLM/OCR 后重新解析。
  • 内置 PDF 解析器在未开启 OCR 时,保守保留通过质量校验的原生文本层,避免带整页背景图的数字 PDF 被直接降级为不可检索图片。
  • 文本层回退仅作用于内置 PDF 解析器;已开启多模态、强制扫描模式和第三方解析器保持原有行为。
  • 增加中文、英文、韩文、俄文的错误码提示与回归测试。

影响与回滚

  • 扫描件未配置 OCR 不再出现“成功但不可问答”,会明确要求启用 OCR。
  • 对于存在高质量文本层的图片主导 PDF,在未启用 OCR 时优先保留文本;若需恢复旧策略,可通过 parser_engine_overrides.pdf_prefer_text_layer=false 关闭该回退。

@WHUTcjh-2024
WHUTcjh-2024 marked this pull request as ready for review July 29, 2026 10:33
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

[Bug]: pdf被解析为图片,无法识别内容

1 participant