Parse Review Workbench 是一个本地文档复核工具,用于对比“源文档”和“解析后的 Markdown”。
它只负责复核,不包含 PDF/DOCX 解析、OCR、LLM 或批处理流水线。
- 左侧预览源 PDF / Office 文档
- 右侧编辑或预览解析后的 Markdown
- 支持目录跳转
- 支持 QA 风险提示跳转
- 支持人工标注解析问题
- 标注结果保存为
jsonl和md - 支持源文档目录和解析结果目录分开选择
- 支持严格同名匹配和前缀匹配
启动后在页面顶部选择两个目录:
- 源文档目录:存放 PDF / DOCX / DOC / PPTX / XLSX 等源文件
- 解析结果目录:存放解析后的 Markdown
工具会递归扫描两个目录,然后按文件名进行关联。
源文档 stem 必须等于 Markdown stem。
source/ABC.pdf
parsed/ABC.md
可以关联。
source/ABC.pdf
parsed/ABC_agentic.md
不会关联。
允许 Markdown 文件名以源文档名作为前缀。
source/ABC.pdf
parsed/ABC.md
parsed/ABC_agentic.md
parsed/ABC_review.md
如果一个源文档匹配到多个 Markdown,工具会计入冲突,不会自动选择其中一个,避免误配。
最小可用结构:
parsed/
ABC.md
推荐结构:
parsed/
ABC.md
ABC_parse_report.json
ABC_assets/
如果存在 *_parse_report.json,工具会读取 QA、页数、图片、风险提示等信息。
如果没有解析报告,工具仍然可以打开源文档和 Markdown,并基于 Markdown 做基础统计。
python -m venv .venv
.\.venv\Scripts\Activate.ps1
pip install -r requirements.txtpython launcher.py打开:
http://127.0.0.1:8765/
进入页面后选择:
- 源文档目录
- 解析结果目录
- 匹配方式
然后点击“扫描”。
python launcher.py `
--workspace "D:\example_workspace" `
--source-dir "D:\example_workspace\source" `
--parsed-outputs "D:\example_workspace\parsed" `
--match-mode prefix.\start_review_site.ps1 `
-Workspace "D:\example_workspace" `
-SourceDir "D:\example_workspace\source" `
-ParsedOutputs "D:\example_workspace\parsed" `
-MatchMode prefix也可以双击:
start_review_site.bat
.\build_exe.ps1输出:
dist\ParseReviewWorkbench.exe
运行 EXE 时可以用环境变量指定默认目录:
$env:PARSE_REVIEW_WORKSPACE="D:\example_workspace"
$env:PARSE_REVIEW_SOURCE_DIR="D:\example_workspace\source"
$env:PARSE_REVIEW_OUTPUTS="D:\example_workspace\parsed"
$env:PARSE_REVIEW_MATCH_MODE="prefix"
.\dist\ParseReviewWorkbench.exe| 变量 | 说明 | 默认值 |
|---|---|---|
PARSE_REVIEW_WORKSPACE |
工作区根目录 | 当前目录 |
PARSE_REVIEW_SOURCE_DIR |
默认源文档目录 | <workspace> |
PARSE_REVIEW_OUTPUTS |
默认解析结果目录 | <workspace>/parsed_outputs |
PARSE_REVIEW_MATCH_MODE |
匹配模式:strict / prefix |
strict |
PARSE_REVIEW_HOST |
服务地址 | 127.0.0.1 |
PARSE_REVIEW_PORT |
服务端口 | 8765 |
工具优先读取 PDF 自带目录。
如果 PDF 没有目录,会尝试从 Markdown 标题或目录文本中推断。
点击目录后会:
- 跳到左侧 PDF 对应页
- 跳到右侧 Markdown 对应位置
- 自动收起目录面板
右侧 QA 面板会展示解析报告中的风险,例如:
- 缺图
- 低置信页面
- OCR 参与页面
- 修订痕迹处理异常
点击风险项会同步跳转到 PDF 页和 Markdown 位置。
当发现解析结果有问题时,可以在右侧“解析问题标注”面板保存标注。
标注会写入当前解析结果目录:
review_annotations.jsonl
review_annotations.md
标签包括:
- 漏文本
- 表格错误
- 顺序错乱
- 乱码
- 图片缺失
- OCR 错误
- 页眉页脚干扰
- 修订痕迹错误
- 其他
jsonl 供程序或 AI 分析,md 供人工查看。
浏览器不能直接内嵌 DOCX。
工具会尝试调用 LibreOffice 将 DOCX 转换成 PDF 后预览。
如果本机没有 LibreOffice,DOCX 会提供下载入口,但无法内嵌预览。
