转 Markdown
1 工具
MinerU 特点: 智能布局分析、高精度公式识别(转为 LaTeX)、自动识别阅读顺序。 https://github.com/opendatalab/MinerU
Docling (由 IBM Research 出品) 特点: 速度极快,依赖更少,能够深刻理解文档结构,并支持直接导出为各种 AI 框架所需的格式。 https://github.com/docling-project/docling
Marker 特点: 针对书籍和论文进行了优化,能够移除 PDF 的页眉页脚,并将复杂的公式和表格转换为清晰的 Markdown/LaTeX。 https://github.com/VikParuchuri/marker
MarkItDown (由 Microsoft 出品) 特点: 除了 PDF,它还能处理 Word、Excel、PPT。它更像是一个“全能型”的预处理插件。 https://github.com/microsoft/markitdown
2 转化特点
- 删除页眉、页脚、脚注、页码等元素,确保语义连贯
- 输出符合人类阅读顺序的文本,适用于单栏、多栏及复杂排版
- 保留原文档的结构,包括标题、段落、列表等
- 提取图像、图片描述、表格、表格标题及脚注
- 自动识别并转换文档中的公式为LaTeX格式
- 自动识别并转换文档中的表格为HTML格式
- 自动检测扫描版PDF和乱码PDF,并启用OCR功能
3 功能架构
布局分析 (Layout Analysis) - Layout Detection 部分,学习它是如何划分 Header (页眉)、Footer (页脚)、Text (正文)、Table (表格) 和 Itemize (列表项) 的。
三层 - 分类 (Classification): 识别 PDF 是“原生文本版”还是“扫描图片版”。对于保险条款,如果是扫描件,LLM Vision 更有优势;如果是原生版,结合 OCR 会更准。 - 解析 (Parsing): 这是你最需要看的地方。它包含布局检测(Layout Detection)、表格识别(Table Recognition)和公式识别。 - 重排 (Reconstruction): 将识别出的零散内容按人类阅读顺序(Reading Order)重新排列成 Markdown。
Hybrid (混合) 流程
- PDF 预处理:利用 PyMuPDF 将 PDF 转为高分辨率图片。
- 区域检测 (借鉴点):模仿 MinerU,先识别出哪里是文字,哪里是表格。
- Vision Prompting:对于检测出的复杂表格和带有复杂层级的条款,调用 LLM Vision 模型(如 GPT-4o 或 Claude 3.5 Sonnet)进行“局部精准翻译”。
- Markdown 合并:将 LLM 生成的片段按照 MinerU 的“重排逻辑”拼回完整的 Markdown。
流程2 第一步:预处理与分类 (Pre-processing & Classification) 系统首先对 PDF 进行“体检”:
- 格式判断:区分是文本型 PDF(可以直接提取文字坐标)还是扫描件/图片型 PDF(必须全程依赖 OCR)。
- 图像标准化:将 PDF 页面渲染为高分辨率图片(通常为 200-300 DPI),供后续的视觉模型识别。
第二步:布局分析 (Layout Analysis) —— 核心环节 这是 MinerU 区别于普通工具的关键。它调用视觉模型(如 LayoutLMv3 或 YOLO 系列)对页面进行区域划分:
- 区域标记:识别并框选出
Text(正文)、Title(标题)、Figure(图片)、Table(表格)和Formula(公式)。 - 保险条款应用点:在这一步,保险合同中的“加粗提示框”或“盖章区域”会被识别为独立的区块,避免文字混在一起。
第三步:内容提取 (Content Extraction) —— 分而治之 根据第二步划分的“框”,进入不同的处理分支:
- 文字提取:利用 OCR(如 PaddleOCR)或 PDF 内置文本流提取文字,并保留加粗、斜体等样式信息。
- 表格解析 (Table Recognition):这是 MinerU 的强项。它使用专门的表格结构识别模型(如
StructEqTable)将像素级的表格转回 HTML 或 Markdown 格式。 - 公式识别 (Formula Recognition):使用
MFD(数学公式检测) 和MFR(数学公式识别) 模型,将复杂的数学表达式转化为 LaTeX 代码。
第四步:逻辑重排 (Reading Order Rescoring) PDF 原始数据通常是乱序的(例如先排左栏再排右栏)。
- 坐标排序:根据块的物理位置(Top, Left, Width, Height)计算逻辑顺序。
- 层级恢复:根据字体大小和位置,判断谁是“第一章”,谁是“1.1 条款”。
第五步:Markdown 合成 (Markdown Reconstruction)
最后,将所有处理好的片段按照第四步确定的顺序,“缝合”成一个完整的 .md 文件。
表格
请将此保险费率表转化为标准的 Markdown 表格,确保行列对应准确