跳转至

转 Markdown

1 工具

MinerU 特点: 智能布局分析、高精度公式识别(转为 LaTeX)、自动识别阅读顺序。 https://github.com/opendatalab/MinerU

Docling (由 IBM Research 出品) 特点: 速度极快,依赖更少,能够深刻理解文档结构,并支持直接导出为各种 AI 框架所需的格式。 https://github.com/docling-project/docling

Marker 特点: 针对书籍和论文进行了优化,能够移除 PDF 的页眉页脚,并将复杂的公式和表格转换为清晰的 Markdown/LaTeX。 https://github.com/VikParuchuri/marker

MarkItDown (由 Microsoft 出品) 特点: 除了 PDF,它还能处理 Word、Excel、PPT。它更像是一个“全能型”的预处理插件。 https://github.com/microsoft/markitdown

2 转化特点

  • 删除页眉、页脚、脚注、页码等元素,确保语义连贯
  • 输出符合人类阅读顺序的文本,适用于单栏、多栏及复杂排版
  • 保留原文档的结构,包括标题、段落、列表等
  • 提取图像、图片描述、表格、表格标题及脚注
  • 自动识别并转换文档中的公式为LaTeX格式
  • 自动识别并转换文档中的表格为HTML格式
  • 自动检测扫描版PDF和乱码PDF,并启用OCR功能

3 功能架构

布局分析 (Layout Analysis) - Layout Detection 部分,学习它是如何划分 Header (页眉)、Footer (页脚)、Text (正文)、Table (表格) 和 Itemize (列表项) 的。

三层 - 分类 (Classification): 识别 PDF 是“原生文本版”还是“扫描图片版”。对于保险条款,如果是扫描件,LLM Vision 更有优势;如果是原生版,结合 OCR 会更准。 - 解析 (Parsing): 这是你最需要看的地方。它包含布局检测(Layout Detection)、表格识别(Table Recognition)和公式识别。 - 重排 (Reconstruction): 将识别出的零散内容按人类阅读顺序(Reading Order)重新排列成 Markdown。

Hybrid (混合) 流程 - PDF 预处理:利用 PyMuPDF 将 PDF 转为高分辨率图片。 - 区域检测 (借鉴点):模仿 MinerU,先识别出哪里是文字,哪里是表格。 - Vision Prompting:对于检测出的复杂表格和带有复杂层级的条款,调用 LLM Vision 模型(如 GPT-4o 或 Claude 3.5 Sonnet)进行“局部精准翻译”。 - Markdown 合并:将 LLM 生成的片段按照 MinerU 的“重排逻辑”拼回完整的 Markdown。

流程2 第一步:预处理与分类 (Pre-processing & Classification) 系统首先对 PDF 进行“体检”:

  • 格式判断:区分是文本型 PDF(可以直接提取文字坐标)还是扫描件/图片型 PDF(必须全程依赖 OCR)。
  • 图像标准化:将 PDF 页面渲染为高分辨率图片(通常为 200-300 DPI),供后续的视觉模型识别。

第二步:布局分析 (Layout Analysis) —— 核心环节 这是 MinerU 区别于普通工具的关键。它调用视觉模型(如 LayoutLMv3 或 YOLO 系列)对页面进行区域划分:

  • 区域标记:识别并框选出 Text(正文)、Title(标题)、Figure(图片)、Table(表格)和 Formula(公式)。
  • 保险条款应用点:在这一步,保险合同中的“加粗提示框”或“盖章区域”会被识别为独立的区块,避免文字混在一起。

第三步:内容提取 (Content Extraction) —— 分而治之 根据第二步划分的“框”,进入不同的处理分支:

  • 文字提取:利用 OCR(如 PaddleOCR)或 PDF 内置文本流提取文字,并保留加粗、斜体等样式信息。
  • 表格解析 (Table Recognition):这是 MinerU 的强项。它使用专门的表格结构识别模型(如 StructEqTable)将像素级的表格转回 HTML 或 Markdown 格式。
  • 公式识别 (Formula Recognition):使用 MFD (数学公式检测) 和 MFR (数学公式识别) 模型,将复杂的数学表达式转化为 LaTeX 代码。

第四步:逻辑重排 (Reading Order Rescoring) PDF 原始数据通常是乱序的(例如先排左栏再排右栏)。

  • 坐标排序:根据块的物理位置(Top, Left, Width, Height)计算逻辑顺序。
  • 层级恢复:根据字体大小和位置,判断谁是“第一章”,谁是“1.1 条款”。

第五步:Markdown 合成 (Markdown Reconstruction) 最后,将所有处理好的片段按照第四步确定的顺序,“缝合”成一个完整的 .md 文件。


表格

请将此保险费率表转化为标准的 Markdown 表格,确保行列对应准确