跳转至

PDF特征分析规则

1 基础认知

  • 数据建模,我们需要补充 “文档块之间的关系”

2 建模过程

2.1 理念

“不是让AI直接猜PDF,而是先教AI看PDF的说明书,再按说明书转化。”

你的项目文件夹/
├── 规则文档/
│   ├── pdf特征.md          # 告诉AI怎么看PDF
│   ├── 转化规则.md         # 告诉AI怎么转化
│   └── 质量标准检查清单.md # 告诉AI怎么检查
├── 输入PDF/
└── 输出Markdown/

2.2 第一步,给PDF拍X光片(结构分析)

  • 文档骨架(结构层):文档标题、一级标题、复杂表格、注释段落、简单表格 、编号列表项、强调文本
  • 表格特殊分析
  • 格式特征记录:字体加粗、下划线波浪线、方括号[ ]、星号*、斜杠/、数学公式
# PDF特征分析规则

## 1. 识别保险条款的“骨架”
- 看到“第X条”开头 → 标记为“条款章节标题”
- 看到“第X款”或“(一)” → 标记为“子条款”
- 看到方括号【】或[ ] → 可能是“定义项”

## 2. 识别特殊格式的含义
- 字体加粗 → 重要条款(免责、责任、金额)
- 下划线波浪线 → 利益条款(核心保障内容)
- 星号* → 标准定义(如28种重大疾病)
- 方括号[ ] → 特定术语(如[恶性肿瘤——重度])

## 3. 识别表格类型
- 有合并单元格的表格 → “复杂表格”(保险合同常见)
- 行数<5的简单表格 → “简易表格”
- 跨页表格 → “分页表格”(需要特殊处理)

2.3 第二步,转化规则卡片(针对保险条款的特别设计)

卡片1:标题分级规则 如果:字体大小最大,居中,第1页第1行 那么:用# 文档标题,如# 中国人寿(2025)医疗保险1号

卡片2:条款章节标题 如果:字体加粗,数字编号+文字,如"第一条 保险合同构成" 那么:用## 第一条 保险合同构成

卡片3:表格转化规则(针对保险条款表) 如果:表格有合并单元格(rowspan/colspan) 那么: 先用HTML表格标记结构 在表前用注释说明表格结构复杂度

卡片4:疾病列表规则 如果:有序列表,有数字编号,带星号标注 那么: 保持数字序号 用标注星号部分 示例:1. [恶性肿瘤——重度]——不包括部分早期恶性肿瘤

卡片5:条款引用规则 如果:文本中有"第四条"、"第十条"等条款引用 那么:用[第四条]标记,如您有按约定退保的权利 [第十条]

卡片6:免责条款强调 如果:加粗文本,且包含"免除"、"不承担"等关键词 那么:用加粗,并在前面加>引用格式 示例: 本合同中有一些免除或者减轻本公司责任的内容

# 转化规则

## 1. 标题转化规则
- 如果:是文档主标题(第1页最大字体)
- 那么:用 `# 标题`
- 如果:是“第X条”格式
- 那么:用 `## 第一条 标题`

## 2. 表格转化规则
- 如果:表格有合并单元格
- 那么:先用HTML表格保留结构,再在注释中说明
- 示例:

2.4 第三步,质量标准检查清单

完整性检查 - 所有条款编号是否保留? (1-12条) - 120种疾病是否完整列出? - 表格数据是否无遗漏? - 免责条款是否突出显示?

格式正确性检查 - 标题层级:文档标题#,条款标题##,小标题### - 表格:复杂表格用HTML,简单表格用Markdown - 列表:有序列表用1.2.3.,无序用- - 引用:条款引用用[第X条]

可读性检查 - 转化后还能看出是保险条款吗? - 重要条款(免责、理赔)是否容易找到? - 疾病列表是否清晰可查? - 表格数据是否对齐美观?

# 质量检查清单

## 必须通过的检查(否则重做)

### 1. 完整性检查
- [ ] 所有条款编号都在吗?(检查1-12条)
- [ ] 表格数据有丢失吗?(对比原PDF)
- [ ] 疾病列表完整吗?(检查120种)

### 2. 格式正确性检查
- [ ] 标题层级正确吗?(# ## ###)
- [ ] 加粗格式保留了吗?
- [ ] 表格对齐了吗?

### 3. 可读性检查
- [ ] 转化后还能看出是保险条款吗?
- [ ] 重要条款容易找到吗?
- [ ] 疾病定义清晰吗?

2.5 第四步,给AI的任务

【任务】将PDF保险条款转为高质量的Markdown

【输入】一个PDF文件(保险条款)

【操作流程】
1. 先阅读《pdf特征.md》,分析PDF的结构特征
2. 按照《转化规则.md》中的规则,一步步转化
3. 完成后用《质量标准检查清单.md》检查自己成果
4. 如果不达标,回到第2步修改

【特别注意】
1. 保留所有条款编号(第X条)
2. 复杂表格用HTML+注释
3. 重要条款必须突出显示
4. 疾病列表要完整准确

2.6 第五步,经验教训库.md

把发现的问题补充到规则文档中

# 经验教训库

## 成功案例
- 【案例1】某PDF的表格处理成功
  - 做法:先用HTML转结构,再简化为Markdown
  - 结果:保留了所有合并单元格信息

## 失败教训
- 【教训1】某PDF转化后丢失了条款编号
  - 原因:AI把“第一条”误判为普通文本
  - 改进:现在看到“第X条”就自动加粗并设为二级标题

3 阿里云数据建模

Open: 微信图片_20260206162458_20_166.jpg _resources/images/6324daa9a662b47979d9178509f3f142_MD5.jpg

Open: 微信图片_20260206162459_21_166.jpg _resources/images/906987632014a46695bf37f9f2079567_MD5.jpg

Open: 微信图片_20260206162500_22_166.jpg _resources/images/19492d4cc74ca3b2f5da03addae702e7_MD5.jpg

Open: 微信图片_20260206162501_23_166.jpg _resources/images/4c2d2d94b78e47d013f132785fabcd74_MD5.jpg

Open: 微信图片_20260206162503_24_166.jpg _resources/images/ece4b7518874abdf47968f46867d52e4_MD5.jpg

Open: 微信图片_20260206162504_25_166.jpg _resources/images/84c07913166911ba83623bd394161c9e_MD5.jpg

Open: 微信图片_20260206162505_26_166.jpg _resources/images/cf679d44303cc40ceab0423081839e8a_MD5.jpg

Open: 微信图片_20260206162506_27_166.jpg _resources/images/1ddadca96c00a562655ec605bb37182e_MD5.jpg - 实例化:对实例进行建模,通过 EntiySet建立实体集,进行实体建模,将系统组件抽象为 EntitySet。一个EntitySet 对应多个 Entity - 抽象化:对实体&实体集进行关联,通过 Link 连接不同的数据集,比如父子关系、依赖关系、数据流转。 - 网络化:通过“图查询”,比如通过 EntiyStore 进行图查询。提供从易到难、层层递进的三种图查询能力。 - 最终实现:让智能体自主发现、定位故障,并回复生产成为可能。

Open: 微信图片_20260206162508_28_166.jpg _resources/images/f0d4dc2d1b1d4695e161135b60589282_MD5.jpg

4 我的数据建模历程

## 角色
作为一名数据采集与建模专家

## 目标
我想搭建一套基于 LLM 的 pdf 转化为 markdown 的数据建模和存储的任务。

## 任务分解
1. Agent治理体系的数据建模和采集的框架结构。比如涉及“模型推理”、“哦你根据调用”、“上下文检索”、“状态更新”、“可观测性”、“度量框架”、“自动化评估”、“数据采集”等模块。其中你选择必备的模块,符合 MVP原则和奥卡姆剃刀原则。
2. 如何进行针对我任务特点的数据建模。如何统一表示,标准化的数据建模方式?
3. 我了解到一套流程:
- 实例化:对实例进行建模,通过 EntiySet建立实体集,进行实体建模,将系统组件抽象为 EntitySet。一个EntitySet 对应多个 Entity
- 抽象化:对实体&实体集进行关联,通过 Link 连接不同的数据集,比如父子关系、依赖关系、数据流转。
- 网络化:通过“图查询”,比如通过 EntiyStore 进行图查询。提供从易到难、层层递进的三种图查询能力。
- 最终实现:让智能体自主发现、定位故障,并回复生产成为可能。

## 输出
1. 数据建模如何操作的教程;
2. MVP 版本数据模型;
3. 整体系统搭建流程;