PDF特征分析规则
1 基础认知
- 数据建模,我们需要补充 “文档块之间的关系”
2 建模过程
2.1 理念
“不是让AI直接猜PDF,而是先教AI看PDF的说明书,再按说明书转化。”
你的项目文件夹/
├── 规则文档/
│ ├── pdf特征.md # 告诉AI怎么看PDF
│ ├── 转化规则.md # 告诉AI怎么转化
│ └── 质量标准检查清单.md # 告诉AI怎么检查
├── 输入PDF/
└── 输出Markdown/
2.2 第一步,给PDF拍X光片(结构分析)
- 文档骨架(结构层):文档标题、一级标题、复杂表格、注释段落、简单表格 、编号列表项、强调文本
- 表格特殊分析
- 格式特征记录:字体加粗、下划线波浪线、方括号[ ]、星号*、斜杠/、数学公式
# PDF特征分析规则
## 1. 识别保险条款的“骨架”
- 看到“第X条”开头 → 标记为“条款章节标题”
- 看到“第X款”或“(一)” → 标记为“子条款”
- 看到方括号【】或[ ] → 可能是“定义项”
## 2. 识别特殊格式的含义
- 字体加粗 → 重要条款(免责、责任、金额)
- 下划线波浪线 → 利益条款(核心保障内容)
- 星号* → 标准定义(如28种重大疾病)
- 方括号[ ] → 特定术语(如[恶性肿瘤——重度])
## 3. 识别表格类型
- 有合并单元格的表格 → “复杂表格”(保险合同常见)
- 行数<5的简单表格 → “简易表格”
- 跨页表格 → “分页表格”(需要特殊处理)
2.3 第二步,转化规则卡片(针对保险条款的特别设计)
卡片1:标题分级规则 如果:字体大小最大,居中,第1页第1行 那么:用# 文档标题,如# 中国人寿(2025)医疗保险1号
卡片2:条款章节标题 如果:字体加粗,数字编号+文字,如"第一条 保险合同构成" 那么:用## 第一条 保险合同构成
卡片3:表格转化规则(针对保险条款表) 如果:表格有合并单元格(rowspan/colspan) 那么: 先用HTML表格标记结构 在表前用注释说明表格结构复杂度
卡片4:疾病列表规则 如果:有序列表,有数字编号,带星号标注 那么: 保持数字序号 用标注星号部分 示例:1. [恶性肿瘤——重度]——不包括部分早期恶性肿瘤
卡片5:条款引用规则 如果:文本中有"第四条"、"第十条"等条款引用 那么:用[第四条]标记,如您有按约定退保的权利 [第十条]
卡片6:免责条款强调 如果:加粗文本,且包含"免除"、"不承担"等关键词 那么:用加粗,并在前面加>引用格式 示例: 本合同中有一些免除或者减轻本公司责任的内容
# 转化规则
## 1. 标题转化规则
- 如果:是文档主标题(第1页最大字体)
- 那么:用 `# 标题`
- 如果:是“第X条”格式
- 那么:用 `## 第一条 标题`
## 2. 表格转化规则
- 如果:表格有合并单元格
- 那么:先用HTML表格保留结构,再在注释中说明
- 示例:
2.4 第三步,质量标准检查清单
完整性检查 - 所有条款编号是否保留? (1-12条) - 120种疾病是否完整列出? - 表格数据是否无遗漏? - 免责条款是否突出显示?
格式正确性检查 - 标题层级:文档标题#,条款标题##,小标题### - 表格:复杂表格用HTML,简单表格用Markdown - 列表:有序列表用1.2.3.,无序用- - 引用:条款引用用[第X条]
可读性检查 - 转化后还能看出是保险条款吗? - 重要条款(免责、理赔)是否容易找到? - 疾病列表是否清晰可查? - 表格数据是否对齐美观?
# 质量检查清单
## 必须通过的检查(否则重做)
### 1. 完整性检查
- [ ] 所有条款编号都在吗?(检查1-12条)
- [ ] 表格数据有丢失吗?(对比原PDF)
- [ ] 疾病列表完整吗?(检查120种)
### 2. 格式正确性检查
- [ ] 标题层级正确吗?(# ## ###)
- [ ] 加粗格式保留了吗?
- [ ] 表格对齐了吗?
### 3. 可读性检查
- [ ] 转化后还能看出是保险条款吗?
- [ ] 重要条款容易找到吗?
- [ ] 疾病定义清晰吗?
2.5 第四步,给AI的任务
【任务】将PDF保险条款转为高质量的Markdown
【输入】一个PDF文件(保险条款)
【操作流程】
1. 先阅读《pdf特征.md》,分析PDF的结构特征
2. 按照《转化规则.md》中的规则,一步步转化
3. 完成后用《质量标准检查清单.md》检查自己成果
4. 如果不达标,回到第2步修改
【特别注意】
1. 保留所有条款编号(第X条)
2. 复杂表格用HTML+注释
3. 重要条款必须突出显示
4. 疾病列表要完整准确
2.6 第五步,经验教训库.md
把发现的问题补充到规则文档中
# 经验教训库
## 成功案例
- 【案例1】某PDF的表格处理成功
- 做法:先用HTML转结构,再简化为Markdown
- 结果:保留了所有合并单元格信息
## 失败教训
- 【教训1】某PDF转化后丢失了条款编号
- 原因:AI把“第一条”误判为普通文本
- 改进:现在看到“第X条”就自动加粗并设为二级标题
3 阿里云数据建模
Open: 微信图片_20260206162458_20_166.jpg
Open: 微信图片_20260206162459_21_166.jpg
Open: 微信图片_20260206162500_22_166.jpg
Open: 微信图片_20260206162501_23_166.jpg
Open: 微信图片_20260206162503_24_166.jpg
Open: 微信图片_20260206162504_25_166.jpg
Open: 微信图片_20260206162505_26_166.jpg
Open: 微信图片_20260206162506_27_166.jpg
- 实例化:对实例进行建模,通过 EntiySet建立实体集,进行实体建模,将系统组件抽象为 EntitySet。一个EntitySet 对应多个 Entity
- 抽象化:对实体&实体集进行关联,通过 Link 连接不同的数据集,比如父子关系、依赖关系、数据流转。
- 网络化:通过“图查询”,比如通过 EntiyStore 进行图查询。提供从易到难、层层递进的三种图查询能力。
- 最终实现:让智能体自主发现、定位故障,并回复生产成为可能。
Open: 微信图片_20260206162508_28_166.jpg
4 我的数据建模历程
## 角色
作为一名数据采集与建模专家
## 目标
我想搭建一套基于 LLM 的 pdf 转化为 markdown 的数据建模和存储的任务。
## 任务分解
1. Agent治理体系的数据建模和采集的框架结构。比如涉及“模型推理”、“哦你根据调用”、“上下文检索”、“状态更新”、“可观测性”、“度量框架”、“自动化评估”、“数据采集”等模块。其中你选择必备的模块,符合 MVP原则和奥卡姆剃刀原则。
2. 如何进行针对我任务特点的数据建模。如何统一表示,标准化的数据建模方式?
3. 我了解到一套流程:
- 实例化:对实例进行建模,通过 EntiySet建立实体集,进行实体建模,将系统组件抽象为 EntitySet。一个EntitySet 对应多个 Entity
- 抽象化:对实体&实体集进行关联,通过 Link 连接不同的数据集,比如父子关系、依赖关系、数据流转。
- 网络化:通过“图查询”,比如通过 EntiyStore 进行图查询。提供从易到难、层层递进的三种图查询能力。
- 最终实现:让智能体自主发现、定位故障,并回复生产成为可能。
## 输出
1. 数据建模如何操作的教程;
2. MVP 版本数据模型;
3. 整体系统搭建流程;