条款PDF-数据建模
1 文档整体结构
- 阅读指引
- 条款目录
- 投保规则与适用人群
- 核心利益条款
- 保险责任明细
- 除外责任条款
- 重大疾病 / 特定责任列表(若有)
- 责任定义与释义附录
- 保险期间与缴费规则
- 保费、保额与现金价值
- 理赔与保全服务条款
- 健康告知与核保规则
- 特别约定与附加条款
- 增值服务与健康管理条款
- 附表与附件
- 政策与合规依据
2 模块特征
2.1 阅读指引
**识别规则
- 位置特征: 优先出现在条款文档首页 / 前 3 页,或 “条款目录” 上方 / 下方,常标注 “阅读提示 / 重要提示 / 阅读指引” 等标题;
- 格式特征: 多为加粗框选 / 单独色块 / 大号字体提示,部分 PDF 以 “【重要提示】”“■ 温馨提示” 为前缀;
- 内容特征: 包含 “重点关注 / 请注意 / 免责 / 风险 / 务必阅读” 等关键词,无具体条款规则(仅指引性内容);
**提取规则
- 以正文层级展示: 除“条款目录”外,大部分内容以正文和列表模式提取。
- 目录剥离: “条款目录”有时放在“阅读指引”中,需要把“条款目录”单独抽离出来,形成一个与“阅读指引”同等标题级别的模块。
2.2 条款目录
2.2.1 识别规则
- 位置特征:
- 固定出现于“阅读指引”后、条款正文前;
- 双栏排版时,多分布在同一页的左/右栏,上下行对应同一层级;
- 部分PDF会标注“目录/条款目录/章节索引”等标题
- 格式特征:
- 字号:小于章标题(L1)、大于正文,为条款内第四大字号(主标题>章标题>条标题>目录>正文);
- 样式:无加粗(少数核心目录项加粗);
- 排版:双栏时左右栏独立编号,但层级一致(如左栏L1、右栏也为L1),如果是3栏或者以上,逻辑同理。
- 内容特征:
- 仅含“编号+标题”,无详细规则描述;
- 标题与16个核心模块强关联(如“保险责任”“责任免除”);
- 编号格式严格匹配数字/中文章节模式的层级规则
- 排除规则:
- 阅读指引的提示文本、附表/附录的子目录、释义术语目录需排除;
- 装饰性符号(■、●、★)、宣传类文字(如“贴心保障”)不属于目录内容;
- 页码标注行(如“第3页”)需排除
2.2.2 提取规则
- 多栏处理:
- 双栏/多栏目录按“从上到下、从左到右”顺序合并为单序列表;
- 合并后保留原层级,补充“排版特征备注”(如“双栏排版-左栏”);
- 跨栏的同一层级目录,按阅读顺序拼接
- 层级校准:
- 对照数字/中文章节模式的层级规则(3.2/3.3),校准目录的“层级标识”;
- 若目录层级缺失(如仅显示L1、L3,无L2),标注“层级缺失”并人工复核
- 父级绑定:
- 每个子级目录必须绑定唯一父级ID(如数字模式L2的“1.1 保险金额”父级为L1的“1 我们保什么”);
- 根目录(L1)父级ID填“无”
- 标题标准化:
- 删除目录中的装饰性符号(■、●、【】)、宣传语(如“性价比高”);
- 删除标题后多余标点(句号、感叹号),保留核心名称;
- 合并PDF自动换行的标题(如“1.3 保险
责任”合并为“1.3 保险责任”) - 页码精准化:
- 提取PDF页码(优先),无页码则标注“无”;
- 可选提取文本坐标(X,Y),提升LLM定位精度;
- 跨页目录标注“起始页码-结束页码”(如页码3-4)
- 去冗余:
- 删除重复目录项(如同一标题出现2次);
2.2.3 格式规范优化(适配Markdown+LLM解析)
核心要求:放弃表格展示,采用Markdown嵌套列表呈现目录树,适配双章节模式,统一格式规范
2.2.3.1 基础格式规范
| 规范项 | 具体要求 |
|---|---|
| 层级表达 | 用Markdown嵌套列表实现目录树层级,无额外字符缩进(依赖列表自身缩进);L1级用无序列表-,子级逐级嵌套 |
| 编号规范 | 严格遵循数字/中文章节模式的编号规则(如数字模式L1为“1 标题”,中文模式L1为“第一条 标题”) |
| 附加信息标注 | ① 页码标注:目录标题后加【页码X】;② 关键词标注:标题后加(关键词:XXX);③ 层级标注:标题前加[Lx] |
| 多栏转换规范 | 双栏目录合并后,在目录树顶部标注“【原多栏排版,已合并】”,保留“排版特征备注” |
2.2.3.2 分模式目录树示例
(1)数字模式目录树(适配L1-L5层级)
条款目录(数字模式)【原双栏排版,已合并】
- [L1] 1 我们保什么、保多久【页码2】(关键词:保障范围,保险期间)
- [L2] 1.1 保险金额【页码2】(关键词:保险金额,保额)
- [L3] (一)被保险人为一人【页码2】(关键词:被保险人,一人)
- [L4] 1. 被保险人18周岁前身故【页码3】(关键词:身故,18周岁)
- [L5] (1) 所交保费×160%【页码3】(关键词:保费,比例)
- [L4] 2. 18周岁后交费期未届满身故【页码3】(关键词:身故,交费期)
- [L2] 1.3 保险责任【页码4】(关键词:保险责任,赔付)
- [L1] 2 我们不保什么【页码5】(关键词:责任免除,免责)
- [L2] 2.1 责任免除【页码5】(关键词:免责,拒赔)
(2)中文模式目录树(适配L1-L4层级)
条款目录(中文模式)
- [L1] 第一条 保险合同构成【页码2】(关键词:合同构成,条款)
- [L1] 第四条 保险责任【页码4】(关键词:保险责任,赔付)
- [L2] 一、一般医疗费用保险金【页码4】(关键词:医疗险,一般医疗)
- [L3] (一)住院医疗费用保险金【页码4】(关键词:住院医疗,赔付)
- [L4] 1. 二级以上公立医院住院【页码5】(关键词:公立医院,住院)
- [L4] 2. 免赔额10000元【页码5】(关键词:免赔额,金额)
- [L2] 二、重大疾病医疗费用保险金【页码6】(关键词:重疾医疗,赔付)
- [L1] 第五条 责任免除【页码7】(关键词:免责,拒赔)
2.2.4 LLM适配增强(核心价值)
针对LLM的“层级推理、语义检索、精准定位、模块关联”能力,新增4个适配设计:
2.2.4.1 目录树结构化数据输出(JSON格式)
便于LLM解析目录的父子关联、层级、模块映射,示例:
{
"目录唯一ID": "C-L1-04",
"章节模式": "中文模式",
"层级标识": "L1",
"目录标题": "第四条 保险责任",
"父级目录ID": "无",
"对应核心模块": "核心利益条款",
"页码定位": "页码4(150,300)",
"检索关键词": "保险责任,赔付条件,重大疾病",
"排版特征备注": "无",
"子级目录": [
{
"目录唯一ID": "C-L2-01",
"层级标识": "L2",
"目录标题": "一、一般医疗费用保险金",
"父级目录ID": "C-L1-04",
"页码定位": "页码4(155,320)"
}
]
}
2.2.4.2 语义检索增强
- 基于“检索关键词”字段,构建目录的向量检索库,LLM输入问题(如“重疾医疗赔付的目录在哪”)时,可快速匹配“第四条 保险责任→二、重大疾病医疗费用保险金”;
- 关键词与2.8(责任定义与释义附录)的术语库关联(如“免赔额”关联术语ID:T-025),提升术语层面的检索精准度。
2.2.4.3 层级推理适配
- 为每个目录项标注“层级路径”(如C-L2-01的路径:C-L1-04 → C-L2-01),便于LLM推理“某目录属于哪个大模块”;
- 新增“层级映射规则”(数字模式L1=中文模式L1,数字模式L2=中文模式L2),便于LLM跨模式解析目录。
2.2.4.4 定位适配
- 页码+坐标的精准定位,支撑LLM从PDF中直接定位目录对应的文本区域;
- 目录与条款正文的“章节编号映射”(如目录的“1.3 保险责任”对应正文的“### 1.3 保险责任”),便于LLM从目录跳转至正文。
2.2.5 实操优化对比
| 优化前(双栏混乱/层级缺失) | 优化后(结构化目录树) |
|---|---|
| 【双栏目录】 左栏: 1 我们保什么 1.1 保险金额 右栏: 2 我们不保什么 2.1 责任免除 |
### 条款目录(数字模式)【原双栏排版,已合并】 - [L1] 1 我们保什么【页码2】(关键词:保障范围) - [L2] 1.1 保险金额【页码2】(关键词:保额) - [L1] 2 我们不保什么【页码5】(关键词:免责) - [L2] 2.1 责任免除【页码5】(关键词:拒赔) |
| 第一条 保险合同构成 一、一般医疗费用保险金 (一)住院医疗费用保险金 |
### 条款目录(中文模式) - [L1] 第一条 保险合同构成【页码2】(关键词:合同构成) - [L1] 第四条 保险责任【页码4】(关键词:保险责任) - [L2] 一、一般医疗费用保险金【页码4】(关键词:一般医疗) - [L3] (一)住院医疗费用保险金【页码4】(关键词:住院医疗) |
2.3 投保规则与适用人群
提取核心特征: 投保年龄(上下限)、职业类别限制、被保险人 / 投保人关系要求、投保份数限制、地域 / 身份适用条件; 建模适配要求: markdown 文字加粗处理。
2.4 核心利益条款
提取核心特征: 保障类型(重疾 / 医疗 / 寿险 / 年金等)、利益给付条件、给付金额 / 比例、给付触发节点; 建模适配要求: markdown 文字加粗处理。
2.5 保险责任明细
提取核心特征: 责任编号、责任名称、保障范围、赔付条件、赔付比例 / 限额、责任生效时间; 建模适配要求: markdown 文字加粗处理。
2.6 除外责任条款
提取核心特征: 除外原因分类(疾病 / 行为 / 财产等)、具体除外情形、例外豁免条件、责任排除范围; 建模适配要求: markdown 文字加粗处理。
2.7 重大疾病 / 特定责任列表
提取核心特征: 疾病 / 责任编号、名称、确诊 / 赔付标准、分组规则、赔付次数限制; 建模适配要求: markdown 文字加粗处理。
2.8 责任定义与释义附录
提取核心特征: 术语名称、官方定义、行业释义、条款内特殊界定、计量单位; 建模适配要求: 以正文列表方式展示。
2.9 保险期间与缴费规则
提取核心特征: 保障期间(趸交 / 期交 / 终身等)、缴费期间、宽限期、复效条件、保障起始 / 终止时间; 建模适配要求: markdown 文字加粗处理。
2.10 保费、保额与现金价值
提取核心特征: 保费计算基数、费率表关联、保额调整规则、现金价值计算方式、退保 / 减保影响; 建模适配要求: markdown 文字加粗处理。
2.11 理赔与保全服务条款
提取核心特征: 理赔流程、所需材料清单、理赔时效、保全类型(退保 / 减保 / 变更等)、服务办理渠道; 建模适配要求: 无。
2.12 健康告知与核保规则
提取核心特征: 告知事项分类(疾病 / 既往史 / 生活习惯等)、告知方式、核保结论类型(标准 / 加费 / 拒保等)、核保时效; 建模适配要求: 无。
2.13 特别约定与附加条款
提取核心特征: 约定编号、约定内容、生效条件、与主条款的优先级、附加条款关联关系; 建模适配要求: 无。
2.14 增值服务与健康管理条款
提取核心特征: 服务类型(就医绿通 / 体检 / 慢病管理等)、服务适用条件、服务有效期、服务提供商; 建模适配要求: 无。
2.15 附表与附件
提取核心特征: 附表编号、附表名称、数据类型(费率表 / 疾病表 / 赔付表等)、数据更新规则; 建模适配要求: 无。
2.16 政策与合规依据
提取核心特征: 依据文件名称、文件编号、合规条款内容、适用监管要求; 建模适配要求: 无。
3 格式与排版特征
3.1 标题
- 识别规则: 一般在页面头部,该页面可能在文档第一页头部,或者在“阅读指引”、“附录”之后的页面。
- 格式特征: 常见是分两行,大号字体,或者加粗,文档居中位置,第一行是公司名称,第二行是产品的条款名称。
- 特定词汇:
公司、条款 - 处理方式: 把两行内容合并为 1 行,并以空格隔开,全文档只能出现一个标题,就是
# 标题的级别只有一个。 - 示例:
# 中国人寿保险股份有限公司 国寿爱意康悦医疗保险(尊享版)利益条款
3.2 章节模式 1 : 数字模式
3.2.1 总览
| 层级 | 术语 | Markdown 建议 | 核心特征 | 示例 |
|---|---|---|---|---|
| L1 | 章 | ## |
纯阿拉伯数字编号(1、2、3……)+ 保险核心板块标题,为条款一级大板块,无上级归属 | 1 我们保什么、保多久;2 我们不保什么 |
| L2 | 条 | ### |
章下的小数点层级编号(1.1、1.2、1.3……)+ 具体责任 / 规则标题,为章的细分模块 | 1.1 保险金额;1.3 保险责任 |
| L3 | 款 (主) | #### |
主流情况:条款结构的第三级标题。 | 1.3 保险责任下的。 1.3.1 被保险人为一人;1.3.2 被保险人为两人 |
| L3 | 款 (次) | #### |
特殊情况:当“条”下的内容直接以“(一)”开头时,可将其视为一种简化的“款”,多见于责任清单的直接罗列。 | 1.3 保险责任下的(一)被保险人为一人;(二)被保险人为两人 |
| L4 | 项 | 有序列表1. |
款下的纯阿拉伯数字编号 1、2、3……,为款的具体执行规则 / 赔付条件,是可落地的细分项 | 1.3 (一) 下的 1 被保险人 18 周岁前身故;2 18 周岁后交费期未届满身故 |
| L5 | 目 | 有序列表(1) |
项下的英文小括号编号 (1)、(2)……,为项的数值 / 标准 / 范围界定,是条款的最小执行单元 | 1.3 (一) 3 下的 (1) 所交保费 × 比例;(2) 当年度保额;(3) 现金价值 |
3.2.2 章
- 识别规则:
- 为保险条款的一级大板块,仅出现在条款核心内容区,阅读指引/附录后为主要分布区域;
- 编号为纯阿拉伯数字+中文顿号/空隔(无小数点),后接板块标题,无上级编号归属;
- 同一份条款中章的编号为连续阿拉伯数字,无重复、无跳号;
- 内容为保险业务核心板块,无细碎规则,仅做功能分类。
- 格式特征:
- 字号: 大于正文、条/款/项/目,为条款内第二大字号(仅低于文档主标题);
- 样式: 加粗(必选),部分PDF会做字符放大/描边处理;
- 对齐: 左对齐(保险条款通用),无居中/右对齐;
- 间距: 章与章之间有1-2行空行,章与下属条之间无空行或仅1行半角空行;
- 符号替代: 部分PDF会用圆圈阿拉伯数字(➊、➋、➌)替代纯阿拉伯数字,为章的视觉变体,本质层级不变。
- 特定词汇:
- 均为保险条款功能分类专属词汇,无行业外内容,核心分为:
- 保障类: 我们保什么、我们保多久、我们不保什么
- 缴费类: 如何支付保险费、如何交纳保费
- 理赔类: 如何申领保险金、如何领取保险金
- 退保类: 如何退保
- 其他类: 其他事项、需关注的其他内容
- 处理方式:
- 符号转换: 圆圈阿拉伯数字(➊)统一转为纯阿拉伯数字(1),消除视觉变体;
- 标题规范: 提取数字编号+标题内容,删除标题后多余标点(如句号、感叹号),标题内顿号/逗号保留;
- 层级标注: 按
## 数字 标题格式生成Markdown,数字与标题之间加一个半角空格; - 间距保留: Markdown中章与章之间保留一个空行,章与下属条之间无空行。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1、我们保什么、保多久 | ## 1 我们保什么、保多久 |
| ➋ 我们不保什么 | ## 2 我们不保什么 |
| 3 如何支付保险费 | ## 3 如何支付保险费 |
3.2.3 条
- 识别规则:
- 为章的直接细分模块,仅归属某一具体章,无跨章归属;
- 编号为章编号+小数点+阿拉伯数字(如1.1、2.3),为二级小数点编号,无更多层级小数点;
- 同一条章下属条的编号连续,跨章后重新从x.1开始编号;
- 内容为保险具体业务规则标题,比章的内容更具体,如“保险金额”“保险责任”“保单红利”。
- 格式特征:
- 字号: 小于章,大于正文、款/项/目,为条款内第三大字号;
- 样式: 加粗(必选),无描边/放大处理;
- 对齐: 左对齐,部分PDF会做2字符缩进(相对于章);
- 间距: 条与条之间无空行,条与下属款之间无空行或1行半角空行;
- 换行: 标题内容过长时,PDF会自动换行,换行后整体左对齐/缩进对齐。
- 特定词汇:
- 为保险条款具体规则专属词汇,与章的功能分类强匹配,核心示例:
- 归属“我们保什么”章: 保险金额、投保范围、保险责任、保单红利、保险期间
- 归属“我们不保什么”章: 责任免除、其他免责条款
- 归属“如何支付”章: 保险费的支付、宽限期、效力中止与恢复
- 处理方式:
- 编号保留: 直接保留小数点编号格式(如1.1、3.2),不做拆分/修改;
- 标题规范: 提取小数点编号+标题内容,删除标题后多余标点,标题内特殊符号(如/、())保留;
- 层级标注: 按
### 小数点编号 标题格式生成Markdown,编号与标题之间加一个半角空格; - 缩进处理: PDF中若有缩进,Markdown中无需额外加缩进,通过层级区分即可;
- 换行合并: PDF中标题自动换行的内容,Markdown中合并为一行,无手动换行。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1.1保险金额 | ### 1.1 保险金额 |
| 1.3 保险责任 | ### 1.3 保险责任 |
| 2.1 责任免除 | ### 2.1 责任免除 |
3.2.4 款
3.2.4.1 款(主)
- 识别规则:
- 为条的直接细分模块,仅归属某一具体条,无跨条/跨章归属;
- 编号为条编号+小数点+阿拉伯数字(如1.3.1、2.1.2),是条款结构中标准化的第三级标题,为“款”的主流呈现形式;
- 同一条下属款(主)的编号连续,跨条后重新从x.x.1开始编号;
- 内容为保险核心责任/规则的标准化分类,是条的核心内容拆分,为保险条款的核心业务层,承载条款的核心业务逻辑(如“1.3.1 被保险人为一人”“2.1.2 故意行为免责”)。
- 格式特征:
- 字号: 与正文一致,小于条/章;
- 样式: 可选加粗(保险条款中约60%的款(主)会轻微加粗,40%为常规字体,加粗目的是强化核心业务分类的视觉识别);
- 对齐: 左对齐,必做2-4字符缩进(相对于条);
- 间距: 款(主)与款(主)之间无空行,款(主)与下属项之间无空行;
- 标识: 无额外装饰性符号,编号为纯数字小数点格式,无冗余字符,符合保险条款标准化排版规范。
- 特定词汇:
- 与保险条款具体险种责任强关联,不同险种(医疗/寿险/重疾)的款(主)词汇差异显著,核心示例:
- 医疗险: 1.2.1 一般医疗范围、1.2.2 重疾医疗范围
- 寿险: 1.3.1 被保险人为一人、1.3.2 被保险人为两人
- 通用规则: 2.1.1 宽限期计算、2.1.2 效力恢复条件
- 处理方式:
- 编号保留: 直接保留“条编号+小数点+阿拉伯数字”的格式(如1.3.1、2.1.2),不做拆分/修改,保障层级编号的标准化;
- 层级标注: 按
#### 数字小数点编号 内容格式生成Markdown,编号与内容之间加一个半角空格; - 缩进处理: PDF中的缩进通过Markdown层级区分,无需额外加缩进字符;
- 样式统一: 无论PDF中是否加粗,Markdown中均仅通过层级体现,不额外加加粗符号(避免样式冗余影响数据建模解析)。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1.3.1被保险人为一人 | #### 1.3.1 被保险人为一人 |
| 2.1.2 故意行为免责 | #### 2.1.2 故意行为免责 |
| 1.2.1 一般医疗范围 | #### 1.2.1 一般医疗范围 |
3.2.4.2 款(次)
- 识别规则:
- 为条的直接细分模块,仅归属某一具体条,无跨条/跨章归属;
- 编号为中文圆括号+阿拉伯数字(如(一)、(二)),无上级数字编号,是“款”的简化呈现形式,多见于责任清单、规则枚举类场景(无需标准化小数点编号);
- 同一条下属款(次)的编号连续,跨条后重新从(一)开始编号;
- 内容为保险核心责任/规则的简化分类,是条的核心内容拆分,以清单式呈现核心责任(如“(一)被保险人为一人”“(一)一般医疗费用保险金”),适配非标准化但高频的条款排版场景。
- 格式特征:
- 字号: 与正文一致,小于条/章;
- 样式: 可选加粗(保险条款中约50%的款(次)会加粗,略高于款(主)的加粗比例,因需突出简化层级下的核心责任分类);
- 对齐: 左对齐,必做2-4字符缩进(相对于条,与款(主)缩进一致,保障视觉层级统一);
- 间距: 款(次)与款(次)之间无空行,款(次)与下属项之间无空行;
- 标识: 部分PDF会在款(次)编号前加全角顿号/点号,为视觉装饰,无层级意义。
- 特定词汇:
- 与保险条款具体险种责任强关联,更偏向清单式责任命名,核心示例:
- 医疗险: (一)一般医疗费用保险金、(二)重大疾病医疗费用保险金
- 寿险: (一)被保险人为一人、(二)被保险人为两人
- 通用规则: (一)宽限期、(二)效力恢复
- 处理方式:
- 编号保留: 直接保留中文圆括号编号格式(如(一)、(三)),不做符号转换,适配条款原始排版习惯;
- 标识删除: 删除款(次)编号前的装饰性全角顿号/点号,仅保留核心编号(避免冗余字符干扰数据建模的层级解析);
- 层级标注: 按
#### 中文圆括号编号 内容格式生成Markdown,编号与内容之间加一个半角空格; - 缩进处理: PDF中的缩进通过Markdown层级区分,无需额外加缩进字符;
- 样式统一: 无论PDF中是否加粗,Markdown中均仅通过层级体现,不额外加加粗符号。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| (一)被保险人为一人 | #### (一)被保险人为一人 |
| (二)被保险人为两人 | #### (二)被保险人为两人 |
| (一)一般医疗费用保险金 | #### (一)一般医疗费用保险金 |
3.2.5 项
- 识别规则:
- 为款的直接细分模块,仅归属某一具体款,无跨款/跨条/跨章归属;
- 编号为纯阿拉伯数字+英文点号/中文顿号(如1.、2、3、),无上级编号,仅通过排版缩进归属对应款;
- 同一款下属项的编号连续,跨款后重新从1开始编号;
- 内容为保险责任/规则的具体执行条件,是可落地的细分规则,如“被保险人18周岁之前身故”“交费期间未届满”。
- 格式特征:
- 字号: 与正文/款一致,为条款内标准正文字号;
- 样式: 常规字体(无加粗,保险条款通用);
- 对齐: 左对齐,必做4-6字符缩进(相对于款,是条款中缩进最大的层级之一);
- 间距: 项与项之间无空行,项与下属目之间无空行;
- 换行: 内容过长时PDF自动换行,换行后缩进与编号首行对齐(而非左对齐)。
- 特定词汇:
- 为保险条款责任执行条件专属词汇,多包含数值、时间、状态类词汇,核心示例:
- 年龄类: 18周岁之前、18周岁之后、小于40周岁、61周岁及以上
- 缴费类: 交费期间未届满、交费期间已届满、首期保险费、分期支付
- 状态类: 被保险人身故、合同终止、保单生效、效力中止
- 处理方式:
- 编号规范: 统一将编号处理为阿拉伯数字+英文点号(如1.、2.),删除中文顿号/无符号的情况;
- 层级标注: 无Markdown标题层级,直接用有序列表1. 格式呈现,编号与内容之间加一个半角空格;
- 缩进继承: Markdown中通过列表自动缩进实现层级,无需额外添加缩进字符;
- 换行合并: PDF中自动换行的内容,Markdown中合并为一行,若内容过长(超过80字符),可在标点处手动换行并保持缩进。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1 被保险人于18周岁之前(不含18周岁)身故 | 1. 被保险人于18周岁之前(不含18周岁)身故 |
| 2、被保险人于18周岁之后(含18周岁)身故且交费期间未届满 | 2. 被保险人于18周岁之后(含18周岁)身故且交费期间未届满 |
| 3 被保险人于18周岁之后(含18周岁)身故且交费期间已届满 | 3. 被保险人于18周岁之后(含18周岁)身故且交费期间已届满 |
3.2.6 目
- 识别规则:
- 为项的直接细分模块,是保险条款最小执行单元,无下属层级,仅归属某一具体项;
- 编号为英文小括号+阿拉伯数字(如(1)、(2)),部分PDF为中文小括号+阿拉伯数字(如{1}、【2】),无上级编号;
- 同一项下属目的编号连续,跨项后重新从(1)开始编号;
- 内容为保险责任/规则的数值/标准/范围界定,多为可量化的赔付标准、计算方式、金额比例等。
- 格式特征:
- 字号: 与正文/款/项一致,为条款内标准正文字号;
- 样式: 常规字体(无加粗,部分PDF会对数值做加粗处理);
- 对齐: 左对齐,必做6-8字符缩进(相对于项,为条款中最大缩进层级);
- 间距: 目与目之间无空行,无下属内容,末尾多为句号/分号;
- 内容: 以量化信息为主,极少出现大段文字,多包含数字、比例、公式、表格关联等。
- 特定词汇:
- 为保险条款量化标准专属词汇,多包含金额、比例、计算、数值类词汇,核心示例:
- 金额类: 所交保险费、现金价值、基本保险金额、当年度保额
- 比例类: 160%、140%、120%、乘以对应比例
- 计算类: 两者的较大值、三者的最大值、按实付保险费与应付保险费的比例
- 处理方式:
- 编号规范: 统一将编号处理为英文小括号+阿拉伯数字(如(1)、(2)),删除中文小括号/方括号的情况;
- 层级标注: 无Markdown标题层级,直接用有序列表(1) 格式呈现,编号与内容之间加一个半角空格;
- 缩进继承: Markdown中通过列表嵌套实现缩进,作为项的子列表呈现;
- 数值保留: PDF中加粗的数值/比例,Markdown中保留加粗(用 标注),突出量化核心;
- 标点统一: 目末尾的分号统一改为句号,保持标点规范。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| (1)本合同的所交保险费 | (1) 本合同的所交保险费 |
| {2}被保险人身故当时本合同的现金价值 | (2) 被保险人身故当时本合同的现金价值 |
| (3)所交保费×160% | (3) 所交保费×160% |
3.3 章节模式 2 : 中文模式
3.3.1 总览
| 层级 | 术语 | Markdown 建议 | 核心特征 | 示例 |
|---|---|---|---|---|
| L1 | 条 | ## |
以“第X条”+ 核心主题命名,为条款一级架构,无上级归属,覆盖保险核心规则模块 | 第一条 保险合同构成;第四条 保险责任;第五条 责任免除 |
| L2 | 款 | ### |
条下的中文数字+顿号编号(一、二、三、),为条的核心内容分类,聚焦具体责任/规则板块 | 一、一般医疗费用保险金;二、重大疾病医疗费用保险金;三、意外门急诊医疗费用保险金 |
| L3 | 项 | #### |
款下的中文圆括号编号(一)、(二)、(三),为款的细分执行规则,明确具体保障/赔付场景 | (一)住院医疗费用保险金;(二)特殊门诊医疗费用保险金;(三)门诊手术医疗费用保险金 |
| L4 | 目 | 有序列表1.列表 |
项下的阿拉伯数字+英文点号编号(1.、2.、3.),为条款最小执行单元,含量化标准/材料要求 | 1. 保险单;2. 申请人法定身份证明;3. 诊断证明及检查报告 |
3.3.2 条
- 识别规则:
- 为条款一级架构,覆盖保险合同核心规则,无上级编号归属,仅存在于条款正文(阅读指引/附录外);
- 编号格式为“第+阿拉伯数字+条”,后接核心主题词,主题词为保险专属模块(如合同构成、投保范围、保险责任、责任免除);
- 同一份条款中条的编号连续(从第一条开始递增),无重复、无跳号,核心主题不重叠;
- 内容为概括性规则说明,不包含具体量化标准,仅明确该条的核心管辖范围。
- 格式特征:
- 字号: 大于正文、款/项/目,为条款内第二大字号(仅低于文档主标题);
- 样式: 加粗(必选),部分PDF会做字符加粗+居中对齐处理;
- 对齐: 左对齐(主流)或居中对齐(少数),无缩进;
- 间距: 条与条之间必须有1-2行空行,条与下属款之间无空行(款直接紧跟条的内容);
- 换行: 标题内容过长时,PDF会自动换行,换行后整体左对齐/居中对齐,主题词完整不拆分。
- 特定词汇:
- 均为保险合同核心模块专属词汇,无行业外内容,核心分为4大类:
- 合同基础类: 保险合同构成、投保范围、合同成立与生效
- 保障责任类: 保险责任、保险金额、给付比例
- 免责规则类: 责任免除、其他免责条款
- 操作规则类: 保险费、保险金申请、合同终止、附则
- 处理方式:
- 标题规范: 提取“第X条+主题词”,删除标题后多余标点(如句号、分号),主题词内特殊符号(如“(尊享版)”“——”)保留;
- 层级标注: 按
## 第X条 主题词格式生成Markdown,“第X条”与主题词之间加一个半角空格; - 间距保留: Markdown中条与条之间保留一个空行,条与下属款之间无空行;
- 对齐统一: 无论PDF中是左对齐还是居中对齐,Markdown中均统一为左对齐,通过层级区分优先级。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 第一条 保险合同构成 | ## 第一条 保险合同构成 |
| 第四条 保险责任 | ## 第四条 保险责任 |
| 第五条 责任免除 | ## 第五条 责任免除 |
| 第八条 保险金申请所需证明和资料 | ## 第八条 保险金申请所需证明和资料 |
3.3.3 款
- 识别规则:
- 为条的直接细分模块,仅归属某一具体条,无跨条/跨章节归属;
- 编号格式为“中文数字+顿号”(一、二、三、),无上级编号前缀,仅通过排版缩进与条绑定;
- 同一条下属款的编号连续,跨条后重新从“一、”开始编号;
- 内容聚焦具体责任/规则板块,与条的核心主题强相关(如“保险责任”条下款均为具体费用保险金)。
- 格式特征:
- 字号: 与正文一致,小于条,大于项/目;
- 样式: 必加粗(保险条款通用规范),无描边/放大处理;
- 对齐: 左对齐,必做2-4字符缩进(相对于条,视觉上与条区分);
- 间距: 款与款之间无空行,款与下属项之间无空行(项直接紧跟款的内容);
- 换行: 标题内容过长时,PDF自动换行,换行后缩进与编号首行对齐(不左对齐)。
- 特定词汇:
- 与条的核心主题强绑定,为具体责任/规则的分类名称,核心示例:
- 归属“保险责任”条: 一般医疗费用保险金、重大疾病医疗费用保险金、基本医保范围内意外门(急)诊医疗费用保险金、院外特定药品费用保险金
- 归属“保险金申请”条: 申请一般医疗费用保险金所需资料、申请重大疾病医疗费用保险金所需资料、申请意外门急诊保险金所需资料
- 归属“责任免除”条: 投保人故意行为、被保险人违法犯罪行为、先天性疾病、高风险活动
- 处理方式:
- 编号保留: 直接保留“中文数字+顿号”格式(如“一、”“二、”),不做符号转换;
- 层级标注: 按
### 中文数字、主题词格式生成Markdown,编号与主题词之间加一个半角空格; - 缩进处理: PDF中的缩进通过Markdown层级区分,无需额外添加缩进字符;
- 换行合并: PDF中标题自动换行的内容,Markdown中合并为一行,确保主题词完整。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 一、一般医疗费用保险金 | ### 一、一般医疗费用保险金 |
| 二、重大疾病医疗费用保险金 | ### 二、重大疾病医疗费用保险金 |
| 三、基本医保范围内意外门(急)诊医疗费用保险金 | ### 三、基本医保范围内意外门(急)诊医疗费用保险金 |
3.3.4 项
- 识别规则:
- 为款的直接细分模块,仅归属某一具体款,无跨款/跨条归属;
- 编号格式为“中文圆括号+中文数字”(一)、(二)、(三),无上级编号前缀,仅通过排版缩进与款绑定;
- 同一款下属项的编号连续,跨款后重新从“(一)”开始编号;
- 内容聚焦具体保障/赔付场景,明确某一费用/责任的适用条件(如“住院医疗费用保险金”项明确住院治疗的保障规则)。
- 格式特征:
- 字号: 与正文/款/目一致,为条款内标准正文字号;
- 样式: 常规字体(无加粗,与款的加粗样式形成区分);
- 对齐: 左对齐,必做4-6字符缩进(相对于款,缩进量大于款);
- 间距: 项与项之间无空行,项与下属目之间无空行;
- 标识: 部分PDF会在项编号后加全角顿号(如“(一)、”),为视觉装饰,无层级意义。
- 特定词汇:
- 与款的责任分类强相关,为具体场景化责任名称,核心示例:
- 归属“一般医疗费用保险金”款: 住院医疗费用保险金、特殊门诊医疗费用保险金、住院前后门(急)诊医疗费用保险金、门诊手术医疗费用保险金
- 归属“保险金申请资料”款: 保险单、申请人法定身份证明、诊断证明及检查报告、医疗费用结算凭证
- 归属“责任免除”款: 投保人故意杀害/伤害、被保险人故意犯罪、高风险活动、先天性疾病
- 处理方式:
- 编号规范: 统一保留“中文圆括号+中文数字”格式(如“(一)”“(二)”),删除编号后多余的全角顿号;
- 层级标注: 按
#### (中文数字)主题词格式生成Markdown,编号与主题词之间加一个半角空格; - 缩进继承: Markdown中通过层级区分缩进,无需额外添加缩进字符;
- 内容拆分: 若项的内容包含大段描述(如保障范围、赔付条件),Markdown中保持段落格式,不拆分核心语义。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| (一)住院医疗费用保险金 | #### (一)住院医疗费用保险金 |
| (二)、特殊门诊医疗费用保险金 | #### (二)特殊门诊医疗费用保险金 |
| (三)门诊手术医疗费用保险金 | #### (三)门诊手术医疗费用保险金 |
3.3.5 目
- 识别规则:
- 为项的直接细分模块,是条款最小执行单元,无下属层级,仅归属某一具体项;
- 编号格式为“阿拉伯数字+英文点号”(1.、2.、3.),部分PDF为“阿拉伯数字+中文顿号”(1、2、),无上级编号前缀;
- 同一项下属目的编号连续,跨项后重新从“1.”开始编号;
- 内容为量化标准、材料清单、条件限制等可直接落地的规则,无大段描述性文字。
- 格式特征:
- 字号: 与正文/款/项一致,为条款内标准正文字号;
- 样式: 常规字体,部分PDF会对核心材料/标准(如“保险单”“10000元”)做加粗处理;
- 对齐: 左对齐,必做6-8字符缩进(相对于项,为条款中最大缩进层级);
- 间距: 目与目之间无空行,末尾多为句号/分号,无额外换行;
- 内容: 以“名词短语”“量化标准”“材料名称”为主,长度较短(通常10-30字符)。
- 特定词汇:
- 为保险条款具体执行所需的“材料/标准/范围”,核心示例:
- 材料类: 保险单、申请人法定身份证明、诊断证明、医疗费用结算凭证、药品处方原件
- 标准类: 10,000元免赔额、100%给付比例、1,500,000元限额、二级以上公立医院
- 条件类: 非首次投保、上一保险期间届满前申请续保、生效后30日(续保无此限制)
- 处理方式:
- 编号规范: 统一将编号处理为“阿拉伯数字+英文点号”(如“1.”“2.”),删除中文顿号/无符号的情况;
- 层级标注: 无Markdown标题层级,直接用有序列表1. 格式呈现,编号与内容之间加一个半角空格;
- 缩进继承: Markdown中通过列表嵌套实现缩进,作为项的子列表呈现;
- 加粗保留: 若PDF中目内核心信息(如金额、材料名称)有加粗,Markdown中保留加粗格式(用 标注);
- 标点统一: 目末尾的分号统一改为句号,保持标点规范。
- 示例:
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1、保险单 | 1. 保险单 |
| 2. 申请人法定身份证明 | 2. 申请人法定身份证明 |
| 3 由二级以上(含二级)公立医院出具的诊断证明 | 3. 由二级以上(含二级)公立医院出具的诊断证明 |
| 4. 医疗费用结算凭证(急诊需加盖急诊印章) | 4. 医疗费用结算凭证(急诊需加盖急诊印章) |
- 在
条下方
第二条 投保范围
凡出生二十八日以上、八十周岁以下的身体健康者,均可作为被保险人,由具有完全民事行为能力的本人或对其具有保险利益的其他人作为投保人,向本公司投保本保险。
若投保人在被保险人八十一周岁至一百周岁期间投保本保险的,需要同时满足以下两个条件:
1.非首次投保;
2.投保人需在上一个保险期间届满前提出重新投保申请。
- 在
款下方
第八条 保险金申请所需证明和资料
一、申请住院医疗费用保险金时,所需的证明和资料为:
1.保险单;
2.申请人法定身份证明;
3.由二级以上(含二级)医院或本公司
- 在
项下方
第八条 保险金申请所需证明和资料
一、申请一般医疗费用保险金、基本医保范围内意外门(急)诊医疗费用保险金时,所需的证明和资料为:
(一)保险单:
1. xxx
2. xxx
3. xxx
3.4 段落文本
3.4.1 识别规则
- 为保险条款中无编号、无列表标识的纯描述性文本,是对条、款、项、目等层级核心规则的详细阐释、条件界定、范围说明,无独立层级归属,必须依附于某一具体编号层级(条/款/项/目)存在,不可单独成段。
- 内容围绕单一保险规则点展开,语义连贯完整,无跨主题表述(如同一段落不同时说明“住院赔付”和“门诊赔付”)。
- 保险条款中段落文本仅出现于条款正文区,阅读指引、目录、附表、释义附录中无大段此类文本,且与列表、表格等元素形成明确区分。
- 按功能可分为规则阐释型、条件限制型、计算说明型、术语解释型、流程描述型五类,均为保险业务/法律层面的正式表述,无口语化、宣传性内容。
- 段落内可穿插量化信息(金额、比例、天数)、专业术语、法律句式,但无分行列举的信息(分行列举为列表项特征)。
3.4.2 格式特征
- 字号: 为保险条款的标准正文字号(通常10pt/11pt),是条款中最基础的字号,小于所有编号层级的标题字号。
- 字体: 保险条款通用宋体(中文)/Times New Roman(英文数字),无字体混用情况,部分外资保险公司条款会用仿宋,但仍为单一字体。
- 样式: 常规字体(无加粗、斜体、下划线),仅段落内的核心量化信息、专业术语可能单独加粗(非整段加粗)。
- 对齐: 统一左对齐,无居中、右对齐情况,是保险条款排版的通用对齐方式。
-
缩进: 采用层级关联式缩进,缩进量随上级归属层级递增,无固定值,仅与上级层级形成视觉区分:
- 依附于「条」的段落: 相对于条标题缩进2-4字符;
- 依附于「款」的段落: 相对于款标题缩进4-6字符;
- 依附于「项」的段落: 相对于项标题缩进6-8字符;
- 依附于「目」的段落: 相对于目标题缩进8-10字符; 无首行缩进(保险条款核心排版特征,区别于普通文书的首行2字符缩进)。
-
间距:
- 与上级编号层级(条/款/项/目)之间: 无空行,直接紧跟标题/编号后;
- 同主题连续段落之间: 无空行,紧密衔接;
- 不同主题段落之间: 有1行半角空行,用于区分不同规则点的阐释内容;
- 与下级列表/表格之间: 无空行,段落结束后直接衔接列表/表格。
-
换行: PDF中因页面宽度限制自动换行,换行后与段落首行对齐(无悬挂缩进),且不会在核心词汇、专业术语、数字中间换行。
- 标点: 统一使用中文全角标点,句式结尾以句号收尾,条件句以分号/逗号做分句分隔,专业术语多搭配双引号/破折号,数字与单位之间无空格(如10000元、100%)。
3.4.3 保险条款专属特征
-
内容类型固定: 仅为保险条款规则的补充阐释,无无关内容,核心分为5类:
- 规则阐释型: 对保险责任、免责条款等核心规则的范围界定(如“本合同约定的住院医疗费用包括住院手术费、床位费、药品费等”);
- 条件限制型: 明确规则的适用前提(如“按本合同约定续保的,不受三十日的等待期限制”);
- 计算说明型: 对保险金、现金价值、保费等的计算方式说明(如“所交保险费按年交保险费×已交费年度数计算”);
- 术语解释型: 对条款中未单独列入释义的专业词汇做临时说明(如“二级以上公立医院不含特需部、国际部、VIP部”);
- 流程描述型: 对理赔、续保、退保等操作的流程步骤做简要说明(如“保险期间届满,投保人需重新向本公司申请投保本保险,并经本公司同意后续保”)。
-
词汇高度专业: 大量出现保险专业术语(现金价值、宽限期、复效、免赔额)、法律术语(投保人、被保险人、受益人、不可抗力)、险种专属术语(医疗险: 特殊门诊、院外特药;寿险: 基本保险金额、当年度保额;重疾险: 专科医生、永久不可逆)。
- 句式偏法律化: 多为陈述句、条件复句(若/如果/当……则/才……)、限定复句(仅/仅指/不包括……),逻辑严谨,无感叹句、疑问句,且存在大量“兜底式表述”(如“本公司要求的其他证明和资料”)。
- 量化信息高频穿插: 段落中常出现具体的金额、比例、天数、年限、等级等量化信息,为保险规则的核心要素,且数值多带单位(元、%、日、周岁、级)。
- 无冗余表述: 文本简洁精炼,无宣传性、解释性的冗余内容,每一句话均为保险规则的有效组成部分,符合保险条款的法律文书属性。
3.4.4 处理方式
- 缩进处理: Markdown中不手动添加缩进字符/空格,通过上级层级的Markdown格式(标题/列表)实现自然缩进,依托工具的层级解析逻辑继承缩进关系,避免手动排版的混乱。
- 间距保留: 严格遵循PDF中的间距规则,同主题连续段落连排,不同主题段落之间保留一个空行,与下级列表/表格之间无空行。
- 换行合并: 将PDF中因页面宽度自动换行的同一语义段落合并为一行,无手动换行;若段落内容过长(单段超过150字符),可在条件句分隔处、标点符号后进行合理断行,断行后保持行首对齐,不拆分核心语义(如条件句的“若……”和“则……”不分开)。
-
量化信息突出: 将段落中核心的量化信息(金额、比例、天数、年限、等级)用粗体标注,方便LLM快速识别保险规则的核心数值,标注规则:
- 金额: 含数字+元的数值(如10000元、1500000元);
- 比例: 含数字+%的数值(如100%、60%);
- 时间: 含数字+日/周岁/年的数值(如30日、18周岁、2年);
- 等级/数量: 保险规则相关的等级、数量(如二级以上、三项以上)。
-
术语保留: 段落中的保险/法律/医疗专业术语(含双引号/破折号的)直接保留原格式,不做修改(如“恶性肿瘤——重度”、专科医生、现金价值)。
- 标点统一: 将PDF中偶发的半角标点混用(如英文逗号、句号)统一修正为中文全角标点,段落结尾统一用句号收尾,分句间的分号/逗号保持不变。
- 语义完整: 禁止拆分核心句子,尤其是条件复句、限定复句,确保LLM能完整解析规则的逻辑关系(如“若被保险人初次确诊重大疾病,且在医院接受治疗的,本公司按约定给付保险金”不可拆分为多段)。
- 特殊符号处理: 对条款中的特殊符号(如×、÷、≥、≤、(含)、(不含))直接保留,数字中的千分号(,)统一保留(如1,500,000元),保持与原条款一致。
3.4.5 示例
- 示例1: 医疗险责任阐释型段落
| PDF原始内容 | Markdown处理后 |
|---|---|
| 被保险人因意外伤害或在本合同生效三十日后因疾病在二级以上公立医院的普通部接受住院治疗的,对于被保险人实际发生并支付的、医疗必需且合理的住院医疗费用,在扣除当地基本医疗保险、其他途径已经补偿的部分以及一般医疗费用保险金免赔额10000元后,本公司按照100%的给付比例给付住院医疗费用保险金。 | 被保险人因意外伤害或在本合同生效30日后因疾病在二级以上公立医院的普通部接受住院治疗的,对于被保险人实际发生并支付的、医疗必需且合理的住院医疗费用,在扣除当地基本医疗保险、其他途径已经补偿的部分以及一般医疗费用保险金免赔额10000元后,本公司按照100%的给付比例给付住院医疗费用保险金。 |
- 示例2: 寿险条件限制型段落
| PDF原始内容 | Markdown处理后 |
|---|---|
| 若本合同被保险人为两人,在本合同第5个保单周年日后,当两名被保险人均生存时,投保人可以向本公司申请减少一名被保险人,经本公司审核同意的,我们将在批单上载明留存的被保险人。 | 若本合同被保险人为两人,在本合同第5个保单周年日后,当两名被保险人均生存时,投保人可以向本公司申请减少一名被保险人,经本公司审核同意的,我们将在批单上载明留存的被保险人。 |
- 示例3: 通用计算说明型段落
| PDF原始内容 | Markdown处理后 |
|---|---|
| 若交费方式为期交,所交保险费按照被保险人身故当时本合同基本保险金额确定的年交保险费×已交费年度数计算。 | 若交费方式为期交,所交保险费按照被保险人身故当时本合同基本保险金额确定的年交保险费×已交费年度数计算。 |
3.5 列表项
3.5.1 识别规则
- 为保险条款中带特定标识前缀的分行列举文本,是对条/款/项/目核心规则的拆分式呈现(如材料清单、责任情形、免责情形),无独立层级归属,必须依附于某一具体编号层级(条/款/项/目)或段落文本存在,不可单独成组。
- 每个列表项仅对应单一规则点,内容简洁(多为短语/短句),无跨主题表述(如同一系列列表项不同时包含“材料”和“条件”)。
- 按标识类型可分为无序列表项(带•、○、●等符号)和有序列表项(带1.、(1)、①等编号),保险条款中以无序列表项为主,有序列表项多用于流程步骤、优先级排序。
- 列表项仅出现于条款正文区,目录、附表、释义中无此类列表,且与段落文本、表格形成明确区分(列表项分行排列,段落文本连续排列)。
- 同组列表项的标识格式统一(无混合使用•和1.的情况),且逻辑关联紧密(如“保险金申请材料”列表项均为必备材料)。
3.5.2 格式特征
- 字号: 与正文/段落文本一致,为条款标准正文字号(10pt/11pt),小于所有编号层级的标题字号。
- 字体: 与正文一致(宋体/ Times New Roman),无字体混用,仅列表项内的核心信息(如材料名称、专业术语)可能单独加粗。
- 样式: 常规字体(无整项加粗),核心信息(材料、量化标准)可局部加粗。
- 对齐: 左对齐,与段落文本对齐方式一致。
-
缩进: 采用标识+间距的缩进逻辑,缩进量与上级归属层级强相关:
- 依附于「款」的列表项: 标识后空1个半角空格,整体相对于款标题缩进6-8字符;
- 依附于「项」的列表项: 标识后空1个半角空格,整体相对于项标题缩进8-10字符;
- 依附于「段落文本」的列表项: 标识后空1个半角空格,整体相对于段落首行缩进2字符; 无首行额外缩进,仅通过标识与文本的间距区分层级。
-
间距:
- 同组连续列表项之间: 无空行,紧密分行排列;
- 列表项与上级归属层级(款/项/段落)之间: 无空行,直接紧跟上级内容;
- 不同组列表项之间: 有1行半角空行,用于区分不同规则点的列举;
- 列表项与下级子列表之间: 无空行,子列表直接紧跟父列表项。
-
标识: 保险条款常用标识固定,无杂乱符号:
- 无序列表项: •(实心圆点)、○(空心圆圈)、●(实心圆圈)、√(勾选符号),以•和○为主;
- 有序列表项: 1.(阿拉伯数字+英文点号)、(1)(英文小括号+阿拉伯数字)、①(带圈阿拉伯数字),以1.和(1)为主;
- 特殊列表项: 部分免责条款用“■”“▲”标识,为视觉强调,本质仍为无序列表项。
-
换行: 列表项内容过长时,PDF自动换行,换行后与列表项首行文本对齐(无悬挂缩进),不拆分核心词汇(如“医疗费用结算凭证”不跨行拆分)。
- 标点: 列表项结尾多为无标点(短语类)或句号(短句类),无逗号、分号结尾,专业术语保留双引号,数字与单位无空格。
3.5.3 保险条款专属特征
-
列表项类型固定: 仅服务于保险规则的列举,核心分为4类,无无关类型:
- 材料类: 保险金申请、退保、续保等所需的证明文件(如“保险单”“诊断证明”“身份证”);
- 责任类: 保险责任、保障范围的具体情形(如“恶性肿瘤放射治疗”“血液透析治疗”“住院手术费”);
- 免责类: 责任免除的具体情形(如“投保人故意杀害被保险人”“被保险人酒后驾驶”“先天性疾病”);
- 条件类: 规则适用的具体前提(如“非首次投保”“上一保险期间届满前申请”“二级以上公立医院”)。
-
内容高度精炼: 均为短语或短句(10-50字符),无大段描述性文字,直接指向核心规则点,符合保险条款“简洁明确”的法律属性。
- 与上级层级强绑定: 列表项的主题的与上级款/项/段落完全一致(如“申请重大疾病医疗费用保险金所需资料”款下,列表项均为重疾理赔材料),无偏离主题的内容。
- 专业术语与量化信息密集: 列表项中高频出现保险术语(如“现金价值”“专科医生”)、医疗术语(如“住院前后门急诊”“靶向疗法”)、量化标准(如“10个工作日”“二级以上”“0元免赔额”)。
- 无冗余项: 每个列表项均为保险规则的“必要组成部分”,无重复、无无关内容(如材料类列表项均为理赔必需材料,无可选无关材料)。
3.5.4 处理方式
-
标识统一: 按“类型对应固定标识”原则统一格式,避免杂乱:
- 无序列表项: 无论PDF原标识为○、●、√,均统一为•(Markdown标准无序列表标识);
- 有序列表项: 原标识为1.、①的统一为1.,原标识为(1)的保留(1),确保层级区分(一级有序列表用1.,二级用(1));
- 特殊标识(■、▲): 统一转为•,保留原列表项的语义,不改变层级。
-
缩进继承: Markdown中不手动添加缩进字符,通过“上级层级格式+列表嵌套”实现自然缩进:
- 一级列表项(依附于款/项): 直接用•或1.,依托上级标题的层级缩进;
- 二级列表项(依附于一级列表项): 用(1)或•,作为子列表嵌套,自动继承缩进。
-
间距保留: 严格遵循PDF间距规则:
- 同组列表项之间: 连排无空行;
- 不同组列表项之间: 保留1个空行;
- 列表项与上级内容(款/项/段落)之间: 无空行;
- 列表项与下级子列表之间: 无空行。
-
核心信息加粗: 将列表项中的关键信息用粗体标注,方便LLM快速识别核心规则:
- 材料类: 材料名称(如保险单、诊断证明);
- 责任类: 责任名称、治疗方式(如恶性肿瘤放射治疗、住院手术费);
- 免责类: 免责情形关键词(如故意杀害、酒后驾驶);
- 条件类: 量化标准、核心前提(如二级以上公立医院、非首次投保)。
-
换行与标点统一:
- 换行: 将PDF中自动换行的列表项内容合并为一行,过长时在标点后合理断行,断行后与首行对齐;
- 标点: 短语类列表项统一不加标点,短句类列表项统一以句号结尾,修正原条款的标点混用问题。
-
子列表处理: 若列表项包含下级子列表(如“材料类列表项+子项说明”),用Markdown嵌套列表呈现,子列表标识按“一级1.→二级(1)→三级•”的逻辑统一。
3.5.5 示例
示例1: 材料类无序列表项
| PDF原始内容 | Markdown处理后 |
|---|---|
| ○ 保险单 ○ 申请人法定身份证明 ○ 由二级以上(含二级)公立医院出具的诊断证明 ○ 医疗费用结算凭证(急诊需加盖急诊印章) | - 保险单 - 申请人法定身份证明 - 由二级以上(含二级) 公立医院出具的诊断证明 - 医疗费用结算凭证(急诊需加盖急诊印章) |
示例2: 责任类有序列表项
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1. 住院手术费 2. 床位费 3. 药品费 4. 医生诊疗服务费 5. 检查检验费 | 1. 住院手术费 2. 床位费 3. 药品费 4. 医生诊疗服务费 5. 检查检验费 |
示例3: 免责类特殊标识列表项
| PDF原始内容 | Markdown处理后 |
|---|---|
| ■ 投保人对被保险人的故意杀害、故意伤害 ■ 被保险人故意犯罪或抗拒依法采取的刑事强制措施 ■ 被保险人自杀或故意自伤(无民事行为能力人除外) | - 投保人对被保险人的故意杀害、故意伤害 - 被保险人故意犯罪或抗拒依法采取的刑事强制措施 - 被保险人自杀或故意自伤(无民事行为能力人除外) |
示例4: 带二级子列表的列表项
| PDF原始内容 | Markdown处理后 |
|---|---|
| 1. 一般医疗费用保险金 (1)住院医疗费用保险金 (2)特殊门诊医疗费用保险金 2. 重大疾病医疗费用保险金 (1)重大疾病住院医疗费用保险金 (2)重大疾病特殊门诊医疗费用保险金 | 1. 一般医疗费用保险金 (1) 住院医疗费用保险金 (2) 特殊门诊医疗费用保险金 2. 重大疾病医疗费用保险金 (1) 重大疾病住院医疗费用保险金 (2) 重大疾病特殊门诊医疗费用保险金 |
3.6 公式与代码
3.6.1 识别规则
- 公式: 保险条款中仅少量出现的基础量化计算式,是保险金、保费、现金价值等核心数值的计算依据,无复杂数学公式/函数,仅依附于「计算说明型段落」「目级层级」或「列表项」存在,不可独立成段/成组,且仅服务于保险规则的量化落地。
- 代码: 保险条款中基本无编程类代码(如Python/Java代码),仅极个别场景出现“代码类标识文本”(如保单代码、险种代码、核保代码),本质为字符标识,无可执行性,归为普通文本范畴。
- 公式仅包含基础算术运算(+、-、×、÷)、比较运算(≥、≤、>、<)、取值描述(最大值/最小值/较大值/较小值)三类,无矩阵、函数、积分等复杂运算,且运算对象均为保险核心数值(保费、保额、现金价值、比例、年度数)。
- 公式的表述形式分两类: 「纯符号式」(极少,如“保费×160%”)、「文字+符号混合式」(主流,如“所交保险费×对应比例”),均为保险条款的辅助说明内容,非核心规则主体。
3.6.2 格式特征
- 字号: 与正文/段落文本/列表项一致,为条款标准正文字号(10pt/11pt),公式中的核心数值(如160%、18)可能单独加粗。
- 字体: 与正文一致(宋体/ Times New Roman),数字、运算符多使用Times New Roman,文字部分使用宋体,无字体混用。
- 样式: 常规字体,仅核心数值/运算符可能局部加粗(非整公式加粗),无斜体、下划线。
- 对齐: 嵌入上下文文本/列表项中,随上下文左对齐,无居中、右对齐,仅极个别PDF会将公式单独分行并居中(多为复杂取值公式)。
-
间距:
- 公式与前后文本之间: 无额外空行,紧密衔接(如“身故保险金=所交保费×160%”);
- 运算符两侧: PDF中可能无空格/有全角空格,无统一规范;
- 单独分行的公式: 上下与文本之间各保留1行半角空行。
-
符号: 运算符多为全角符号(×、÷),少数为半角符号(*、/),≥、≤、(含)、(不含)等符号为保险条款通用符号,无特殊自定义符号。
- 代码类标识: 若出现(如“险种代码: A123”“保单代码: 8800012345”),为“文字+字母/数字”组合,无固定格式,多为行内文本,与普通文本无视觉区分。
3.6.3 保险条款专属特征
-
公式类型高度单一: 仅服务于保险核心数值计算,无其他类型公式,核心分为3类:
- 保费/保额计算: 所交保险费×已交费年度数、基本保险金额×给付比例;
- 保险金赔付计算: 现金价值×120%、max(所交保费, 现金价值)、min(医疗费用, 保额限额);
- 条件比较计算: 年龄≥18周岁、交费年度数≤5年、赔付比例>60%。
-
无编程代码: 保险条款为法律文书,不存在任何可执行的编程代码,“代码”类文字仅为标识(如险种代码、保单代码),无语法、无逻辑、无执行性,与普通术语属性一致。
- 公式表述偏文字化: 因面向普通投保人,公式极少用纯符号表述,多为“文字描述+核心运算符”(如“按实付保险费与应付保险费的比例计算”),降低理解门槛。
- 核心运算对象固定: 公式中的运算对象均为保险专属数值,无无关变量,核心包括: 所交保险费、基本保险金额、现金价值、已交费年度数、给付比例、免赔额、保额限额。
3.6.4 处理方式
3.6.4.1 公式处理(核心)
-
运算符统一: 为适配Markdown格式和LLM解析,统一运算符规范:
- 全角乘号× → 半角星号
*(Markdown通用乘号); - 全角除号÷ → 半角斜杠
/(Markdown通用除号); - +、-、≥、≤、>、<直接保留,不做修改;
- 运算符两侧加1个半角空格,提升可读性(如“所交保费 × 160%”)。
- 全角乘号× → 半角星号
-
取值描述标准化: 将保险条款中文字化的取值描述转为LLM易识别的标准化格式:
- “两者的较大值” →
max(值1, 值2); - “两者的较小值” →
min(值1, 值2); - “三者的最大值” →
max(值1, 值2, 值3); - “三者的最小值” →
min(值1, 值2, 值3); - 取值对象保留原条款的文字描述(如
max(所交保费, 现金价值))。
- “两者的较大值” →
-
核心数值突出: 公式中的量化数值(金额、比例、年限、年龄)用粗体标注,方便LLM快速识别核心计算参数:
- 比例: 160%、100%、60%;
- 金额: 10000元、1500000元;
- 时间/数量: 18周岁、5年、3个保单年度。
-
格式嵌入:
- 行内公式: 嵌入上下文文本中,不单独分行(如“身故保险金=所交保费 × 160%”);
- 单独分行公式: 保留原分行格式,公式居中(用Markdown居中语法
> 公式),上下各保留1个空行。
-
语义完整: 公式的文字描述部分不拆分,确保计算逻辑完整(如“按实付保险费与应付保险费的比例 × 保险金额计算”不拆分为多段)。
3.6.4.2 代码类标识处理(补充)
- 保险条款中无编程代码,若出现“代码类标识文本”(如保单代码、险种代码),按普通文本处理,不做特殊格式标注;
- 保留“代码”前的说明文字(如“险种代码: ”“保单代码: ”),代码本身原样保留(如“险种代码: A123”),不修改字符、不添加格式;
- 若代码为核心标识(如理赔所需的保单代码),可将代码部分加粗(如“保单代码: 8800012345”),突出关键信息。
3.6.5 示例
示例1: 纯符号式公式
| PDF原始内容 | Markdown处理后 |
|---|---|
| 身故保险金=所交保费×160% | 身故保险金=所交保费 × 160% |
| 现金价值=基本保险金额×120% | 现金价值=基本保险金额 × 120% |
示例2: 文字+符号混合式公式
| PDF原始内容 | Markdown处理后 |
|---|---|
| 所交保险费按年交保险费×已交费年度数计算 | 所交保险费按年交保险费 × 已交费年度数计算 |
| 给付金额=医疗费用-免赔额10000元×给付比例100% | 给付金额=医疗费用 - 免赔额10000元 × 给付比例100% |
示例3: 取值描述式公式
| PDF原始内容 | Markdown处理后 |
|---|---|
| 保险金给付金额为所交保费与现金价值两者的较大值 | 保险金给付金额为 max(所交保费, 现金价值) |
| 赔付金额为医疗费用、保额限额、医保报销后余额三者的最小值 | 赔付金额为 min(医疗费用, 保额限额, 医保报销后余额) |
示例4: 代码类标识文本
| PDF原始内容 | Markdown处理后 |
|---|---|
| 保单代码: 8800012345 险种代码: A123 | 保单代码: 8800012345 险种代码: A123 |
3.7 文字字体
3.7.1 识别规则
- 保险条款字体属性(类型、字号、样式)具有强统一性和功能关联性,不同功能文本(标题、正文、关键信息)的属性固定,无杂乱混用,是LLM快速识别文本功能的核心依据。
- 字体属性与文本功能强绑定: 标题类突出层级,正文类保证可读性,关键信息类强化识别,无跨功能属性混乱。
- 同一条款内同功能文本的字体属性一致(如所有正文字体、字号统一),不同公司条款的核心属性(正文宋体、标题加粗)通用。
3.7.2 格式特征
-
字体类型(核心固定)
-
中文: 统一为宋体(主流)或仿宋_GB2312(少数),无多字体混用;
- 英文/数字: 统一为Times New Roman,适用于标题、正文、公式中的英文/数字部分;
-
核心规则: 仅保留1-2种核心字体,无花哨字体(如楷体、艺术字)。
-
字号(适配功能)
-
标题类(主标题、章/条/款): 按功能层级适配字号,层级越高字号越大,同层级字号统一;
- 正文类(段落、列表项、公式): 统一为10-11pt标准字号,保证阅读连贯性;
- 附注/脚注: 比正文字号小1-2pt(8-9pt),不干扰核心内容;
-
核心规则: 字号仅服务于功能区分,无个性化调整,不出现反向层级字号(如正文比标题大)。
-
样式(功能专属)
-
加粗: 仅用于标题、关键术语、核心规则,强化层级和关键信息识别,不用于普通正文;
- 下划线: 仅用于利益条款引用、超链接(极少出现),无其他用途;
- 核心规则: 仅保留2种常用样式,禁用斜体、描边、阴影等冗余样式,无多重样式叠加(如加粗+下划线)。
3.7.3 保险条款专属特征
- 字体属性与文本功能一一对应,LLM可通过“字体+样式”快速判定文本作用(如“宋体+加粗”=标题/关键信息);
- 核心术语(如“现金价值”“免赔额”)均用“加粗”样式,与普通正文形成明确区分,便于提取;
- 无属性冗余,所有字体属性均为“功能必需”(如标题加粗是为了区分层级),无装饰性属性。
3.7.4 处理方式
- 字体类型: Markdown中无需手动修改字体,仅识别并标注核心类型(中文宋体/仿宋、英文Times New Roman),支撑LLM统一解析;
- 字号: 按“标题>正文>附注”的功能逻辑识别,无需额外标注具体数值,仅保证同功能文本字号一致;
-
样式:
- 加粗: 保留
**格式,用于标题、关键术语、核心规则; - 下划线: 利益条款引用保留
~~(波浪线),超链接保留[文本](url)格式; - 冗余样式(如描边、阴影): 忽略视觉效果,仅保留文本核心内容。
- 加粗: 保留
4 特殊元素处理
4.1 超链接
- 识别规则: 文本或图片中包含URL(如
https: //www.xxx.com),或可点击的书签(如目录中的章节链接)。 - 格式特征:
[点击这里](https: //www.xxx.com)(Markdown示例,对应PDF中的超链接文本,通常为蓝色下划线)。
4.2 注释与批注
4.2.1 识别规则
- 保险条款中的注释与批注是非核心补充说明,仅用于解释术语、补充特殊约定或标注例外情况,不构成保险规则主体,必须依附于某一具体正文内容(如术语、条款、数值)存在,无独立语义。
- 位置特征固定: 注释多位于页面底部(页脚),批注偶见于页边距,均与被解释的正文内容通过“标识符号”(如①、[注1])关联,不嵌入正文中间。
- 内容无争议性: 仅对正文信息做补充,不修改、不否定核心规则,跨页时会因页面分割导致“正文在第N页,注释在第N页页脚,第N+1页正文直接延续”的语义割裂场景。
- 标识格式统一: 同一条款内注释/批注的标识符号一致(如全用①②③或注1),无混合混用,且标识与正文内容一一对应(一个标识对应一条注释)。
4.2.2 格式特征
- 字号: 比正文小1-2pt(8-9pt),视觉优先级低于正文,不干扰核心规则阅读;
- 字体: 与正文一致(宋体+Times New Roman),无特殊字体,部分注释会用斜体区分,但保险条款中极少出现;
- 对齐: 页脚注释左对齐,页边批注竖排/左对齐,无居中/右对齐;
- 间距: 页脚注释之间用半角空格或分号分隔,与正文底部保留1-2行空白距离,不与正文紧密衔接;
- 标识: 前缀为“标识符号+中文冒号”(如①: 、[注1]: ),标识符号与正文被解释处的符号完全一致;
- 跨页特征: 当被解释的正文内容位于页面底部时,注释会留在当前页页脚,下一页正文直接延续被解释内容的逻辑,导致语义割裂(如第1页正文“二级以上公立医院[注1]”,[注1]在第1页页脚,第2页正文直接讲“不含特需部”,未衔接注释内容)。
4.2.3 保险条款专属特征
-
注释类型单一: 仅两类核心用途,无无关内容:
- 术语解释型: 解释正文中未列入“释义附录”的临时术语(如[注1]: 二级以上公立医院指具备二级及以上资质的综合医院或专科医院);
- 特殊约定型: 补充条款的例外情况或执行细节(如[注2]: 本约定不适用于趸交保费保单);
-
无主观批注: 保险条款为格式化法律文本,无个人手写批注、审核意见等主观内容,所有批注均为印刷体固定补充说明;
- 与正文强绑定: 注释/批注的语义完全依赖被解释的正文,脱离正文则无独立意义(如仅看“不含特需部”无法判断是解释“公立医院”)。
4.2.4 处理方式(核心解决跨页语义割裂)
核心原则: 剥离页脚位置,将注释/批注与被解释正文“强绑定呈现”,不打断上下文逻辑
-
标识锚点统一:
- 将原页脚注释的标识符号(如①、★)统一替换为“[注X]”(X为阿拉伯数字,按出现顺序递增),并嵌入被解释的正文对应位置(如“二级以上公立医院[注1]”),保持标识与正文的视觉关联;
- 批注若有独立标识,按同样规则统一为“[批X]”,无标识则按出现顺序补编标识。
-
语义绑定呈现:
- 非跨页场景: 注释/批注内容紧跟被解释的正文内容之后,用括号标注“([注X]: XXX)”,不单独拆分(如“二级以上公立医院[注1]([注1]: 指具备二级及以上资质的综合医院或专科医院,不含特需部)”);
- 跨页场景: 将原页脚的注释/批注内容,移至被解释正文所在的“段落末尾”或“条款末尾”,用“[注X]: XXX”单独成行,与正文之间保留半角空格,确保语义连贯(如第1页正文“二级以上公立医院[注1]”,第1页段落末尾补充“[注1]: 指具备二级及以上资质的综合医院或专科医院,不含特需部”,第2页正文直接延续逻辑)。
-
集中归类备份:
- 若注释/批注数量较多(超过5条),可在章节末尾(如“第四条 保险责任”结束后)新增“注释汇总”模块,按标识顺序列出所有注释/批注,方便查阅;
- 原页脚的注释/批注内容删除,避免重复呈现,仅保留正文内的标识锚点和关联呈现的内容。
-
格式简化统一:
- 注释/批注内容按正文格式排版(左对齐、常规字体、8-9pt字号),无需斜体/加粗,仅通过“[注X]: ”前缀区分;
- 多条注释/批注之间用空行分隔,避免杂乱堆砌。
4.2.5 示例(解决跨页语义割裂)
原跨页场景(问题):
| 第1页正文 | 第1页页脚 | 第2页正文 |
|---|---|---|
| 被保险人因意外伤害在二级以上公立医院[注1]普通部接受门(急)诊治疗的,对于实际发生的医疗费用,扣除免赔额后按约定给付保险金。 | [注1]: 指具备二级及以上资质的综合医院或专科医院,不含特需部、国际部、VIP部。 | 不含特需部、国际部、VIP部的医疗费用均不在保障范围内,包括但不限于特需门诊挂号费、国际部住院床位费等。 |
处理后(语义连贯):
第1页正文
被保险人因意外伤害在二级以上公立医院[注1]普通部接受门(急)诊治疗的,对于实际发生的医疗费用,扣除免赔额后按约定给付保险金。 [注1]: 指具备二级及以上资质的综合医院或专科医院,不含特需部、国际部、VIP部。
第2页正文
不含特需部、国际部、VIP部的医疗费用均不在保障范围内,包括但不限于特需门诊挂号费、国际部住院床位费等。
4.3 页眉与页脚
4.3.1 页眉
识别规则:
- 位置特征: 位于每页顶部,通常在上边框附近,连续多页重复出现相同或相似内容
- 内容特征:
- 公司名称或简称(如“中国人寿保险股份有限公司”、“中国平安人寿保险股份有限公司”)
- 产品名称(如“国寿爱意康悦医疗保险(尊享版)条款”、“平安创御享金越(2026)终身寿险(分红型)”)
- 条款标识(如“利益条款”、“短期保险基本条款”、“阅读指引”)
- 格式特征:
- 字体通常较小(如8-10pt)
- 可能居中、居左或居右排列
- 有时包含分隔线或装饰元素
- 在文档不同部分可能变化(如利益条款、基本条款分开)
- 页码关系: 可能在页眉中包含页码信息,或与页脚页码配合使用
示例:
中国人寿保险股份有限公司 国寿爱意康悦医疗保险(尊享版)利益条款
中国平安 PINGAN专业·价值
处理方式:
- 首次出现: 可提取为文档元数据,但不作为正文内容
- 重复出现: 识别后过滤,避免冗余
- 变化内容: 记录变化模式,用于文档结构分段标识
- 特殊标识: 如“阅读指引”、“利益条款”等,可用于标注当前页面所属模块
建模适配要求:
- 提取页眉中的
公司名称、产品名称、条款类型字段 - 标注页眉变化点,用于识别文档内部结构边界
- 对于包含页码的页眉,建立“页眉内容-页码范围”映射表
4.3.2 页脚
识别规则:
- 位置特征: 位于每页底部,通常在下边框附近
- 内容特征:
- 页码信息: 最常见,如“第1页”、“- 1 -”、“1/28”等形式
- 版权声明: 如“© 2025 中国人寿版权所有”
- 文件标识: 如“文件编号”、“版本号”
- 联系方式: 如公司网址、客服电话
- 风险提示: 如“本条款仅供参考,具体以保险合同为准”
- 格式特征:
- 字体通常最小(如7-9pt)
- 居中排列最常见
- 可能包含简单分隔线
- 页码格式:
- 阿拉伯数字:
1、2、3 - 带修饰符:
第1页、Page 1、- 1 - - 总分格式:
1/30、第1页/共30页 - 罗马数字: 在附录或特定部分可能使用
- 阿拉伯数字:
示例:
第1页
- 5 -
3/28
© 2025 中国人寿保险股份有限公司 版权所有
http: //www.e-chinalife.com
处理方式:
- 页码信息: 提取并建立文档的“页码-内容”索引,便于后续定位和引用
- 重复性页脚: 识别模式后过滤,保留首次出现作为文档元数据
- 变化页脚: 记录变化,可能对应文档不同部分
- 重要信息: 如版权声明、网址等,提取为文档元数据字段
建模适配要求:
- 解析页码格式,建立统一的正则表达式识别规则
- 提取页脚中的
页码、总页数、版权信息、网址等结构化字段 - 对于特殊页码格式(如罗马数字),建立转换规则
- 标注页脚变化点,辅助文档结构分析
4.3.3 特殊情况的页眉页脚
识别规则:
- 首页特殊格式: 首页可能无页眉页脚,或有不同的设计
- 章节起始页: 新章节可能从奇数页开始,页眉页脚可能有变化
- 附录部分: 可能有独立的页眉页脚样式
- 空白页: 可能有页眉页脚但无正文内容
- 跨页表格/图表: 页眉页脚可能被暂时隐藏
处理方式:
- 识别首页特殊性,区分封面页和内页
- 记录章节起始的页眉页脚变化,辅助章节划分
- 对于空白页,标记为“仅含页眉页脚”页面
- 处理跨页元素时,保持页眉页脚识别的连续性
4.3.4 提取与标记规则
在Markdown中的表示:
正文内容从这里开始...
更多正文内容...
提取策略:
- 位置阈值法: 根据Y坐标判断(顶部5%-15%为页眉,底部85%-95%为页脚)
- 内容重复法: 识别跨页重复出现的文本块
- 格式特征法: 根据字体大小、样式、对齐方式判断
- 页码模式法: 识别页码特有格式(数字、Page、第X页等)
数据建模字段:
页眉:
- 公司名称: string
- 产品名称: string
- 条款类型: string
- 变化标识: string
- 起始页码: number
- 结束页码: number
页脚:
- 页码格式: string
- 当前页码: number
- 总页数: number
- 版权信息: string
- 联系方式: string
- 其他信息: string