跳转至

1. 进入 MinerU 目录

1 目录安排

MinerU 和 具体项目是不同的文件夹

D:\
├── AI_Models\                # <-- 公共模型区
│   └── MinerU\               # 下载好的权重放在这里
│       ├── models\
│       └── ...
│
└── Projects\                 # <-- 你的工作区
    └── ai_as_me\             # 你的主项目
        ├── .venv\            # Python 虚拟环境
        ├── data\             # 数据存放
        │   ├── input\        # 1000份保险PDF
        │   └── output\       # 转出来的 Markdown
        ├── src\              # 你的 Python 源码
        │   ├── main.py
        │   └── processor.py
        └── magic-pdf.json    # 项目专用的配置副本(可选)

2 安装过程

2.1 环境准备 (Prerequisites)

在开始之前,请确保你的 Windows 11 具备以下基础环境:

  • Python 版本:推荐 3.10(这是目前对 AI 库兼容性最稳的版本)。
  • GPU 加速(可选):如果你有 NVIDIA 显卡,请确保已安装 CUDA 11.812.x(使用命令:nvidia-smi)查看。
  • 虚拟环境:为了不污染系统,强烈建议使用 venv

2.2 安装 MinerU

# 1. 进入 MinerU 目录
cd D:\AI_Models\MinerU

# 2. 创建虚拟环境
python -m venv venv
.\venv\Scripts\activate

# 3. 安装 MinerU (包含所有依赖)
pip install -U "mineru[all]" --extra-index-url https://wheels.myhloli.com --trusted-host wheels.myhloli.com --trusted-host pypi.org --trusted-host files.pythonhosted.org

2.3 模型下载与存放

建议使用 huggingface-cli 或从 ModelScope (魔搭) 下载 PDF-Extract-Kit-1.0。: https://modelscope.cn/models/OpenDataLab/PDF-Extract-Kit-1.0/files

使用

modelscope download --model OpenDataLab/

models 文件会在: C:\Users\Administrator.cache\modelscope\hub\models\OpenDataLab\PDF-Extract-Kit-1.0 。需要把 models文件夹剪切到 D:\AI_Models\MinerU 中

3 项目虚拟环境安装支持

在你的项目虚拟环境中安装 magic-pdf

pip install -U "magic-pdf[full]" --extra-index-url https://wheels.myhloli.com -i https://mirrors.aliyun.com/pypi/simple --trusted-host wheels.myhloli.com --trusted-host mirrors.aliyun.com

4 配置文件

复制模型配置文件 将 D:\AI\MinerU\magic-pdf.json 复制到你的项目根目录

{
  "models-dir": "D:/AI/MinerU/models",
  "device-mode": "cuda",
  "model-config": {
    "layout_model": "doclayout_yolo",
    "formula_model": "mfd",
    "table_model": "struct_eqtable",
    "ocr_model": "paddle_ocr"
  },
  "runtime-config": {
    "enable_formula": true,
    "enable_table": true,
    "enable_ocr": true,
    "language": "ch",
    "table_max_row": 100,
    "table_max_col": 30
  }
}

4.1 配置关键说明:

  • models-dir: 这是你之前从 ModelScope 下载并移动到 D 盘的模型路径。请确保该目录下能直接看到 LayoutOCR 等文件夹。
  • device-mode:
    • 如果你有 NVIDIA 显卡并安装了 CUDA,请保持 "cuda"
    • 如果没有显卡,请改为 "cpu"
  • layout_model: 设置为 "doclayout_yolo"。这是在 Windows 上处理中文保险文档效果最稳、兼容性最好的模型。
  • language: 设置为 "ch",确保 OCR 引擎针对中文进行优化,减少保险术语的识别错误。