1. 进入 MinerU 目录
1 目录安排
MinerU 和 具体项目是不同的文件夹
D:\
├── AI_Models\ # <-- 公共模型区
│ └── MinerU\ # 下载好的权重放在这里
│ ├── models\
│ └── ...
│
└── Projects\ # <-- 你的工作区
└── ai_as_me\ # 你的主项目
├── .venv\ # Python 虚拟环境
├── data\ # 数据存放
│ ├── input\ # 1000份保险PDF
│ └── output\ # 转出来的 Markdown
├── src\ # 你的 Python 源码
│ ├── main.py
│ └── processor.py
└── magic-pdf.json # 项目专用的配置副本(可选)
2 安装过程
2.1 环境准备 (Prerequisites)
在开始之前,请确保你的 Windows 11 具备以下基础环境:
- Python 版本:推荐 3.10(这是目前对 AI 库兼容性最稳的版本)。
- GPU 加速(可选):如果你有 NVIDIA 显卡,请确保已安装 CUDA 11.8 或 12.x(使用命令:nvidia-smi)查看。
- 虚拟环境:为了不污染系统,强烈建议使用
venv
2.2 安装 MinerU
# 1. 进入 MinerU 目录
cd D:\AI_Models\MinerU
# 2. 创建虚拟环境
python -m venv venv
.\venv\Scripts\activate
# 3. 安装 MinerU (包含所有依赖)
pip install -U "mineru[all]" --extra-index-url https://wheels.myhloli.com --trusted-host wheels.myhloli.com --trusted-host pypi.org --trusted-host files.pythonhosted.org
2.3 模型下载与存放
建议使用 huggingface-cli 或从 ModelScope (魔搭) 下载 PDF-Extract-Kit-1.0。: https://modelscope.cn/models/OpenDataLab/PDF-Extract-Kit-1.0/files
使用
modelscope download --model OpenDataLab/
models 文件会在: C:\Users\Administrator.cache\modelscope\hub\models\OpenDataLab\PDF-Extract-Kit-1.0 。需要把 models文件夹剪切到 D:\AI_Models\MinerU 中
3 项目虚拟环境安装支持
在你的项目虚拟环境中安装 magic-pdf
pip install -U "magic-pdf[full]" --extra-index-url https://wheels.myhloli.com -i https://mirrors.aliyun.com/pypi/simple --trusted-host wheels.myhloli.com --trusted-host mirrors.aliyun.com
4 配置文件
复制模型配置文件 将 D:\AI\MinerU\magic-pdf.json 复制到你的项目根目录
{
"models-dir": "D:/AI/MinerU/models",
"device-mode": "cuda",
"model-config": {
"layout_model": "doclayout_yolo",
"formula_model": "mfd",
"table_model": "struct_eqtable",
"ocr_model": "paddle_ocr"
},
"runtime-config": {
"enable_formula": true,
"enable_table": true,
"enable_ocr": true,
"language": "ch",
"table_max_row": 100,
"table_max_col": 30
}
}
4.1 配置关键说明:
models-dir: 这是你之前从 ModelScope 下载并移动到 D 盘的模型路径。请确保该目录下能直接看到Layout、OCR等文件夹。device-mode:- 如果你有 NVIDIA 显卡并安装了 CUDA,请保持
"cuda"。 - 如果没有显卡,请改为
"cpu"。
- 如果你有 NVIDIA 显卡并安装了 CUDA,请保持
layout_model: 设置为"doclayout_yolo"。这是在 Windows 上处理中文保险文档效果最稳、兼容性最好的模型。language: 设置为"ch",确保 OCR 引擎针对中文进行优化,减少保险术语的识别错误。