README_zh-CN.md 34.8 KB
Newer Older
xuchao's avatar
xuchao committed
1
2
<div align="center" xmlns="http://www.w3.org/1999/html">
<!-- logo -->
徐超's avatar
徐超 committed
3
<p align="center">
4
  <img src="docs/images/MinerU-logo.png" width="300px" style="vertical-align:middle;">
徐超's avatar
徐超 committed
5
</p>
赵小蒙's avatar
赵小蒙 committed
6

xuchao's avatar
xuchao committed
7
<!-- icon -->
8

赵小蒙's avatar
赵小蒙 committed
9
10
11
[![stars](https://img.shields.io/github/stars/opendatalab/MinerU.svg)](https://github.com/opendatalab/MinerU)
[![forks](https://img.shields.io/github/forks/opendatalab/MinerU.svg)](https://github.com/opendatalab/MinerU)
[![open issues](https://img.shields.io/github/issues-raw/opendatalab/MinerU)](https://github.com/opendatalab/MinerU/issues)
myhloli's avatar
myhloli committed
12
13
14
15
[![issue resolution](https://img.shields.io/github/issues-closed-raw/opendatalab/MinerU)](https://github.com/opendatalab/MinerU/issues)
[![PyPI version](https://badge.fury.io/py/magic-pdf.svg)](https://badge.fury.io/py/magic-pdf)
[![Downloads](https://static.pepy.tech/badge/magic-pdf)](https://pepy.tech/project/magic-pdf)
[![Downloads](https://static.pepy.tech/badge/magic-pdf/month)](https://pepy.tech/project/magic-pdf)
16

Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
17
[![OpenDataLab](https://img.shields.io/badge/Demo_on_OpenDataLab-blue?logo=&labelColor=white)](https://opendatalab.com/OpenSourceTools/Extractor/PDF)
Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
18
19
[![ModelScope](https://img.shields.io/badge/Demo_on_ModelScope-purple?logo=&labelColor=white)](https://www.modelscope.cn/studios/OpenDataLab/MinerU)
[![HuggingFace](https://img.shields.io/badge/Demo_on_HuggingFace-yellow.svg?logo=&labelColor=white)](https://huggingface.co/spaces/opendatalab/MinerU)
myhloli's avatar
myhloli committed
20
[![Colab](https://colab.research.google.com/assets/colab-badge.svg)](https://colab.research.google.com/gist/myhloli/3b3a00a4a0a61577b6c30f989092d20d/mineru_demo.ipynb)
sfk's avatar
sfk committed
21
[![Paper](https://img.shields.io/badge/Paper-arXiv-green)](https://arxiv.org/pdf/2409.18839?)
22

myhloli's avatar
myhloli committed
23
<a href="https://trendshift.io/repositories/11174" target="_blank"><img src="https://trendshift.io/api/badge/repositories/11174" alt="opendatalab%2FMinerU | Trendshift" style="width: 250px; height: 55px;" width="250" height="55"/></a>
赵小蒙's avatar
赵小蒙 committed
24

xuchao's avatar
xuchao committed
25
<!-- language -->
赵小蒙's avatar
赵小蒙 committed
26

27
[English](README.md) | [简体中文](README_zh-CN.md)
赵小蒙's avatar
赵小蒙 committed
28

xuchao's avatar
xuchao committed
29
<!-- hot link -->
30

徐超's avatar
徐超 committed
31
32
33
34
<p align="center">
<a href="https://github.com/opendatalab/PDF-Extract-Kit">PDF-Extract-Kit: 高质量PDF解析工具箱</a>🔥🔥🔥
</p>

xuchao's avatar
xuchao committed
35
<!-- join us -->
36

徐超's avatar
徐超 committed
37
<p align="center">
xuchao's avatar
xuchao committed
38
    👋 join us on <a href="https://discord.gg/Tdedn9GTXq" target="_blank">Discord</a> and <a href="https://cdn.vansin.top/internlm/mineru.jpg" target="_blank">WeChat</a>
徐超's avatar
徐超 committed
39
</p>
赵小蒙's avatar
赵小蒙 committed
40

xuchao's avatar
xuchao committed
41
</div>
赵小蒙's avatar
赵小蒙 committed
42

xuchao's avatar
xuchao committed
43
# 更新记录
44
45
46
47
48

- 2024/10/31 0.9.0发布,这是我们进行了大量代码重构的全新版本,解决了众多问题,提升了性能,降低了硬件需求,并提供了更丰富的易用性:
  - 重构排序模块代码,使用 [layoutreader](https://github.com/ppaanngggg/layoutreader) 进行阅读顺序排序,确保在各种排版下都能实现极高准确率
  - 重构段落拼接模块,在跨栏、跨页、跨图、跨表情况下均能实现良好的段落拼接效果
  - 重构列表和目录识别功能,极大提升列表块和目录块识别的准确率及对应文本段落的解析效果
49
  - 重构图、表与描述性文本的匹配逻辑,大幅提升 caption 和 footnote 与图表的匹配准确率,并将描述性文本的丢失率降至接近0
50
51
52
53
54
55
  - 增加 OCR 的多语言支持,支持 84 种语言的检测与识别,语言支持列表详见 [OCR 语言支持列表](https://paddlepaddle.github.io/PaddleOCR/latest/ppocr/blog/multi_languages.html#5)
  - 增加显存回收逻辑及其他显存优化措施,大幅降低显存使用需求。开启除表格加速外的全部加速功能(layout/公式/OCR)的显存需求从16GB降至8GB,开启全部加速功能的显存需求从24GB降至10GB
  - 优化配置文件的功能开关,增加独立的公式检测开关,无需公式检测时可大幅提升速度和解析效果
  - 集成 [PDF-Extract-Kit 1.0](https://github.com/opendatalab/PDF-Extract-Kit)
    - 加入自研的 `doclayout_yolo` 模型,在相近解析效果情况下比原方案提速10倍以上,可通过配置文件与 `layoutlmv3` 自由切换
    - 公式解析升级至 `unimernet 0.2.1`,在提升公式解析准确率的同时,大幅降低显存需求
56
    -`PDF-Extract-Kit 1.0` 更换仓库,需要重新下载模型,步骤详见 [如何下载模型](docs/how_to_download_models_zh_cn.md)
sfk's avatar
sfk committed
57
- 2024/09/27 0.8.1发布,修复了一些bug,同时提供了[在线demo](https://opendatalab.com/OpenSourceTools/Extractor/PDF/)[本地化部署版本](projects/web_demo/README_zh-CN.md)[前端界面](projects/web/README_zh-CN.md)
drunkpig's avatar
drunkpig committed
58
- 2024/09/09 0.8.0发布,支持Dockerfile快速部署,同时上线了huggingface、modelscope demo
59
- 2024/08/30 0.7.1发布,集成了paddle tablemaster表格识别功能
xuchao's avatar
xuchao committed
60
61
62
63
64
- 2024/08/09 0.7.0b1发布,简化安装步骤提升易用性,加入表格识别功能
- 2024/08/01 0.6.2b1发布,优化了依赖冲突问题和安装文档
- 2024/07/05 首次开源

<!-- TABLE OF CONTENT -->
65

xuchao's avatar
xuchao committed
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
<details open="open">
  <summary><h2 style="display: inline-block">文档目录</h2></summary>
  <ol>
    <li>
      <a href="#mineru">MinerU</a>
      <ul>
        <li><a href="#项目简介">项目简介</a></li>
        <li><a href="#主要功能">主要功能</a></li>
        <li><a href="#快速开始">快速开始</a>
            <ul>
            <li><a href="#在线体验">在线体验</a></li>
            <li><a href="#使用CPU快速体验">使用CPU快速体验</a></li>
            <li><a href="#使用GPU">使用GPU</a></li>
            </ul>
        </li>
        <li><a href="#使用">使用方式</a>
            <ul>
            <li><a href="#命令行">命令行</a></li>
            <li><a href="#api">API</a></li>
85
            <li><a href="#部署衍生项目">部署衍生项目</a></li>
xuchao's avatar
xuchao committed
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
            <li><a href="#二次开发">二次开发</a></li>
            </ul>
        </li>
      </ul>
    </li>
    <li><a href="#todo">TODO</a></li>
    <li><a href="#known-issues">Known Issues</a></li>
    <li><a href="#faq">FAQ</a></li>
    <li><a href="#all-thanks-to-our-contributors">Contributors</a></li>
    <li><a href="#license-information">License Information</a></li>
    <li><a href="#acknowledgments">Acknowledgements</a></li>
    <li><a href="#citation">Citation</a></li>
    <li><a href="#star-history">Star History</a></li>
    <li><a href="#magic-doc">magic-doc快速提取PPT/DOC/PDF</a></li>
    <li><a href="#magic-html">magic-html提取混合网页内容</a></li>
    <li><a href="#links">Links</a></li>
  </ol>
</details>

# MinerU
106

xuchao's avatar
xuchao committed
107
## 项目简介
108

xuchao's avatar
xuchao committed
109
110
111
MinerU是一款将PDF转化为机器可读格式的工具(如markdown、json),可以很方便地抽取为任意格式。
MinerU诞生于[书生-浦语](https://github.com/InternLM/InternLM)的预训练过程中,我们将会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。
相比国内外知名商用产品MinerU还很年轻,如果遇到问题或者结果不及预期请到[issue](https://github.com/opendatalab/MinerU/issues)提交问题,同时**附上相关PDF**
myhloli's avatar
myhloli committed
112

Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
113
https://github.com/user-attachments/assets/4bea02c9-6d54-4cd6-97ed-dff14340982c
myhloli's avatar
myhloli committed
114

xuchao's avatar
xuchao committed
115
## 主要功能
myhloli's avatar
myhloli committed
116

117
118
- 删除页眉、页脚、脚注、页码等元素,确保语义连贯
- 输出符合人类阅读顺序的文本,适用于单栏、多栏及复杂排版
xuchao's avatar
xuchao committed
119
- 保留原文档的结构,包括标题、段落、列表等
120
121
122
123
124
125
126
- 提取图像、图片描述、表格、表格标题及脚注
- 自动识别并转换文档中的公式为LaTeX格式
- 自动识别并转换文档中的表格为LaTeX或HTML格式
- 自动检测扫描版PDF和乱码PDF,并启用OCR功能
- OCR支持84种语言的检测与识别
- 支持多种输出格式,如多模态与NLP的Markdown、按阅读顺序排序的JSON、含有丰富信息的中间格式等
- 支持多种可视化结果,包括layout可视化、span可视化等,便于高效确认输出效果与质检
xuchao's avatar
xuchao committed
127
- 支持CPU和GPU环境
128
- 兼容Windows、Linux和Mac平台
赵小蒙's avatar
update:  
赵小蒙 committed
129

xuchao's avatar
xuchao committed
130
131
132
133
134
## 快速开始

如果遇到任何安装问题,请先查询 <a href="#faq">FAQ</a> </br>
如果遇到解析效果不及预期,参考 <a href="#known-issues">Known Issues</a></br>
有3种不同方式可以体验MinerU的效果:
135

xuchao's avatar
xuchao committed
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
- [在线体验(无需任何安装)](#在线体验)
- [使用CPU快速体验(Windows,Linux,Mac)](#使用cpu快速体验)
- [Linux/Windows + CUDA](#使用gpu)

**⚠️安装前必看——软硬件环境支持说明**

为了确保项目的稳定性和可靠性,我们在开发过程中仅对特定的软硬件环境进行优化和测试。这样当用户在推荐的系统配置上部署和运行项目时,能够获得最佳的性能表现和最少的兼容性问题。

通过集中资源和精力于主线环境,我们团队能够更高效地解决潜在的BUG,及时开发新功能。

在非主线环境中,由于硬件、软件配置的多样性,以及第三方依赖项的兼容性问题,我们无法100%保证项目的完全可用性。因此,对于希望在非推荐环境中使用本项目的用户,我们建议先仔细阅读文档以及FAQ,大多数问题已经在FAQ中有对应的解决方案,除此之外我们鼓励社区反馈问题,以便我们能够逐步扩大支持范围。

<table>
    <tr>
        <td colspan="3" rowspan="2">操作系统</td>
    </tr>
    <tr>
        <td>Ubuntu 22.04 LTS</td>
        <td>Windows 10 / 11</td>
        <td>macOS 11+</td>
    </tr>
    <tr>
        <td colspan="3">CPU</td>
159
160
        <td>x86_64(暂不支持ARM Linux)</td>
        <td>x86_64(暂不支持ARM Windows)</td>
xuchao's avatar
xuchao committed
161
162
163
164
165
166
167
168
        <td>x86_64 / arm64</td>
    </tr>
    <tr>
        <td colspan="3">内存</td>
        <td colspan="3">大于等于16GB,推荐32G以上</td>
    </tr>
    <tr>
        <td colspan="3">python版本</td>
169
        <td colspan="3">3.10 (请务必通过conda创建3.10虚拟环境)</td>
xuchao's avatar
xuchao committed
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
    </tr>
    <tr>
        <td colspan="3">Nvidia Driver 版本</td>
        <td>latest(专有驱动)</td>
        <td>latest</td>
        <td>None</td>
    </tr>
    <tr>
        <td colspan="3">CUDA环境</td>
        <td>自动安装[12.1(pytorch)+11.8(paddle)]</td>
        <td>11.8(手动安装)+cuDNN v8.7.0(手动安装)</td>
        <td>None</td>
    </tr>
    <tr>
        <td rowspan="2">GPU硬件支持列表</td>
        <td colspan="2">最低要求 8G+显存</td>
186
        <td colspan="2">3060ti/3070/4060<br>
187
        8G显存可开启layout、公式识别和ocr加速</td>
xuchao's avatar
xuchao committed
188
189
190
        <td rowspan="2">None</td>
    </tr>
    <tr>
191
192
193
        <td colspan="2">推荐配置 10G+显存</td>
        <td colspan="2">3080/3080ti/3090/3090ti/4070/4070ti/4070tisuper/4080/4090<br>
        10G显存及以上可以同时开启layout、公式识别和ocr加速和表格识别加速<br>
sfk's avatar
sfk committed
194
        </td>
xuchao's avatar
xuchao committed
195
196
197
198
    </tr>
</table>

### 在线体验
199
稳定版(经过QA验证的稳定版本):
xuchao's avatar
xuchao committed
200

Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
201
[![OpenDataLab](https://img.shields.io/badge/Demo_on_OpenDataLab-blue?logo=&labelColor=white)](https://opendatalab.com/OpenSourceTools/Extractor/PDF)
202
203
204

测试版(同步dev分支更新,测试新特性):

Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
205
[![HuggingFace](https://img.shields.io/badge/Demo_on_HuggingFace-yellow.svg?logo=&labelColor=white)](https://huggingface.co/spaces/opendatalab/MinerU)
206
[![ModelScope](https://img.shields.io/badge/Demo_on_ModelScope-purple?logo=&labelColor=white)](https://www.modelscope.cn/studios/OpenDataLab/MinerU)
xuchao's avatar
xuchao committed
207
208
209
210

### 使用CPU快速体验

#### 1. 安装magic-pdf
211

xuchao's avatar
xuchao committed
212
最新版本国内镜像源同步可能会有延迟,请耐心等待
213

214
215
216
```bash
conda create -n MinerU python=3.10
conda activate MinerU
217
pip install -U magic-pdf[full] --extra-index-url https://wheels.myhloli.com -i https://mirrors.aliyun.com/pypi/simple
218
```
219

220
#### 2. 下载模型权重文件
赵小蒙's avatar
赵小蒙 committed
221

xuchao's avatar
xuchao committed
222
详细参考 [如何下载模型文件](docs/how_to_download_models_zh_cn.md)
223

224
#### 3. 修改配置文件以进行额外配置
225

226
227
完成[2. 下载模型权重文件](#2-下载模型权重文件)步骤后,脚本会自动生成用户目录下的magic-pdf.json文件,并自动配置默认模型路径。
您可在【用户目录】下找到magic-pdf.json文件。
228
229
> windows的用户目录为 "C:\\Users\\用户名", linux用户目录为 "/home/用户名", macOS用户目录为 "/Users/用户名"

230
您可修改该文件中的部分配置实现功能的开关,如表格识别功能:
231

232
>如json内没有如下项目,请手动添加需要的项目,并删除注释内容(标准json不支持注释)
233

234
235
```json
{
236
237
238
239
240
241
242
243
244
245
246
247
    // other config
    "layout-config": {
        "model": "layoutlmv3" // 使用doclayout_yolo请修改为“doclayout_yolo"
    },
    "formula-config": {
        "mfd_model": "yolo_v8_mfd",
        "mfr_model": "unimernet_small",
        "enable": true  // 公式识别功能默认是开启的,如果需要关闭请修改此处的值为"false"
    },
    "table-config": {
        "model": "tablemaster",  // 使用structEqTable请修改为"struct_eqtable"
        "enable": false, // 表格识别功能默认是关闭的,如果需要开启请修改此处的值为"true"
xuchao's avatar
xuchao committed
248
249
        "max_time": 400
    }
250
251
252
}
```

xuchao's avatar
xuchao committed
253
### 使用GPU
254

xuchao's avatar
xuchao committed
255
如果您的设备支持CUDA,且满足主线环境中的显卡要求,则可以使用GPU加速,请根据自己的系统选择适合的教程:
256

xuchao's avatar
xuchao committed
257
258
- [Ubuntu22.04LTS + GPU](docs/README_Ubuntu_CUDA_Acceleration_zh_CN.md)
- [Windows10/11 + GPU](docs/README_Windows_CUDA_Acceleration_zh_CN.md)
259
260
- 使用Docker快速部署
    > Docker 需设备gpu显存大于等于16GB,默认开启所有加速功能
261
262
263
264
265
266
    > 
    > 运行本docker前可以通过以下命令检测自己的设备是否支持在docker上使用CUDA加速
    > 
    > ```bash
    > docker run --rm --gpus=all nvidia/cuda:12.1.0-base-ubuntu22.04 nvidia-smi
    > ```
267
268
  ```bash
  wget https://github.com/opendatalab/MinerU/raw/master/Dockerfile
269
270
  docker build -t mineru:latest .
  docker run --rm -it --gpus=all mineru:latest /bin/bash
271
272
273
  magic-pdf --help
  ```
    
274

xuchao's avatar
xuchao committed
275
## 使用
276

xuchao's avatar
xuchao committed
277
### 命令行
278
279

```bash
xuchao's avatar
xuchao committed
280
281
282
283
284
285
magic-pdf --help
Usage: magic-pdf [OPTIONS]

Options:
  -v, --version                display the version and exit
  -p, --path PATH              local pdf filepath or directory  [required]
Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
286
287
288
289
290
291
292
293
294
295
296
  -o, --output-dir PATH        output local directory  [required]
  -m, --method [ocr|txt|auto]  the method for parsing pdf. ocr: using ocr
                               technique to extract information from pdf. txt:
                               suitable for the text-based pdf only and
                               outperform ocr. auto: automatically choose the
                               best method for parsing pdf from ocr and txt.
                               without method specified, auto will be used by
                               default.
  -l, --lang TEXT              Input the languages in the pdf (if known) to
                               improve OCR accuracy.  Optional. You should
                               input "Abbreviation" with language form url: ht
297
298
                               tps://paddlepaddle.github.io/PaddleOCR/latest/en
                               /ppocr/blog/multi_languages.html#5-support-languages-
Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
299
300
301
302
303
304
305
                               and-abbreviations
  -d, --debug BOOLEAN          Enables detailed debugging information during
                               the execution of the CLI commands.
  -s, --start INTEGER          The starting page for PDF parsing, beginning
                               from 0.
  -e, --end INTEGER            The ending page for PDF parsing, beginning from
                               0.
xuchao's avatar
xuchao committed
306
307
308
309
310
311
312
313
  --help                       Show this message and exit.


## show version
magic-pdf -v

## command line example
magic-pdf -p {some_pdf} -o {some_output_dir} -m auto
314
315
```

xuchao's avatar
xuchao committed
316
317
318
319
其中 `{some_pdf}` 可以是单个pdf文件,也可以是一个包含多个pdf文件的目录。
运行完命令后输出的结果会保存在`{some_output_dir}`目录下, 输出的文件列表如下

```text
320
321
├── some_pdf.md                          # markdown 文件
├── images                               # 存放图片目录
322
├── some_pdf_layout.pdf                  # layout 绘图 (包含layout阅读顺序)
323
324
325
├── some_pdf_middle.json                 # minerU 中间处理结果
├── some_pdf_model.json                  # 模型推理结果
├── some_pdf_origin.pdf                  # 原 pdf 文件
326
327
├── some_pdf_spans.pdf                   # 最小粒度的bbox位置信息绘图
└── some_pdf_content_list.json           # 按阅读顺序排列的富文本json
328
329
```

xuchao's avatar
xuchao committed
330
更多有关输出文件的信息,请参考[输出文件说明](docs/output_file_zh_cn.md)
331

xuchao's avatar
xuchao committed
332
333
334
### API

处理本地磁盘上的文件
335

赵小蒙's avatar
赵小蒙 committed
336
337
338
```python
image_writer = DiskReaderWriter(local_image_dir)
image_dir = str(os.path.basename(local_image_dir))
xuchao's avatar
xuchao committed
339
jso_useful_key = {"_pdf_type": "", "model_list": []}
赵小蒙's avatar
赵小蒙 committed
340
341
pipe = UNIPipe(pdf_bytes, jso_useful_key, image_writer)
pipe.pipe_classify()
xuchao's avatar
xuchao committed
342
pipe.pipe_analyze()
赵小蒙's avatar
赵小蒙 committed
343
344
345
346
pipe.pipe_parse()
md_content = pipe.pipe_mk_markdown(image_dir, drop_mode="none")
```

xuchao's avatar
xuchao committed
347
处理对象存储上的文件
348

赵小蒙's avatar
赵小蒙 committed
349
350
351
352
353
```python
s3pdf_cli = S3ReaderWriter(pdf_ak, pdf_sk, pdf_endpoint)
image_dir = "s3://img_bucket/"
s3image_cli = S3ReaderWriter(img_ak, img_sk, img_endpoint, parent_path=image_dir)
pdf_bytes = s3pdf_cli.read(s3_pdf_path, mode=s3pdf_cli.MODE_BIN)
xuchao's avatar
xuchao committed
354
jso_useful_key = {"_pdf_type": "", "model_list": []}
赵小蒙's avatar
赵小蒙 committed
355
356
pipe = UNIPipe(pdf_bytes, jso_useful_key, s3image_cli)
pipe.pipe_classify()
xuchao's avatar
xuchao committed
357
pipe.pipe_analyze()
赵小蒙's avatar
赵小蒙 committed
358
359
360
361
pipe.pipe_parse()
md_content = pipe.pipe_mk_markdown(image_dir, drop_mode="none")
```

362
363
详细实现可参考

xuchao's avatar
xuchao committed
364
365
- [demo.py 最简单的处理方式](demo/demo.py)
- [magic_pdf_parse_main.py 能够更清晰看到处理流程](demo/magic_pdf_parse_main.py)
myhloli's avatar
myhloli committed
366

367
368
369
370
371
372
373
374
### 部署衍生项目

衍生项目包含项目开发者和社群开发者们基于MinerU的二次开发项目,
例如基于Gradio的应用界面、基于llama的RAG、官网同款web demo、轻量级的多卡负载均衡c/s端等,
这些项目可能会提供更多的功能和更好的用户体验。
具体部署方式请参考 [衍生项目readme](projects/README_zh-CN.md)


xuchao's avatar
xuchao committed
375
### 二次开发
376

xuchao's avatar
xuchao committed
377
TODO
378

xuchao's avatar
xuchao committed
379
# TODO
赵小蒙's avatar
赵小蒙 committed
380

381
382
383
384
- 🗹 基于模型的阅读顺序  
- 🗹 正文中目录、列表识别  
- 🗹 表格识别
- ☐  正文中代码块识别
385
-[化学式识别](docs/chemical_knowledge_introduction/introduction.pdf)
386
- ☐  几何图形识别
赵小蒙's avatar
赵小蒙 committed
387

xuchao's avatar
xuchao committed
388
# Known Issues
389

390
- 阅读顺序基于模型对可阅读内容在空间中的分布进行排序,在极端复杂的排版下可能会部分区域乱序
xuchao's avatar
xuchao committed
391
- 不支持竖排文字
392
393
394
- 目录和列表通过规则进行识别,少部分不常见的列表形式可能无法识别
- 标题只有一级,目前不支持标题分级
- 代码块在layout模型里还没有支持
xuchao's avatar
xuchao committed
395
- 漫画书、艺术图册、小学教材、习题尚不能很好解析
396
397
398
- 表格识别在复杂表格上可能会出现行/列识别错误
- 在小语种PDF上,OCR识别可能会出现字符不准确的情况(如拉丁文的重音符号、阿拉伯文易混淆字符等)
- 部分公式可能会无法在markdown中渲染
399

drunkpig's avatar
drunkpig committed
400
# FAQ
401

xuchao's avatar
xuchao committed
402
[常见问题](docs/FAQ_zh_cn.md)
赵小蒙's avatar
赵小蒙 committed
403

404

405
[FAQ](docs/FAQ_en_us.md)
myhloli's avatar
myhloli committed
406

xuchao's avatar
xuchao committed
407
# All Thanks To Our Contributors
赵小蒙's avatar
赵小蒙 committed
408

409
<a href="https://github.com/opendatalab/MinerU/graphs/contributors">
赵小蒙's avatar
赵小蒙 committed
410
411
412
  <img src="https://contrib.rocks/image?repo=opendatalab/MinerU" />
</a>

xuchao's avatar
xuchao committed
413
# License Information
赵小蒙's avatar
赵小蒙 committed
414
415
416
417
418

[LICENSE.md](LICENSE.md)

本项目目前采用PyMuPDF以实现高级功能,但因其遵循AGPL协议,可能对某些使用场景构成限制。未来版本迭代中,我们计划探索并替换为许可条款更为宽松的PDF处理库,以提升用户友好度及灵活性。

xuchao's avatar
xuchao committed
419
# Acknowledgments
420

xuchao's avatar
xuchao committed
421
422
- [PDF-Extract-Kit](https://github.com/opendatalab/PDF-Extract-Kit)
- [StructEqTable](https://github.com/UniModal4Reasoning/StructEqTable-Deploy)
赵小蒙's avatar
赵小蒙 committed
423
424
- [PaddleOCR](https://github.com/PaddlePaddle/PaddleOCR)
- [PyMuPDF](https://github.com/pymupdf/PyMuPDF)
425
- [layoutreader](https://github.com/ppaanngggg/layoutreader)
赵小蒙's avatar
赵小蒙 committed
426
427
- [fast-langdetect](https://github.com/LlmKira/fast-langdetect)
- [pdfminer.six](https://github.com/pdfminer/pdfminer.six)
赵小蒙's avatar
赵小蒙 committed
428

xuchao's avatar
xuchao committed
429
# Citation
赵小蒙's avatar
赵小蒙 committed
430
431

```bibtex
432
433
434
435
436
437
438
439
440
441
@misc{wang2024mineruopensourcesolutionprecise,
      title={MinerU: An Open-Source Solution for Precise Document Content Extraction}, 
      author={Bin Wang and Chao Xu and Xiaomeng Zhao and Linke Ouyang and Fan Wu and Zhiyuan Zhao and Rui Xu and Kaiwen Liu and Yuan Qu and Fukai Shang and Bo Zhang and Liqun Wei and Zhihao Sui and Wei Li and Botian Shi and Yu Qiao and Dahua Lin and Conghui He},
      year={2024},
      eprint={2409.18839},
      archivePrefix={arXiv},
      primaryClass={cs.CV},
      url={https://arxiv.org/abs/2409.18839}, 
}

xuchao's avatar
xuchao committed
442
443
444
445
446
447
@article{he2024opendatalab,
  title={Opendatalab: Empowering general artificial intelligence with open datasets},
  author={He, Conghui and Li, Wei and Jin, Zhenjiang and Xu, Chao and Wang, Bin and Lin, Dahua},
  journal={arXiv preprint arXiv:2407.13773},
  year={2024}
}
赵小蒙's avatar
赵小蒙 committed
448
449
450
```

# Star History
赵小蒙's avatar
赵小蒙 committed
451

赵小蒙's avatar
赵小蒙 committed
452
453
454
455
456
457
<a>
 <picture>
   <source media="(prefers-color-scheme: dark)" srcset="https://api.star-history.com/svg?repos=opendatalab/MinerU&type=Date&theme=dark" />
   <source media="(prefers-color-scheme: light)" srcset="https://api.star-history.com/svg?repos=opendatalab/MinerU&type=Date" />
   <img alt="Star History Chart" src="https://api.star-history.com/svg?repos=opendatalab/MinerU&type=Date" />
 </picture>
Xiaomeng Zhao's avatar
Xiaomeng Zhao committed
458
</a>
qiangqiang199's avatar
qiangqiang199 committed
459

xuchao's avatar
xuchao committed
460
# Magic-doc
461

xuchao's avatar
xuchao committed
462
463
464
[Magic-Doc](https://github.com/InternLM/magic-doc) Fast speed ppt/pptx/doc/docx/pdf extraction tool

# Magic-html
465

xuchao's avatar
xuchao committed
466
467
468
469
470
471
472
[Magic-HTML](https://github.com/opendatalab/magic-html) Mixed web page extraction tool

# Links

- [LabelU (A Lightweight Multi-modal Data Annotation Tool)](https://github.com/opendatalab/labelU)
- [LabelLLM (An Open-source LLM Dialogue Annotation Platform)](https://github.com/opendatalab/LabelLLM)
- [PDF-Extract-Kit (A Comprehensive Toolkit for High-Quality PDF Content Extraction)](https://github.com/opendatalab/PDF-Extract-Kit)