TA的每日心情 | 开心 13 小时前 |
|---|
签到天数: 3152 天 [LV.Master]无
|
试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。, h& Z. {0 S F
处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。4 S6 @ z7 Z" I; x
这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
8 j1 i3 t" v8 ]( Y7 @$ v6 A8 [+ i3 w1 ^; e0 k
https://github.com/oomol-lab/pdf-craft" u$ T3 y0 ^# w1 K- V. ?, q
. {" l! {1 ?! ~% _3 _, ]
1. 这个工具要求装 python3.109 `0 z8 u9 p0 h& \. T( ?1 m
2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
) m. Z, k+ G4 \1 l3. pip install pdf-craft7 f: [' `5 u: C/ D
4. 把下面的内容写到一个文件里,例如 a.py
) N' B, w1 }$ q- v$ j* p ^ [, I3 t6 _# N9 V$ d# P
- from pdf_craft import PDFPageExtractor, MarkDownWriter; v: T) k( D: }# ~& C7 S
$ _. M% x/ Z% x% A- extractor = PDFPageExtractor($ ?8 S$ _% d/ `2 g( Z+ Z/ [
- device="cpu", # If you want to use CUDA, please change to device="cuda" format.
) D+ e) v2 ?5 g A% H6 t5 e5 V, h- N - model_dir_path="/path/to/model/dir/path", # The folder address where the AI model is downloaded and installed
1 E2 a T F5 Z y - )' b& k0 u1 c/ S+ x6 l* a2 q' Q, R
- with MarkDownWriter(markdown_path, "images", "utf-8") as md:/ s3 w1 F* E! a, M
- for block in extractor.extract(pdf="/path/to/pdf/file"):
% u2 d9 c1 _: a) Z, U8 w2 ?, O - md.write(block)
复制代码
x; [) [7 w" O. }) b
1 k4 n& V% {$ B- Y要修改的内容:* X2 H9 b8 D4 t7 [6 `
4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型8 j+ B B4 d3 [5 x; d* x( O
4.2 markdown_path:输出的 markdown 路径文件名
7 t3 p+ }0 l, w x1 i4.3 /path/to/pdf/file: 输入的源PDF路径文件名
& p' Z: `* G! Q8 h& ]" G6 i2 }1 d( ?* D5 u
5. 运行 python3 a.py |
评分
-
查看全部评分
|