TA的每日心情 | 开心 2019-8-21 08:44 |
|---|
签到天数: 163 天 [LV.7]常住居民III
|
发表于 2018-11-28 09:34:34
|
显示全部楼层
本帖最后由 mikeee 于 2018-11-28 14:38 编辑 ( X- ?% P1 o8 Z; o/ L7 S
; L7 Z$ E6 x: O, ~$ c我来安利一个方法:- A$ k, t3 b9 @* F: d. Y
- 先用 Abbyy Finereader 将 pdf 转成 docx
- 再用将 docx 转存为 html
- 然后用 pyquery(python)/cheerio(javascript) 解析(可借助Chrome的Devtools)得到的 html (或直接拷出txt)
) K ?, y/ G7 n$ b : Z" }% o/ [- p7 o$ A
1)里用 Abbyy Fineread 将 pdf 转成 docx 可以自动处理页首页注等(如章名,页码等)。这些用其他方法处理相当头疼。Abbyy Fineread还有个好处,原有些pdf里分行时用的分字符(-)可以被处理掉。手动处理这些东西也很费事。2)主要是为下一步用程序解析结构准备。不想编程就直接折腾 docx 好了。3)可以节省很多时间。坊间流行的正则麻烦多多。Python里也有其他包(如bs4,lxml)但个人认为都不如 pyquery 好用。bs4用自己一套,lxml基于xpath。pyquery抄 jquery (抄得够全)用 css selector。
3 V* x* b4 e; w0 o Y; u+ Q" J1 r有人会问我是不是试过,是的。参看此帖的 9 楼 https://www.pdawiki.com/forum/fo ... light=word%2Borigin
& |7 y) Q! N# n1 s. t
" ?: K* L3 }* b$ G, [大家不妨用别的方法处理一下这本书的 pdf 试试。直接下载地址 http://npu.edu.ua/!e-book/book/d ... hrase%20Origins.pdf (2018.11.28仍然有效)。顺便提一句,这本书还挺不错的。好像还没有 mdx版,如果没人做,我可能元旦时来折腾一下。主要是硬盘紧张,没地方装 abbyy finereader,ocr需要的硬盘可能也得几百M。6 @0 l8 |2 F# I" c+ F9 N
* g) ]$ Z( a- \ |
评分
-
1
查看全部评分
-
|