|
|
发表于 2015-11-19 22:33:07
|
显示全部楼层
可惜没有词头, 因为PDF的词头OCR效果不是很好.
3 e+ f2 E+ A U* B& Yairframe 的OCR => ai r fram e
& F" u/ e. L" `bobcat 的OCR => bo b ca t1 J. ~. R- V" B. @4 ]
所以我才想用从” See picture under”往前35个文本来当查找的依据.
5 h8 _! l1 f7 k, X. a+ d1 |0 i1 f2 J& {& s" L! i
另外, 我也还没有完成PDF转TXT的断行整理
# T2 u. ~( _4 R8 j光是想将行尾的 “空白\n” 删除掉 \n, PC就得花不少时间..我就先中断了.
& P y4 v, _1 x) _8 @但若不先处理TXT的断行, 也会抓不到数据..8 i- \% t- L4 @8 O/ o
|
|