|
|
本帖最后由 chigre3 于 2018-6-30 21:37 编辑 2 E, A9 X2 S& w
/ r+ ]% l; f- H不用另外写个小程序,直接综合使用现有的工具软件。0 E8 a3 q) T8 W+ p# D
* D v7 z% z3 [" y正文页面的首末单词索引制作方式:& w/ N2 E8 X% G/ D. o4 T
注意:当然可以直接手工录入的方式,完成后再按步骤6检校3次。
5 `8 I& { n4 p, R) o. R! o* w6 Q. N! W& U, N! o. ]
(1) 使用 ComicEnhancerPro 【批处理】将所有页面纯黑白化;
$ V- i. k1 m& k6 O+ B(2) 使用 ImageMagick 【批处理】(.bat) 对页面采取固定位置+固定大小切图,得到包含单词的页眉截图;
% s' u- U+ |; e- s2 g. x(3) 使用 FineReader 对切图识别,导出文本文件, 每个切图对应一个文本;
^) H6 z+ ~$ m" ?& N, O: R(4) 使用 TextForever 合并文本,添加文件名信息和空白行,整理文本;
0 ?( {7 B8 @& Z(5) 屏幕左边使用 ComicsViewer 打开图片,适合宽度显示;屏幕右边使用 EmEditor 校对步骤4的文本 (第1次)。: N" G/ v8 V M. H7 O" X1 D
p.s. 原扫描图片为高清, OCR识别后的步骤5需要修改的地方不多,可能不是很有必要!修改的地方仅仅为:个别空格缺少,个别单词的字母识别错误(使用单词拼写检查无法检查出)
$ T9 d. B( E8 Q1 ?(6) 使用 Excel 的拼写检查核对一下 (第2次),然后再使用排序检查 (第3次),最后将这些单词和MW英文版的大词库词条进行删除重复测试检查是否有范围外的单词 (第4次)3 Y: ^1 X) |4 p0 N
6 ]3 k5 t3 Q) N& U+ F, [- `% [这样的单词索引,稍微加工之后,可用于Goldendict通过加载python脚本实现整页版查询、显示、翻页等等功能。
7 K* l8 W; }0 l! x( m延伸阅读:& Z1 n0 E1 E: u6 E1 B) ]% K/ u
[设想]一种新的词典格式[专为图片版词典设计]: ^0 v! o4 a: S8 j
https://www.pdawiki.com/forum/fo ... hread&tid=22035
$ w4 J4 [& B9 _) J 我的楼层:
: f0 m! }4 C- r' f v8 l https://www.pdawiki.com/forum/fo ... 2035&pid=520858- l% r' E7 c8 W: v- l
9 R5 m5 H* S* j, |/ [, ?+ W7 h Z Q, H6 O
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?免费注册
x
评分
-
3
查看全部评分
-
|