掌上百科 - PDAWIKI

 找回密码
 免费注册

QQ登录

只需一步,快速开始

楼主: sunsmile23

[工具] mdx制作必备:RegEx Dotext,可合并词条,提取信息等

  [复制链接]

该用户从未签到

发表于 2013-11-28 09:26:19 | 显示全部楼层
这个可以把词库任意组合啦!无敌呀!
  • TA的每日心情
    开心
    2020-3-8 09:14
  • 签到天数: 1 天

    [LV.1]初来乍到

    发表于 2013-11-28 12:36:48 | 显示全部楼层
    谢谢楼主分享,让我也试试吧。

    该用户从未签到

    发表于 2013-11-28 21:27:54 | 显示全部楼层
    几天没上,大神已更新了这么多次,辛苦了+ A; d. D6 W/ i, O
    想要您的最新版,可以吗?

    该用户从未签到

    发表于 2013-11-29 12:49:07 | 显示全部楼层
    软件真好,对我帮助很大!希望老大分享,体验新版使用的快感!

    该用户从未签到

    发表于 2013-11-30 09:50:33 | 显示全部楼层
    本帖最后由 Oeasy 于 2013-11-30 10:02 编辑 + ~' i. ^2 P% t4 c: ?! f

    ' I2 k: m" v+ ~/ E1 B2 C: i( x7 X# z
    首先感谢楼主 ,提供了这么好的工具,谁用谁知道。节省了大量的时间,以前我都是用Excel来合并词条,很费劲,还有内容丢失的情况(因为Excel一个单元格里的内容有长度限制)。不过人心不足蛇吞象,我们想要的总是更多、更好。{:5_227:} 不知道可不可以添加下面的功能。3 y$ H: ~6 Y' A1 Y" q! g$ J; J) ^
    / c2 b0 y" ?' M) a' k
    说明,下面我用到了三个有“名”的txt。
    8 o( m" v7 X) j8 s1 d% X) ?src_1.txt,mdx源文件1;, c1 S' ]7 W6 `5 y; o& K
    src_2.txt,mdx源文件2;
    5 `* M8 t$ P9 V* i+ q, v0 hsrc_result.txt,最终(想)得到的txt,keywords为src_2.txt,条目内容为src_1.txt+src_2.txt对应条目下的内容。
    4 d9 S& b: e+ V- Q2 ]+ V========================================================================8 m) \5 s6 j; Q# W# g( m; |4 d
    有src_1.txt、src_2.txt这样两个mdx源文件,其中, u1 h' N# t8 {
    src_1.txt  G. s; L1 O) ~& `
    A9 J3 r1 i0 G9 H# G5 A
    A_CONTENT_src_1
      x& ^) Y9 R0 R3 c7 Z4 J0 ~</>
    1 _0 C/ B, I) R- }! S" ~B
    0 z: T+ {1 Z# Z/ A! @$ N* K4 @B_CONTENT_src_1
    ) p% K4 p( L4 b+ h  @4 W9 Y$ I1 a</>5 z9 h$ i; K* x4 {7 `: s
    C
    3 R; K  b& @: g9 h# M8 qC_CONTENT_src_1, f0 Q, @( M* L. z9 Q* ]' O3 y: O
    </>
    9 Z! N( M) O" ED
    3 l. D9 C. r2 M2 V3 ]) Z. `4 HD_CONTENT_src_1
    ' ?: A" `) j* a$ O</>

    : g* n0 g9 F1 R" N: U( R4 ~
    # J! P9 K5 g) Z3 Qsrc_2.txt; J/ [9 Q2 R$ g. x
    B8 K; v2 W0 @0 F; [9 d( Q! S" \
    B_CONTENT_src_2
    % S6 v- A7 {# H1 i</># z( U0 y, I# H/ Y! S
    D  O* j' V7 A2 T5 F. V! }
    D_CONTENT_src_2
    / y+ i3 p* {3 y# O  \: }% t' _: \</>
    $ A0 _& y0 l# ?/ t6 `
    $ e, r1 z: B1 M2 D( c1 Z
    我想得到这样一个mdx源文件' T6 d+ ~2 Y7 c% [  V- F6 g' h
    src_result.txt" T& O4 D7 f. Z( X7 A: D
    B# S% P2 e! Z4 \- Z, u3 J0 M
    B_CONTENT_src_1: o+ f, {9 U5 m  W# u3 }& |' O1 l
    B_CONTENT_src_2' C% R7 B, D! I: ?* n  \
    </>  a8 m, z: p4 \/ S& D. A/ W
    D" a& y) O4 M1 r" [3 {" k
    D_CONTENT_src_18 D% E# n, t' [
    D_CONTENT_src_2" R- i9 d* Y4 b& v- l4 ?
    </>
    % H5 k" i$ |- h' i6 s9 @

    ) D) Y  \7 f: o7 F( ^, d& N目前我的处理方法是,src_1.txt与src_2.txt合并(就是复制粘贴到一个文件里啦),然后利用Dotext的合并词条功能,得到  h% u. k4 G. o
    A' `9 j9 Q! J! n, V: D* i; S
    A_CONTENT_src_1& P3 }, @( j- |. J; @0 f
    </>
    . H* P& L# I" k# ^0 L1 }: YB
    . ~2 _, h5 `& PB_CONTENT_src_18 [# T. Q; M% }
    B_CONTENT_src_2
    # Z2 h+ O7 H( H% q</>: E- f/ r7 ]- h0 ?4 Z
    C, \; [5 i- }  }
    C_CONTENT_src_1
    . A2 z1 @# i) S" ?" X' r</>
    7 x5 P. p$ s, G" ~4 u8 E1 K! z  eD
    - p/ j& K: L0 a  p2 U, V7 ED_CONTENT_src_1
    " n( @( h8 ~& L" }) {D_CONTENT_src_2
    $ u# {7 f1 L6 z  C</>

    ) u- I& _3 M5 M( S% }然后利用src_2.txt里原有的一些标记性文字,删除不含src_2.txt内容的词条。最后也算可以得到src_result.txt。% Q8 H! a0 Q& q+ o7 G$ m
    这其实就是mdx源文件的合并、取差、筛选等等。
    ; B6 Y; ?. S' ^/ |( P* W========================================================================0 ^+ v4 T5 s# n' I! N; Z6 r
    说说这个idea有什么用。8 z& D# B! R! |' Y: a5 D
    一、
    4 x& ^/ h9 \( b5 Tsrc_2.txt可以是一个list性质的mdx,比如
    , z8 T" x8 b: O& ^8 ^! {
    生词1
    , f% x/ o! U: q! ]随便什么内容1
    * ?6 M. r/ u. ^</>
    ' y. Q  A/ F5 t  o生词2) B5 A1 {  D- R
    随便什么内容2
    4 m! y/ ~8 G9 B) J</>

    6 p$ x% Y9 u: _' h9 Q2 [/ l: J1 fsrc_1.txt可以是某本双解词典。- O4 i+ s5 E2 w% |2 I, D

    8 v9 Z/ @' O/ Q1 V利用上面的操作,就从src_1.txt提取出了生词1、生词2的词条(内容),做成一个mdx,时常阅读、复习,可算是升级版本的“生词本”(单词本)。! B& F+ v  @1 H- x: c. c5 @
    二、
    ! c# D) {1 _2 b# r6 W5 b& osrc_2.txt可以是一本小型的词典,比如( ?/ D! h: ?, e6 g
    外研社现代法汉汉法词典. }( J" U& v  }
    src_1.txt则是chigre的【2013.05.27】法语发音库(121,310检索项, 实际90,626词条)
    ; @, k2 b# a4 @https://pdawiki.com/forum/thread-10685-1-1.html8 E4 r: s3 U) j" ~0 F0 V
    1 K2 Q7 J: S& t8 ]
    利用上面的操作,src_result.txt就是有真人语音的《现代法汉汉法词典》了。
    9 ~+ l' }7 O" o4 ^3 i7 p3 a. O3 o7 J3 c" w, g" t
    三、
      y3 Z% }, S8 |: ?+ B5 k一、二的组合情况。1 L! r6 X0 @* i: U& v4 ^
    ========================================================================
    " I  N! n/ T$ j- L9 A说了这么多废话,跟Dotext什么关系呢?
    7 ?# w8 _. e* N9 S5 ^3 H我上面那一堆,核心就是想得到src_1.txt里keyword为B、D的条目,$ J/ T0 v% ^! p  e4 q. t
    ) ^  E( Y5 q; P2 x
    src_1.txt5 @# i; y2 k% c' Z( a3 F6 ^, ?
    A8 {7 U8 [) u8 ]. Q7 m( g
    A_CONTENT_src_1' t  o* b) A  W# Z3 D( _: J
    </>
    & l4 d- s3 f; O+ {+ q: MB  }) ]+ e6 X9 u. X0 P
    B_CONTENT_src_1
    4 |) \' X* R6 s% w</>6 {) q% ^7 W: O" e
    C3 F1 z# Y* E# T; ^/ o% O/ t2 \7 |
    C_CONTENT_src_1; r8 A9 Z& D5 G$ d1 A
    </>8 G0 {% Z. W8 v/ l( S
    D
    0 x7 y' w2 S( PD_CONTENT_src_1
    * f9 ^7 \# U& `. ~6 C! h8 J</>

    4 C9 [/ i1 z" Q- P" O提取条件是* F8 g! u# p9 S
    B- f- E- O# q) h4 e4 C, V
    D
    : b/ C3 U+ `/ n
    提取结果6 d1 f, g' M/ E: y9 Y3 L6 Z
    src_1_extract.txt  _5 U" u8 e! P. M  D
    B7 x5 l; S. B! r( E, Z6 P5 i( m
    B_CONTENT_src_1
    3 s( Y% ]: A1 M& s* h</>
    - B6 v3 N# U/ z! gD
    3 s1 I  @; Y' GD_CONTENT_src_1
    : j! g) Z2 n& K2 ~3 P5 {& Z</>
    3 W5 W4 N+ l6 F* e6 Z3 i2 ~7 W
    Bingo!0 L! s; e8 z2 P1 u' v: R- \/ U* d
    不知道能不能给RegEx Dotext加上这个功能,或者说已经可以实现,但是我没摸索到?
    ' k& V5 f6 V; I* |' j再次感谢楼主。{:10_244:}   e' ~. P6 \4 O, M7 |  q- Q
      V; {7 _* {" D  c& T, v' a

    该用户从未签到

    发表于 2013-11-30 11:07:34 | 显示全部楼层
    谢谢老大。我想要新版。我的邮箱:[email protected]

    该用户从未签到

     楼主| 发表于 2013-11-30 13:37:17 | 显示全部楼层
    本帖最后由 sunsmile23 于 2013-11-30 13:43 编辑
    : j  t- A" l) H' g/ s5 R) o: X  e% ^9 s! Z8 K) z
    mdx fan 们,O常委是本坛目前所见的知识储备多、勤奋好学又热心肠的人,我等若能有他一半,何愁解决不了自己的问题。
    $ K. a" M+ u# F) p
    ! \- P- U1 |! U**所见略同。这种按需提取,正是dotext考虑的下一次升级。前面各版主要在于排错,以后可能主要在于添功能。3 D( n/ l4 [- V3 R$ w
    正如你所言,懂英语、懂词典的,不懂技术;懂技术的不太懂这词典到底该怎么搞,怎么弄好用。恰好我几样都懂点(尽管只懂点皮毛),所以,知道想要什么

    该用户从未签到

    发表于 2013-11-30 20:18:03 | 显示全部楼层
    谢谢老大的工具。真的非常感谢!

    该用户从未签到

    发表于 2013-12-1 01:54:43 | 显示全部楼层
    正式我在找的软件,合并词条,去掉重复词条。
  • TA的每日心情
    擦汗
    2025-3-22 09:30
  • 签到天数: 21 天

    [LV.4]偶尔看看III

    发表于 2013-12-2 18:19:54 来自手机 | 显示全部楼层
    本帖最后由 majikun 于 2013-12-2 18:22 编辑 , ?& t  U% S3 u: [

    . U* T9 k) k  b0 n! o$ m支持老大正在制作词典,里面的重复太多了,特别需要老大的新版软件,可以发我的邮箱吗?[email protected]谢谢了

    该用户从未签到

    发表于 2013-12-2 18:37:02 | 显示全部楼层
    本帖最后由 dingweifengye 于 2013-12-2 18:40 编辑
    . {6 l' Q# Y& E5 n" v% ~$ P$ H. \, d& m8 M( K
    非常感谢楼主的分享!支持...E-mail:[email protected]

    该用户从未签到

    发表于 2013-12-3 11:04:24 | 显示全部楼层
    正在修改21世纪大英汉词典,这个词典释义比较广泛,例句丰富,但是需要词条合并一下。' v/ |0 D, `; ~. h# b
    不知楼主能否共享下解压密码?谢过了~~
    0 ^$ g( Y; e. k+ j% ^[email protected]
  • TA的每日心情
    开心
    2025-1-24 20:48
  • 签到天数: 635 天

    [LV.9]以坛为家II

    发表于 2013-12-3 15:39:34 | 显示全部楼层
    感谢楼主无私的奉献,请惠赐密码

    该用户从未签到

    发表于 2013-12-3 16:48:34 | 显示全部楼层
    sunsmile23大神你好,1 S4 `+ D( {0 ~/ l9 l$ e9 R# X
    有个问题请教一下:
    1. Revere3 n- R2 s8 O5 |7 e
    2. n. 里维尔(美国马萨诸塞州东部城市)
      / E5 D: J4 E' T8 T9 w

    3. * l, y3 Y/ n& u) n( k
    4. revere
      ( g. j, @7 V7 P
    5. vt.尊敬,尊重;崇敬
      * Z7 ]3 b4 I$ d# K
    6. - C; m. y# D' h0 q* p6 B
    7. revere) ]; Y! r. |5 }  @+ x% d) G
    8. n.单词revers的变体
    复制代码
    这三个单词,我想合并后两者,前面的Revere作为独立的词条。
    * g8 g3 V4 J: o4 E& o0 x1 c# G但是我用RegEx Dotext 1.0β3转换后,这三个词条合并在了一起。
    0 \- ?6 G- x  `& D2 ]1 ~8 u' i* P0 I) U6 x! z8 N: h
    猜测可能是因为没有区分词条的大小写。
    3 L8 O# k; V! Q3 E请问应该如何操作呢?  v8 B- d- b/ E% Z+ a+ |
    , G0 Y3 L0 K. ^
    谢谢!

    该用户从未签到

     楼主| 发表于 2013-12-3 20:25:58 来自手机 | 显示全部楼层
    确实不区分大小写。; {2 i* H! Z- U+ c
    以后版中,是否区分,可交给用户去决定

    该用户从未签到

    发表于 2013-12-3 21:13:42 | 显示全部楼层
    能否增加一个功能:全部删除释义相同的词条?3 i7 _9 H& `& I
    应用背景:在合并时,有些完全相同的词条在N本词典中都有,并合后就会重复出现,因此 只想保留其中的一条即可。
    1 a, y6 J/ B5 C8 A/ }9 ]. I$ e如有可能,请提供,谢谢您 。

    该用户从未签到

    发表于 2013-12-7 23:00:11 | 显示全部楼层
    我是最大的受益者!再来致谢!(我甚至把我自己的语音库/词频/第一主力词典都用dotext合并了o(∩_∩)o), E9 {1 p+ X0 R7 J
    其实还想把牛津和朗文以及新牛津的短语和衍生词都提取了,可惜精力不够了!
  • TA的每日心情
    慵懒
    2025-1-28 16:22
  • 签到天数: 216 天

    [LV.7]常住居民III

    发表于 2013-12-9 20:40:02 | 显示全部楼层
    Hugh 发表于 2013-12-7 23:00
    2 k/ {/ D/ E; o& _7 i# z7 }( L: r我是最大的受益者!再来致谢!(我甚至把我自己的语音库/词频/第一主力词典都用dotext合并了o(∩_∩)o)
    * R" j2 g8 O5 g3 V7 i. K其 ...

    0 S  A! ]4 e7 T1 H* M3 d4 @赏心悦目的排版。

    该用户从未签到

    发表于 2013-12-11 22:49:30 | 显示全部楼层

    该用户从未签到

    发表于 2013-12-11 23:35:54 | 显示全部楼层
    前来致谢!合并词条效果很好!只是很奇怪,里面的正则表达式怎么用不了?总是报错。同样的表达式在c#里面没错啊?

    该用户从未签到

    发表于 2013-12-12 08:55:19 | 显示全部楼层
    抽取短语有没有人做过

    该用户从未签到

    发表于 2013-12-12 09:13:27 | 显示全部楼层
    老大的作品太好了,给个新版吧,谢谢!![email protected]

    该用户从未签到

     楼主| 发表于 2013-12-12 20:21:37 来自手机 | 显示全部楼层
    hyln9 发表于 2013-12-11 23:35
    5 D2 D3 [1 }/ F前来致谢!合并词条效果很好!只是很奇怪,里面的正则表达式怎么用不了?总是报错。同样的表达式在c#里面没 ...
    . D$ ~, \- B2 [: K1 e+ j, U- Z8 R9 e
    贴出来看看。
    & U: A. q8 p5 Z这个与perl兼容。

    该用户从未签到

     楼主| 发表于 2013-12-12 20:24:53 来自手机 | 显示全部楼层
    l126t 发表于 2013-12-12 08:558 l  R  {7 ?# t
    抽取短语有没有人做过

    / T$ G8 q9 M4 Y6 z3 X帮助里有使用示范文件的例子。
    ! d; @! c$ Y2 g1 w, m) y' [最关键的是找出短语特征。

    该用户从未签到

    发表于 2013-12-13 01:46:44 | 显示全部楼层
    sunsmile23 发表于 2013-12-12 20:21
    ) J- m5 h2 r: {: Y1 t6 m6 B贴出来看看。+ F5 X1 ]) O2 h! T6 w; }
    这个与perl兼容。

    / F0 k2 ]; R* ~. q% v; ^3 k, {; ?实在抱歉,我后来吧表达式缩短了一些就没再报错,之前的没有记录下来。不过还有一个疑问,就是转出来的文件会有这样的:<a> 我都手工改成了 </a>
    您需要登录后才可以回帖 登录 | 免费注册

    本版积分规则

    小黑屋|手机版|Archiver|PDAWIKI |网站地图

    GMT+8, 2026-7-30 00:01 , Processed in 0.020662 second(s), 15 queries .

    Powered by Discuz! X3.4

    © 2001-2023 Discuz! Team.

    快速回复 返回顶部 返回列表