掌上百科 - PDAWIKI

 找回密码
 免费注册

QQ登录

只需一步,快速开始

楼主: sunsmile23

[工具] mdx制作必备:RegEx Dotext,可合并词条,提取信息等

  [复制链接]

该用户从未签到

发表于 2013-11-28 09:26:19 | 显示全部楼层
这个可以把词库任意组合啦!无敌呀!
  • TA的每日心情
    开心
    2020-3-8 09:14
  • 签到天数: 1 天

    [LV.1]初来乍到

    发表于 2013-11-28 12:36:48 | 显示全部楼层
    谢谢楼主分享,让我也试试吧。

    该用户从未签到

    发表于 2013-11-28 21:27:54 | 显示全部楼层
    几天没上,大神已更新了这么多次,辛苦了( j- _: @/ ^2 @" v
    想要您的最新版,可以吗?

    该用户从未签到

    发表于 2013-11-29 12:49:07 | 显示全部楼层
    软件真好,对我帮助很大!希望老大分享,体验新版使用的快感!

    该用户从未签到

    发表于 2013-11-30 09:50:33 | 显示全部楼层
    本帖最后由 Oeasy 于 2013-11-30 10:02 编辑
    % X, j7 f! y3 N9 u3 C
    ' S- z" S8 o0 a0 b
    ! t& ^% Y" k, H" I首先感谢楼主 ,提供了这么好的工具,谁用谁知道。节省了大量的时间,以前我都是用Excel来合并词条,很费劲,还有内容丢失的情况(因为Excel一个单元格里的内容有长度限制)。不过人心不足蛇吞象,我们想要的总是更多、更好。{:5_227:} 不知道可不可以添加下面的功能。' c' @. ]( M  s* r
    # n+ E( j( x8 W+ w7 ~1 Z+ A" m) U+ d8 c6 i
    说明,下面我用到了三个有“名”的txt。- V; v% R% [+ ^$ ^/ x; Z
    src_1.txt,mdx源文件1;
    ' f& R& D' G1 I& Tsrc_2.txt,mdx源文件2;2 ~& u% V* [# ]  d1 N
    src_result.txt,最终(想)得到的txt,keywords为src_2.txt,条目内容为src_1.txt+src_2.txt对应条目下的内容。
    % d" a; m3 G  h' A========================================================================# \4 j" T) i) M$ V( F" ^- o# |
    有src_1.txt、src_2.txt这样两个mdx源文件,其中# B! U  v; a, i1 Z  O9 L1 }  F& @
    src_1.txt4 r- H. r' W4 w! S
    A0 b$ l/ K3 D1 A+ Q7 J4 ^
    A_CONTENT_src_1
    * ?, F; A6 A* K1 L</>
    / P* o! w. f& n  I8 ^/ U% gB
    5 o# j" q( S- Y/ n3 r/ WB_CONTENT_src_1
    6 @7 a8 [/ b0 b1 C3 Z</>
      m9 G: `: s) F" p9 n2 c  QC
    ' B9 |- ^3 g9 @  FC_CONTENT_src_1
    $ Q: q) j& T2 D  `8 m: Q1 r, x</>& N0 e! P8 N2 k7 u  P
    D$ y0 X4 H+ _- l
    D_CONTENT_src_1: y% I! V9 O/ P$ v9 A7 [2 Y8 t
    </>

    9 L+ M1 {/ x" I7 Z$ L" N# \
    9 g- I* q+ Z9 J9 F9 y& ?9 ysrc_2.txt) T6 z- E: u- U6 D7 s$ y
    B
    ; j7 [2 c: r) a! M2 ZB_CONTENT_src_2, S/ ~, C3 ~$ M1 ^& r4 [5 d
    </>, [" \9 H$ s1 p+ S- Q. B+ n
    D
    * F! i# A: F) S; zD_CONTENT_src_2
    " y4 `0 |8 G$ V2 c' c  ~+ K</>
    - ~: f. N5 \8 i) _- b* X8 }
      L- J, ?' m3 d4 i
    我想得到这样一个mdx源文件
    # U2 g+ C# V3 ]/ E; q) v3 A; j3 vsrc_result.txt/ `$ G, ^3 u' E
    B
    5 B4 [3 B7 [9 D8 t0 K9 nB_CONTENT_src_1
    ; r7 D- r* G( \- HB_CONTENT_src_2
    ' d6 |3 ]# w' r- h1 X: F</>
    $ Z+ b- ~# ~4 u7 qD
    + y# o0 @+ @8 ~% GD_CONTENT_src_1
    3 K$ z0 D$ R' `+ c3 Q* tD_CONTENT_src_2
    " E, z2 ]; f  {- H6 {& J% o</>
    6 k9 i) i, ~+ g5 `
    # d7 g0 ~+ \# M7 ]
    目前我的处理方法是,src_1.txt与src_2.txt合并(就是复制粘贴到一个文件里啦),然后利用Dotext的合并词条功能,得到5 W% \' d  g9 Q* i0 z, v8 k+ W
    A; q8 |( i  m6 Q1 c/ C; y; [1 _) W
    A_CONTENT_src_1
    : v! k( e+ J( K+ d" k+ c</>
    9 [( D# t" ]6 Q* o# O6 xB
    # t3 H4 m0 u- k$ l- Y% SB_CONTENT_src_11 U/ k% R7 Y: e/ x* K- x
    B_CONTENT_src_2& _+ k, A& p' r) i; j
    </>0 O. d" X% B" u8 m
    C& C& X6 E( J- T# a5 |) f, s# c  v
    C_CONTENT_src_1
    % Q3 r  O* h$ x$ [- g7 [& E) I7 u$ M</>
    . v5 E4 ~. p% a( X! _0 O3 JD& z1 \  L0 _3 s" K: M+ P4 y3 A( Z- ~
    D_CONTENT_src_1% P+ ^$ ^( W" v2 b4 u
    D_CONTENT_src_2- s9 j7 B; b1 g  Z& y- B3 K0 n
    </>
    - X+ r3 Z% J- M* A* X
    然后利用src_2.txt里原有的一些标记性文字,删除不含src_2.txt内容的词条。最后也算可以得到src_result.txt。
    3 u( {3 `9 g- r/ l6 F这其实就是mdx源文件的合并、取差、筛选等等。
    # D. Q9 a' Q" K6 A) D========================================================================' J6 O, d" z' j- v6 T$ p! q5 x
    说说这个idea有什么用。
    , L; p& R" ], ]2 h( E" l$ A一、) `3 I1 Y$ ?+ p1 B) M4 f5 }
    src_2.txt可以是一个list性质的mdx,比如/ w% b2 R9 `& C! D
    生词1! c. m6 L% I4 d4 a: W) o/ Z
    随便什么内容1/ X$ Z5 n& {$ G' `3 ]- O
    </>
    & J; c- @1 w& x, `9 \7 {3 c( z生词2, G4 C+ {' d9 S; D% V4 W
    随便什么内容2
    + T2 S' |1 x* c$ {1 B, v# k) b</>

    $ S# R" u$ i8 @src_1.txt可以是某本双解词典。
    3 ]1 u( O4 U( Q1 ~) R! ?
    2 x0 F8 J- c$ v7 G6 r- n! s利用上面的操作,就从src_1.txt提取出了生词1、生词2的词条(内容),做成一个mdx,时常阅读、复习,可算是升级版本的“生词本”(单词本)。
    5 N% S8 ?9 z( I二、) `1 W7 c. W( \' }1 z+ Z) n
    src_2.txt可以是一本小型的词典,比如$ d/ _$ G5 D: E) t# V3 K
    外研社现代法汉汉法词典' Q3 {4 K( z9 w
    src_1.txt则是chigre的【2013.05.27】法语发音库(121,310检索项, 实际90,626词条)
    , x$ w- r8 s4 lhttps://pdawiki.com/forum/thread-10685-1-1.html7 B( c! _7 s" J) W5 A& H+ v

    . |6 b$ b8 b5 l8 L利用上面的操作,src_result.txt就是有真人语音的《现代法汉汉法词典》了。
    % }# g/ y( Y3 f8 Q6 x$ D0 o4 B& b/ R5 }( e: D
    三、: E2 T. R8 G. c! O% d% {+ K
    一、二的组合情况。
    8 s2 L9 ]9 s$ G0 t- m( j1 k========================================================================* x7 d" W- g6 y' u1 `- t( Q3 @
    说了这么多废话,跟Dotext什么关系呢?; [& k0 O/ K1 G6 V" A4 _& p0 ^
    我上面那一堆,核心就是想得到src_1.txt里keyword为B、D的条目,+ ~! x- G/ G7 Q" r1 j/ [$ w  ]

    6 r! B3 `0 @2 v8 o/ k8 h/ jsrc_1.txt4 D- R9 ~. B4 K. w! D
    A5 B% \0 ^+ m- K3 A. S, ?
    A_CONTENT_src_1
    * T& I0 b' u5 r</>. A, ^3 Q0 o* M: z) V1 j
    B+ h0 T! H: ?8 o/ W, A
    B_CONTENT_src_1. L) }* |8 ]7 J- c3 ^) q
    </>( ]) Z& p+ b, B
    C; D. `8 d. j, J2 O. a
    C_CONTENT_src_1; h' q* ?1 T1 u! N/ \2 y
    </>
    ' v( q2 l9 g) W3 \- o- T3 M1 RD5 q' R$ p+ I! L$ @# s7 G. {
    D_CONTENT_src_1& r. B) i9 p* B8 N+ p6 Q
    </>

    ; y! ~- B0 v7 w6 Y7 \# a$ ~# ^3 u提取条件是
    6 \0 [/ e5 f1 ]& U, {* H
    B. }7 d& S/ t$ {5 B/ q
    D

    4 C0 M% I6 y% t* e+ F4 l提取结果
    4 j; N5 v0 {1 hsrc_1_extract.txt3 [4 T/ ?* N! ]0 e7 |8 C% f
    B. V( k1 R0 C) v$ i: \( f, e4 T
    B_CONTENT_src_1
    . e& T, r! c! \4 T( t( \5 y9 b</>/ b: F1 m- B2 @5 o2 p- S! g# ^* l* e
    D
    + v' f* o8 N+ a2 iD_CONTENT_src_1
    : E; J1 w- D$ }* S  F/ T6 Q</>

    $ Z4 f/ Y& I/ m. EBingo!
    # F2 E6 J+ a# T, f, p. k1 F不知道能不能给RegEx Dotext加上这个功能,或者说已经可以实现,但是我没摸索到? , U! T$ {/ T/ ^
    再次感谢楼主。{:10_244:}
    0 q* q7 h$ U# y3 e/ p' a& @
    ) T/ v7 g& v3 P  e! m

    该用户从未签到

    发表于 2013-11-30 11:07:34 | 显示全部楼层
    谢谢老大。我想要新版。我的邮箱:[email protected]

    该用户从未签到

     楼主| 发表于 2013-11-30 13:37:17 | 显示全部楼层
    本帖最后由 sunsmile23 于 2013-11-30 13:43 编辑
    / `5 i3 W1 d: T! {$ F3 o. B' h
      ]/ j: ]: u: x  v- |mdx fan 们,O常委是本坛目前所见的知识储备多、勤奋好学又热心肠的人,我等若能有他一半,何愁解决不了自己的问题。* V: p) [  Z  o. B

    + P% D; l0 m7 L4 A' D& f**所见略同。这种按需提取,正是dotext考虑的下一次升级。前面各版主要在于排错,以后可能主要在于添功能。  @6 d" [2 l# ]3 U  @7 V
    正如你所言,懂英语、懂词典的,不懂技术;懂技术的不太懂这词典到底该怎么搞,怎么弄好用。恰好我几样都懂点(尽管只懂点皮毛),所以,知道想要什么

    该用户从未签到

    发表于 2013-11-30 20:18:03 | 显示全部楼层
    谢谢老大的工具。真的非常感谢!

    该用户从未签到

    发表于 2013-12-1 01:54:43 | 显示全部楼层
    正式我在找的软件,合并词条,去掉重复词条。
  • TA的每日心情
    擦汗
    2025-3-22 09:30
  • 签到天数: 21 天

    [LV.4]偶尔看看III

    发表于 2013-12-2 18:19:54 来自手机 | 显示全部楼层
    本帖最后由 majikun 于 2013-12-2 18:22 编辑 / S+ `0 y. v, }5 T

    ' A& _" E- d# {- I9 H, p1 |) s支持老大正在制作词典,里面的重复太多了,特别需要老大的新版软件,可以发我的邮箱吗?[email protected]谢谢了

    该用户从未签到

    发表于 2013-12-2 18:37:02 | 显示全部楼层
    本帖最后由 dingweifengye 于 2013-12-2 18:40 编辑
    ) O& }( h- W( W, \% Y% {, k! V  M$ J  r
    非常感谢楼主的分享!支持...E-mail:[email protected]

    该用户从未签到

    发表于 2013-12-3 11:04:24 | 显示全部楼层
    正在修改21世纪大英汉词典,这个词典释义比较广泛,例句丰富,但是需要词条合并一下。9 F: R( S' K$ _# K4 V# ~* J  l
    不知楼主能否共享下解压密码?谢过了~~
    % v5 o0 k, K7 Y7 p' ]2 L* J- `6 t[email protected]
  • TA的每日心情
    开心
    2025-1-24 20:48
  • 签到天数: 635 天

    [LV.9]以坛为家II

    发表于 2013-12-3 15:39:34 | 显示全部楼层
    感谢楼主无私的奉献,请惠赐密码

    该用户从未签到

    发表于 2013-12-3 16:48:34 | 显示全部楼层
    sunsmile23大神你好,
    0 b* I5 \. v" f有个问题请教一下:
    1. Revere
      $ G6 |. |; |: S9 o& t3 v
    2. n. 里维尔(美国马萨诸塞州东部城市) 5 x" l& ^: O; K0 H/ f
    3. 9 y2 y1 u/ U8 ?1 |4 i" C
    4. revere  ?' D2 P* R' A  w
    5. vt.尊敬,尊重;崇敬
      & U4 ^" [- ~/ P! H  W+ N
    6. 7 V3 _( ]7 v$ H4 I) f+ Z5 O2 _/ s
    7. revere
      3 T- U+ O% n3 t
    8. n.单词revers的变体
    复制代码
    这三个单词,我想合并后两者,前面的Revere作为独立的词条。# ?$ [9 I. B5 M; o
    但是我用RegEx Dotext 1.0β3转换后,这三个词条合并在了一起。
    2 H) o3 S+ I6 b4 b" v: u, F
    6 o% p  }2 P* v4 f, A7 d$ R" s猜测可能是因为没有区分词条的大小写。& M# A" A5 `) e
    请问应该如何操作呢?, m+ U) o" l+ ?. n, d9 r
    * ~, o5 K5 y2 b5 h# o* M
    谢谢!

    该用户从未签到

     楼主| 发表于 2013-12-3 20:25:58 来自手机 | 显示全部楼层
    确实不区分大小写。" S- X; f+ i# O7 ]# @6 n, G& F: X: [
    以后版中,是否区分,可交给用户去决定

    该用户从未签到

    发表于 2013-12-3 21:13:42 | 显示全部楼层
    能否增加一个功能:全部删除释义相同的词条?
    + x) L) A3 B% T. Q) o应用背景:在合并时,有些完全相同的词条在N本词典中都有,并合后就会重复出现,因此 只想保留其中的一条即可。
    / B8 `# E: _' v9 y) t9 J  q如有可能,请提供,谢谢您 。

    该用户从未签到

    发表于 2013-12-7 23:00:11 | 显示全部楼层
    我是最大的受益者!再来致谢!(我甚至把我自己的语音库/词频/第一主力词典都用dotext合并了o(∩_∩)o)
    9 [; v, P2 {7 T% ]" O! U1 y其实还想把牛津和朗文以及新牛津的短语和衍生词都提取了,可惜精力不够了!
  • TA的每日心情
    慵懒
    2025-1-28 16:22
  • 签到天数: 216 天

    [LV.7]常住居民III

    发表于 2013-12-9 20:40:02 | 显示全部楼层
    Hugh 发表于 2013-12-7 23:00 5 A# Z9 q& u& b
    我是最大的受益者!再来致谢!(我甚至把我自己的语音库/词频/第一主力词典都用dotext合并了o(∩_∩)o)1 H0 u1 K( I5 d5 v  N2 Z9 w
    其 ...
    9 C1 A1 g, K( C" J" l" @9 m% N4 g
    赏心悦目的排版。

    该用户从未签到

    发表于 2013-12-11 22:49:30 | 显示全部楼层

    该用户从未签到

    发表于 2013-12-11 23:35:54 | 显示全部楼层
    前来致谢!合并词条效果很好!只是很奇怪,里面的正则表达式怎么用不了?总是报错。同样的表达式在c#里面没错啊?

    该用户从未签到

    发表于 2013-12-12 08:55:19 | 显示全部楼层
    抽取短语有没有人做过

    该用户从未签到

    发表于 2013-12-12 09:13:27 | 显示全部楼层
    老大的作品太好了,给个新版吧,谢谢!![email protected]

    该用户从未签到

     楼主| 发表于 2013-12-12 20:21:37 来自手机 | 显示全部楼层
    hyln9 发表于 2013-12-11 23:35
    # o2 g$ ]/ d$ O8 w8 C; r前来致谢!合并词条效果很好!只是很奇怪,里面的正则表达式怎么用不了?总是报错。同样的表达式在c#里面没 ...
    ( T( K$ U7 g9 ?& [- W  t" M3 w' R8 _
    贴出来看看。
    2 X) J4 @7 j- m! v8 N这个与perl兼容。

    该用户从未签到

     楼主| 发表于 2013-12-12 20:24:53 来自手机 | 显示全部楼层
    l126t 发表于 2013-12-12 08:55
    ! Z1 y  o; o0 C* C抽取短语有没有人做过

    - }2 m5 A4 V5 V# t* j帮助里有使用示范文件的例子。5 ^1 v1 E3 W5 u* t" G8 _% j
    最关键的是找出短语特征。

    该用户从未签到

    发表于 2013-12-13 01:46:44 | 显示全部楼层
    sunsmile23 发表于 2013-12-12 20:21
    + H* {% e5 I4 D, [4 X4 V贴出来看看。9 y" d3 h1 B* K& V! e/ H
    这个与perl兼容。

    ) j% y1 q, O1 i  h% J4 u7 u! x+ p0 I实在抱歉,我后来吧表达式缩短了一些就没再报错,之前的没有记录下来。不过还有一个疑问,就是转出来的文件会有这样的:<a> 我都手工改成了 </a>
    您需要登录后才可以回帖 登录 | 免费注册

    本版积分规则

    小黑屋|手机版|Archiver|PDAWIKI |网站地图

    GMT+8, 2026-9-22 00:35 , Processed in 0.020157 second(s), 15 queries .

    Powered by Discuz! X3.4

    © 2001-2023 Discuz! Team.

    快速回复 返回顶部 返回列表