掌上百科 - PDAWIKI

 找回密码
 免费注册

QQ登录

只需一步,快速开始

查看: 2475|回复: 4

[讨论] 辭典詞彙量估算匹配

[复制链接]
  • TA的每日心情
    开心
    2018-8-8 03:13
  • 签到天数: 1 天

    [LV.1]初来乍到

    发表于 2019-3-21 13:07:14 | 显示全部楼层 |阅读模式
    本帖最后由 喬治兄 于 2019-3-21 21:08 编辑 / ~$ \4 w. v1 O2 i$ N" h$ H
    3 C- [9 N' f# C8 o. `
    辭典詞彙量估算匹配' l- y3 y2 h- r3 d
    在此提供試算表 您可自行預估拿捏 wordlist 詞條數量
    9 s% i" K8 O6 `延伸此點交代不清之處
    7 i5 T$ z% K2 |0 C# ]$ |2 Ahttps://www.pdawiki.com/forum/forum.php?mod=viewthread&tid=33566&extra=, v+ s" u4 z3 `# q2 J8 @
    1. 要先預估其要製作的辭典的辭彙量,
    8 G% r$ d' Z; D3 g: t   若能知道正確辭彙量是最好的, 但往往不知道其多少辭彙量4 a+ C7 {3 R4 p2 ?. @: Z7 Q. \
       可能辭典序言上標示的辭彙量也不一定正確
    % K" _# b% v; [   此可利用 Excel 統計 random 的函數產生的 30 個隨機數來挑其頁數
    , q" B! D, J& n! p3 t# F   算一下那 30 頁 每頁各多少詞頭, 然後求個平均值在乘上頁數.......就大概是那辭彙量
    2 S* p" U% R8 [. ?   保險一點的話在加上3個標準異差乘上頁數.......這樣辭彙量應能大概都能含概了吧
    8 h8 r4 E% T8 J& a   因此關於您要用多少的辭彙量來配那本字典, 您也可選 30~40 萬的 wordlist 來配4~5 萬的辭典
    2 x1 |1 d2 @* h5 b+ ?1 b; G' s   問題是整頁都是多一堆辭典沒有的字, 也是同樣多花時間找' A3 y5 G8 i- H; d2 q" c

    5 n4 r7 V, \3 E# E; {. WP.S. 已用過 47 萬多的21世紀英漢 wordlist 來配 外研社新英漢詞典 (圖片版)
    4 p- Q( Q( f2 K效果真的不佳7 \+ j/ t' Z" J7 U! y
    此 EXCEL 例只是說明小弟並無真的去算那抽樣的30頁
    1 t' r; v+ f: m& Z4 D也就是說只要配到 26萬多就基本含蓋了" U0 X; `! J2 \& c' C! H1 r
    不需用到 47 萬多的wordlist 來配
    ) D% ~! `. l( X, r其實用平均值6萬6 以上配, 應該是效果已不錯了
    $ @! ?( n1 S1 {0 z僅供參考
    * E( B# J/ D3 N- O每頁匹配多少詞條可用 countif 來算
    * `' f* j8 V+ [8 j6 N2 T" |比較一下每頁的詞條數和匹配的詞條數
    + T4 O1 @& q: e1 v% ]若是各依其數具計算出來的平均值和標準異差都很接近6 D1 t' Z, F2 i# x! a4 ~! K
    那表示你應該匹配的還可以吧
    * D/ @1 F9 U! E- r! Q7 v7 v' u5 q5 z4 l' \; W$ e8 e/ l4 m& V% x
    辭典詞彙量估算匹配_4............應該是比較合理的預估模型
    . L" f# @6 ~6 [8 i3 ?2 j& C(書頁詞條數-匹配數)<= 沒配到的詞條數
    9 z( }( P/ O5 m& h# ]. {沒配到的詞條數算出平均值標準異差.......各乘上頁數
    2 b) w4 n/ Z' V% T4 P! G9 ?7240 , 3726
    " F8 A' V/ V/ o1 V& B3 l! ]也就是說以此 wordlist 來配完此辭典大概平均沒配到的詞條數 在 7240條數 但預估最大值 18418條數
    4 M$ t7 |8 z2 }; z' i: |  f+ P' f所以用 66595+7240=73834.......大概都能配到的平均值
    4 v5 U3 X+ f* `- ^& ^, {若要在保險點則加沒配到的詞條數的預估最大值 18418......66595+18418=85013
    + C/ t7 A) E4 L+ Z所以 min=73834  max=85013) w# v9 U) Y6 ^4 k$ K) I

    ; S1 Y% B' N/ a" l* K

    本帖子中包含更多资源

    您需要 登录 才可以下载或查看,没有账号?免费注册

    x

    评分

    1

    查看全部评分

    本帖被以下淘专辑推荐:

  • TA的每日心情
    无聊
    2022-9-25 21:09
  • 签到天数: 1136 天

    [LV.10]以坛为家III

    发表于 2019-3-21 18:08:53 | 显示全部楼层
    本帖最后由 oversky 于 2019-3-21 18:25 编辑
    ( z! \% F, m* }1 X3 ~5 ~* }5 Y+ _2 Z' S# y8 Y
    第一个想法
    ; A  R4 o8 L9 X9 y( m可以试试抓几个项目特别多的字之页数来当作参考起点,这样应该可以减少累积误差。
    ( v! Y4 v. r9 {  i3 s  q
    " `- u1 o' z6 N8 B第二个想法
    " f7 }) R1 H1 J! ?! `用字频资料库来估比例。
  • TA的每日心情
    开心
    2018-8-8 03:13
  • 签到天数: 1 天

    [LV.1]初来乍到

     楼主| 发表于 2019-3-21 18:42:01 | 显示全部楼层
    本帖最后由 喬治兄 于 2019-3-21 19:06 编辑
    8 f4 Q5 }; J7 R$ `, k
    oversky 发表于 2019-3-21 18:08
    ( M. w$ m" Q+ H9 E' m$ u可以试试抓几个项目特别多的字之页数来当作参考起点,这样应该可以减少累积误差。 ...
    # [! t( g: g, t; K

    ; X6 m" p7 I/ I6 @! Soversky 兄:4 I) `6 n% y: E
    如此就不是隨機數了$ ~+ K5 ]3 |4 y, N9 {, {/ t/ p" {& \! k
    其實是不需如此, 因標準異差值本來就是設計來估誤差值的5 G( k1 g+ R% J& _% d. V
    當您用到6萬6去匹配基本上50%的單詞都絕對配到8 @# P2 L1 P9 U, t
    加一個標準異差的量13萬2就68%以上都絕對配到0 L) Q+ _, p$ t/ w% f. L9 l
    加兩個標準異差的量19萬9就95%以上都絕對配到
    ) A7 k/ T( L- P4 \1 j5 }加三個標準異差的量26萬5就99.7%以上都絕對配到
    6 Y4 I2 i# m9 v. `- M/ x, I, q而且這是雙邊機率值
    2 b  G$ m2 b' K) U若單邊其實機率值更高0 b1 j! e. Y; b' ^5 y8 D
    真的也不太需要用到加三個標準異差的量26萬5去匹配/ L% k& @! h( g. O2 P# Z% q7 o
    ! Y/ a: o+ n& b/ |! h) N. S
    倒是可以考慮把幾本的 wordlist 作張表把頻數填上, r8 H: S3 d. _0 Y$ P1 k
    用 Bootstrap 的方法把頻數考慮上隨機抽取你算出的數量的 wordlist 去匹配: F5 N; s2 [% J  V
    重要的單字不漏也不至於多配太多和漏配太多+ F$ N3 x9 I1 B2 v+ `) q3 a
    可能命中率更能提高些
    / U  z- p* R$ D0 q* A也就是集中數個wordlist 於一張 wordlist 然後每次都從此 wordlist 隨機抽取你要的數量來匹配2 @# D: t" }7 C2 U0 m$ z

    6 F# Z5 U* _# e" Q
  • TA的每日心情
    开心
    2018-8-8 03:13
  • 签到天数: 1 天

    [LV.1]初来乍到

     楼主| 发表于 2019-3-21 20:33:00 | 显示全部楼层
    本帖最后由 喬治兄 于 2019-3-21 21:23 编辑 0 @4 Y  J2 n- g( D2 v
    oversky 发表于 2019-3-21 18:08
    3 K0 l! p8 a- c8 L) n2 c第一个想法) f7 ^  S5 @2 x8 }. G8 N
    可以试试抓几个项目特别多的字之页数来当作参考起点,这样应该可以减少累积误差。

    * R! C4 `- }" q) L' o* b3 F. G. ^* M! M! Z2 J
    oversky 兄:
    0 c. x8 L$ @2 k9 |4 U* |1 E剛又想了一下檔案和圖都改了好以次# T2 C3 x- u% C8 W
    後來的預估模型應該是比較合理0 [6 \% L; q- O1 N: s* X1 H
    因若以每頁的標異差來估$ I) a5 i/ l$ F4 G2 F
    數量一定會膨脹太大1 x; P9 _  P( E+ w
    但若以沒配到的平均值和標異差來估
    0 W1 A0 m1 m0 U6 B且加上則數值來看應該是比較合理
    0 u. J3 [6 g3 J/ \
    : B; j( y* S' A' W' g9 I
    9 |' ~' I3 N& k5 U
    - f! W8 Z  P; ]2 H+ b2 X" `
  • TA的每日心情
    无聊
    2022-9-25 21:09
  • 签到天数: 1136 天

    [LV.10]以坛为家III

    发表于 2019-3-21 21:20:39 | 显示全部楼层
    喬治兄 发表于 2019-3-21 20:33
    * k) N) y& q6 b( K, V7 u7 joversky 兄:9 B0 C9 a; X. ~
    剛又想了一下檔案和圖都改了好以次
    8 q% U3 p) |# O7 W後來的預估模型應該是比較合理
    ' i$ M( w% Z- A7 L" {9 \
    好久没碰机率,我再来研究看看。
    您需要登录后才可以回帖 登录 | 免费注册

    本版积分规则

    小黑屋|手机版|Archiver|PDAWIKI |网站地图

    GMT+8, 2026-8-7 21:06 , Processed in 0.020732 second(s), 25 queries .

    Powered by Discuz! X3.4

    © 2001-2023 Discuz! Team.

    快速回复 返回顶部 返回列表