古德-圖靈估計

來源:互聯網
上載者:User

標籤:

     古德-圖靈估計可以解決n元文法模型(n-gram)中的資料的稀疏問題。主要的思想是把非零的n元文法的機率降低勻給一些低機率n元文法,以修改最大似然估計與真實機率之間的偏離。是實用比較多的平滑演算法。

                        

            圖:從左至右的變化:把一部分看得見的事件的機率勻給未看見的事件  

      以統計詞典中的機率為例,來說明古德-圖鈴公式。

      假定在語料庫中出現r次的詞有Nr個,特別的出現0次(未登入詞)出現的次數為N0個。語料庫中詞語的個數為N,顯然

                                

      出現r次的詞在詞典中的相對頻度為r/N。如果不做任何最佳化處理,就依這個相對頻度作為這些詞的機率估計。

      加入當r非常小時,這麼統計可能不可靠,因此出現r次的那些詞在計算它們的機率時要使用一個更小一點的數,是dr,而不是r。古德-圖靈估計按照下面的公式計算dr:

                                   dr=(r+1)* Nr+1/Nr

      顯然

                                 

      一般來說,出現一次的詞的數量比出現兩次的詞的數量多,出現兩次的詞的數量比出現三次的數量多。這叫做Zipf定律。是一個小語料庫中,出現次數r和對應的數量Nr之間的關係。

      這樣就給未登入詞一個很小的非零值,從而解決了零機率問題。同時下調了出現頻率很低的詞的機率。在實際的自然語言處理中,一般對出現次數超過某個閾值的詞機率不下調;只對低於這個閾值的詞,機率下調;下調的頻率之和等於未登入詞的機率。

      對於二元組(wi-1,wi)的條件機率估計P(wi|wi-1)也可以做同樣的處理。因通過前一個詞wi-1預測後一個詞wi時,所有可能情況的條件總和應該為1,即

                  

      對於出現次數非常少的二元組(wi-1|wi),它們出現的次數需要按著古德-圖靈的方法打折扣,這樣意味著有一部分機率沒有分配出去,留給了未登入的二元組(wi-1wi)。基於這種思想,估計二元模型機率公式如下:

                 

      其中T是一個閾值,一般在8-10左右,fgt表示經過古德-圖靈估計後的相對頻度。

連結

古德-圖靈估計

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.