google的新聞(文章)分類演算法

來源:互聯網
上載者:User

原文: http://www.google.com.hk/ggblog/googlechinablog/2006/07/12_4010.html

 

Google 的新聞是自動分類和整理的。所謂新聞的分類無非是要把相似的新聞放到一類中。電腦其實讀不懂新聞,它只能快速計算。這就要求我們設計一個演算法來算出任意兩篇新聞的相似性。為了做到這一點,我們需要想辦法用一組數字來描述一篇新聞。

 

對於一篇新聞中的所有實詞,我們可以計算出它們的單文本詞彙頻率/逆文本頻率值(TF/IDF)。不難想象,和新聞主題有關的那些實詞頻率高,TF/IDF 度量很大。我們按照這些實詞在詞彙表的位置對它們的 TF/IDF 度量排序。比如,詞彙表有六萬四千個詞,分別為

單詞編號 漢字詞
------------------
1 阿
2 啊
3 阿鬥
4 阿姨
...
789 服裝
....
64000 做作

在一篇新聞中,這 64,000 個詞的 TF/IDF 度量分別為

單詞編號 TF/IDF 度量
==============
1 0
2 0.0034
3 0
4 0.00052
5 0
...
789 0.034
...
64000 0.075


如果單詞表中的某個次在新聞中沒有出現,對應的值為零,那麼這 64,000 個數,組成一個64,000維的向量。我們就用這個向量來代表這篇新聞,並成為新聞的特徵向量。如果兩篇新聞的特徵向量相近,則對應的新聞內容相似,它們應當歸在一類,反之亦然。

學過向量代數的人都知道,向量實際上是多維空間中有方向的線段。如果兩個向量的方向一致,即夾角接近零,那麼這兩個向量就相近。而要確定兩個向量方向是否一致,這就要用到餘弦定理計算向量的夾角了。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.