實現文本自動分類的基礎----Term頻率計算方法
據說如今互連網上的文檔每天以100萬的數量增長,這麼大的增長量使得Google可能需要1個月甚至更長的時間才能光顧你的網站一次。所以如果你今天對你的網頁做了最佳化,那麼1個月後在看Google的反應吧。這真是資訊爆炸的年代。互連網剛誕生的時候,通過目錄導航機制,我們就能找到所需要的資訊,Yahoo抓住這個機會成功了;後來隨著互連網的普及,資訊爆炸的速度讓目錄導航失去了效應,Google抓住了這個機會,提出有特色搜尋演算法,讓人們不理會目錄機制也能找到資訊,Google也成功了。可是正如我們不能有了互連網就把報紙丟棄一樣,目錄導航的機制仍然發揮著作用。觀察一下Google的推出的個性搜尋服務就可以發現,為了讓使用者搜尋的內容更相關,Google正鼓勵你使用預定搜尋頻道。
也就是說搜尋的目錄分類機制仍然存在,但是不直接面對終端使用者,而是面對搜尋引擎,即根據文檔內容自動分類。
根據文檔內容自動分類的方法有很多種,本文介紹一下Term頻率計算方法。
向量空間模型的基本思想是把文檔看成一個根據其中字詞出現頻率權重的向量.為了減少資訊的噪音,這裡面的字詞需要經過如下步驟的處理:
1、對文檔進行分詞,取出文檔中包含的所有字詞(term);
2、消除掉沒有意義的字詞(term),比如漢語的:是,的 等;
3、統計計算每個字詞(term)出現的頻率;
4、根據需要過濾掉出現頻率高的那部分詞(term)和出現頻率低的那部分詞(term)(類似綜藝節目中去掉最高分和最低分的做法);
5、處理到這步後,我們假設一共有w個最終的字詞,然後對這些字詞分別標註一個唯一的標記。
處理到這一步,後面的步驟就依演算法的不同而各異了。但有一個共同的特點,就是必須依賴字詞(term)的權重。字詞的權重直接依賴於他們出現的頻率。因為我們要分析的是成千上萬的文檔,所以字詞在一個文檔中出現的頻率並不能說明問題,因此在考慮字詞權重的時候也要考慮多個文檔的因素。
現在我們抽象的考慮一下:
1、假設需要處理的文檔是一個D對象的集合;
2、分類就是一個模糊的A描述,A就是一個D的子集;
3、我們分類的痛點就是區分D對象更加傾向於那個子集A(分類)。
所以這樣看來決定字詞權重的應該包括下面3個部分:
1、字詞本身出現的頻率因素,確定字詞在當前文檔中的重要程度;
2、文檔長度的因素;
3、全部文檔包含Term出現的頻率,確定字詞在全部文檔中的重要程度;
如果能比較準確的得到字詞的頻率,再加上統計的方法,對文檔歸類就應該更加準確吧。