PLSA主題模型

來源:互聯網
上載者:User

標籤:有關   主題   技術分享   src   不同   機率分布   思想   com   em演算法   

主題模型

主題模型這樣理解一篇文章的產生過程:

1、          確定文章的K個主題。

2、          重複選擇K個主題之一,按主題-詞語機率產生詞語。

3、          所有詞語組成文章。

這裡可以看到,主題模型僅僅考慮詞語的數量,不考慮詞語的順序,所以主題模型是詞袋模型。

主題模型有兩個關鍵的過程:

1、          doc -> topic

2、          topic -> word

其中topic -> word是定值,doc -> topic是隨機值。這是顯而易見的,對於不同的文章,它的主題不盡相同,但是對於同一個主題,它的詞語機率應該是一致的。好比記者寫了一篇科技新聞和一篇金融新聞,兩篇新聞的主題分布必然不同,但是這兩篇文章都包含數學主題,那麼對於數學主題出現的詞語應該大致相同。

主題模型的關鍵就是要計算出topic -> word過程,也就是topic-word機率分布。對於一篇新的文章,我們已知它的詞語數量分布,又訓練出了topic-word機率分布,則可以使用最佳化方法分析出文章對應的K個最大似然主題。

PLSA

PSLA主題模型正是上述思想的直接體現,文章產生過程如下

PLSA主題模型圖形化過程如下

 

我們考慮第m篇文檔的產生過程,其中涉及1個doc-topic骰子,K個topic-word骰子。記第m篇文檔為,第m篇文章出現第z個主題的機率為,第z個主題產生詞語w的機率為(這裡與文檔有關係,與文檔沒有關係)。對於某個詞語的產生機率,即投擲一次doc-topic骰子與一次topic-word骰子產生詞語w的機率為

於是第m篇文檔的n個詞語產生機率為

如果我們有M篇文檔,考慮到文檔之間獨立,則所有詞語產生的機率為M個的乘積。

PLSA模型最佳化包含兩個參數求解,可以使用EM演算法計算。讀者有興趣可以參考前面的文章。

 

參考:《LDA數學八卦》

PLSA主題模型

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.