資料採礦-話題識別

來源:互聯網
上載者:User
簡單話題識別的處理步驟:1、tf-idf處理詞的值(idf為150萬篇博文的切詞)。2、切詞並進行統計詞頻,依照tf-idf計算該詞在向量中的維度值 。3、切分標題統計詞頻,標題的權重是3 (統計時,標題的實際詞頻*3) 。4、去掉非名詞的詞語,去掉一些自訂的無意義名詞(像“今,今天”,“時候”等) 。5、取前100個詞,組裝成向量 。6、對向量歸一化處理,目前做的是全部向量轉換成單位長度 1 。7、初始點設定,聚類,目前聚類的簇設定為10 ,質心計算採用的是各維度和取平均值,聚類迭代結束條件(變更的點數小於1個或者迭代次數超過200次)。8、對於每個簇進行統計:找出離簇的中心最近的20個向量(博文);提取分散度(在該簇的多少篇文章中出現過)最高的20個詞。9、對每個文檔簇(博文)的評價指標:文章數、熱度(評論、點擊量的綜合) 。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.