中文文本情感分析:基於機器學習方法的思路_機器學習

來源:互聯網
上載者:User

1.常用步驟


2.中文分詞

1)這是相對於英文文本情感分析,中文專屬的預先處理。

2)常用方法:基於詞典、基於規則、基於統計、基於字標註、基於人工智慧。

3)常用工具:哈工大—語言云、東北大學NiuTrans統計機器翻譯系統、中科院張華平博士ICTCLAS、波森科技、結巴分詞、Ansj分詞,HanLP。


3.特徵提取

1)文本中拿什麼作為特徵。

2)常用方法:根據詞性(adj、adv、v)、單詞進行組合(unigram、bigram)、位置。

3)使用詞的組合表示文本,兩種方式:詞出現與否、詞出現的次數。


4.特徵選取

1)選擇哪些特徵,如果把所有的特徵都作為特徵計算,那計算量非常大,高維疏鬆陣列。

2)常用方法:去停用詞,卡方,互資訊。

3)常用工具:word2vector ,doc2vec


5.分類模型

1)訓練、測試。

2) 常用方法:樸素貝葉斯、最大熵、svm。


6.評價指標

1)準確率

Accuracy = (TP + TN)/(TP + FN + FP + TN) 反映了分類器統對整個樣本的判定能力——能將正的判定為正,負的判定為負 。

2)精確率

Precision = TP/(TP+FP) 反映了被分類器判定的正例中真正的正例樣本的比重

3)召回率

Recall = TP/(TP+FN) 反映了被正確判定的正例佔總的正例的比重


7.可參考資料

1)中文分詞基本演算法介紹

2)ICTCLAS 漢語詞性標註集

3)文本分類技術

4)文本分類與SVM

5)基於貝葉斯演算法的文本分類演算法

6)基於libsvm的中文文本分類原型

7)LDA-math-文本建模

8)情感分析資源

9)面向情感分析的特徵抽取技術研究

9.1)斯坦福大學自然語言處理第七課-情感分析

10)深度學習、自然語言處理和表徵方法

11)Deep Learning in NLP (一)詞向量和語言模型




聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.