python —— 文本特徵提取 CountVectorize

來源:互聯網
上載者:User

標籤:voc   參數表   token   get   csdn   文章   fit   ali   規則   

CountVectorize

來自:python學習 文本特徵提取(二) CountVectorizer TfidfVectorizer 中文處理 - CSDN部落格

80930801

常用資料輸入形式為:列表,列表元素為代表文章的字串,一個字串代表一篇文章,字串是已經分割好的CountVectorizer同樣適用於中文
參數表 作用
stop_words 停用詞表;自訂停用詞表
token_pattern 過濾規則;

 

屬性工作表 作用
vocabulary_ 詞彙表;字典型
get_feature_names() 所有文本的詞彙;列表型
stop_words_ 返回停用詞表

CountVectorizer是通過fit_transform函數將文本中的詞語轉換為詞頻矩陣,矩陣元素a[i][j] 表示j詞在第i個文本下的詞頻。即各個詞語出現的次數,通過get_feature_names()可看到所有文本的關鍵字,通過toarray()可看到詞頻矩陣的結果。

方法表 作用
fit_transform(X) 擬合模型,並返迴文本矩陣

python —— 文本特徵提取 CountVectorize

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.