電腦時代的中文—-中文的文本挖掘的困難

來源:互聯網
上載者:User

關於分詞和詞頻中文的文本挖掘的困難----關於分詞和詞頻
今天找了個java的統計詞頻的程式,發現對中文根本不能用。
對於英語來說這兩個東西簡單很多,但對於中文真的是很難,因為應為的詞和詞之間都有空格,而中文沒有,就這樣這個程式會把中文的一句話看作一個詞,這樣就沒有意義了,要想把中文的詞提取出來,可能要做更多的工作,而且也會複雜的很多。這個我也不知道怎麼做(現在),但肯定有人做了許多成果了,要不就沒有baidu了,仔細想象baidu對於中文真的很重要。
反過來想象,電腦不是中國人發明的,電腦是根據西方的邏輯作的,這就使得我們的漢語文化作很多努力去適應它........ 或許我們這種語言真的很不適合符號處理。
但還要努力做電腦與中文之間的介面,好的介面........

這真的要花很多時間, 效果也可能不如意.........

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.