四十 Python分布式爬蟲打造搜尋引擎Scrapy精講—elasticsearch(搜尋引擎)倒排索引

來源:互聯網
上載者:User

標籤:arch   通過   body   權重   pos   str   .com   log   位置   

 

倒排索引

倒排索引源於實際應用中需要根據屬性的值來尋找記錄。這種索引表中的每一項都包括一個屬性值和具有該屬性值的各記錄的地址。由於不是由記錄來確定屬性值,而是由屬性值來確定記錄的位置,因而稱為倒排索引(inverted index)。帶有倒排索引的檔案我們稱為倒排索引檔案,簡稱倒排檔案(inverted file)。

 

 

倒排索引原理

就是將一句話進行分詞並記錄分詞所存在的文章,當使用者搜尋字詞時可以直接尋找到當前詞所存在的文章

 

 

 

倒排索引分詞權重記錄(詞瓶)

 分詞權重記錄,是通過(TF-IDF)來實現的,詳情https://baike.so.com/doc/433640-459181.html

 

 

倒排索引待解決的問題

這些問題elasticsearch(搜尋引擎)已經解決

 

四十 Python分布式爬蟲打造搜尋引擎Scrapy精講—elasticsearch(搜尋引擎)倒排索引

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.