【轉】倒排索引

來源:互聯網
上載者:User

標籤:

原文連結 http://www.cnblogs.com/surgewong/p/3351863.html

 

倒排索引(Inverted index),顧名思義,是一種反向的索引。

首先我們先來看一下索引的概念,索引好比書的目錄,通過目錄可以快速找到想要的章節。

而倒排索引就相當於知道章節的內容,就可以找到目錄的資訊。

可能這樣子類比還不是很清楚,那麼我們就舉一個簡單的例子來說明一下。

  假設我們有三句話:

  T[0] = "it is what it is"

  T[1] = "what is it"

  T[2] = "it is a banana"

  在這裡,我們的索引是建立在位置(position)和單詞(word)之間建立。

  常規索引是指通過位置找到相應的單詞,比如:T[0]的第一個單詞是it,可以記為 (0,0) : "it",再如 (2,1) : "is"。

  倒排索引則是反過來,通過單詞擷取位置,比如:"it" 這個單詞出現的位置有 (0,0) (0,3) (1,2) (2,0),

這樣可以記為 "it" :{(0,0) (0,3) (1,2) (2,0)}。

通過對上述三句話建立倒排索引可以得到:

  "a"           : {(2,2)}

  "banana"  : {(2,3)}

  "is"          : {(0,1) (0,4) (1,1) (2,1)}

  "it"          : {(0,0) (0,3) (1,2) (2,0)}。

  "what"     : {(0,2) (1,0)}

  通過構建好的倒排索引,使得我們可以很方便的實現對語句的檢索,

比如: 需要檢索包含"what" "is" "it"三個單詞的語句,忽略倒排表中的第二位(單詞在每句中的位置),

可以得到 {0 1}∩{ 0 1 2}∩{0 1 2} = {0 1},因此我們斷定T[0]和T[1]滿足條件。

在檢索 "what is it"這個片語的時候還需要考慮到單詞的具體位置,

因此我們只能夠擷取到 T[1] 滿足條件{(1,0) (1,1) (1,2)}。

  總結,上面的分析可以告訴我們,單詞或語句的檢索在構建好倒排索引之後可以轉化成一個集合求解的問題,

而不用逐行逐字的掃描,這使得檢索效率得到大大地提高,這也就是為什麼倒排索引在搜尋領域如此重要的原因。

同樣有個問題擺在面前,建立倒排索引是非常耗時的。所幸的是這個過程可以離線完成。

  更多的資料資訊請參考百度維基百科,百度百科,以及相關論文等等

【轉】倒排索引

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.