我眼中的搜尋引擎的不足及改進策略

來源:互聯網
上載者:User

大家每天都用SE,但是SE還有很多不算很到位的問題,大家來討論一下吧。

 

1、去重做的很不好。

     比如檢索[編譯Android核心]這個主題,其實,一共很不同的結果只有2~3種(僅限前10頁),但是檢索出來的一大堆內容,很多都是重複的,只不過是不同人不同網站的相互轉載而已,完全沒有做到簡化我們檢索資訊的目的,給我們很大的麻煩。

 

     我預想的解決辦法:綜合閱讀的實現

 

     所謂綜合閱讀,就是在檢索的過程中,SE根據檢索詞彙,自然地收集資訊,然後彙集成一片新的文章,初期,這篇文章可能不是像人寫的完整的文章,更像是百科一樣的樹狀條目,而後期隨著機器智能的提升,這篇文章可能會變成真正人寫成的文章。但是這篇文章可怎麼獲得呢?我覺得針對個別關鍵詞的聚類演算法就應該很有效,之後通過權重文章的聚類數量和rank來綜合成一篇新的文章。

 

2、詞與詞分立

     本來完整的一句話,在SE中檢索,發現得到的結果其實是分詞後檢索的結果,很少可能有這句話本身。而我們在使用整句檢索時,卻是能檢索出很多這句話的。我覺得,這個問題源自SE處理時對詞與詞之間理解,還是做得不夠細緻。

 

    我預想的解決辦法:動態規劃

 

    其實,我們要解決的問題和矩陣連乘很類似,都是有順序的,比如"我是來自黑龍江的數字",這句話的分詞(包括停詞)是(我,是,來自,黑龍江,的,數字)。好了,之後我們分別檢索每個單個詞的結果,之後在檢索距離為2、3。。。k的整句結果,然後綜合這些,k越大給的權重越大,這樣我們就可以得到詞與詞的結合效果。更好的結果是,我們可以通過自然語言的形式分析,得到某些可以合為一類機率更大,從而調整權重!

 

暫時就寫這麼多吧,以後補充。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.