雜談:使用者的搜尋意圖(intention of SE users)

搜尋引擎早已經成為互連網上的最大的應用之一了,可是新聞媒體已經研究人員很難拿到相關的資料來對它進行深入的研究。之所以不知廬山真面目,只緣看不到真正的有價值的資料及其分析。在搜尋引擎領域,使用者的搜尋意圖分析是一個關鍵領域,主要研究的方向是使用者輸入的關鍵詞的真正意圖。就拿最常見的搜尋關鍵詞:木乃伊3下載,這個搜尋的意圖非常明顯,使用者就是要找到能下載木乃伊3的一個網址。另外例如像n73這樣的搜尋字詞,就是一個手機的型號,可以補全到nokia

Regex匹配問題

最近在做URL的分詞。需要找到頂層網域,沒有次層網域的URL,自動增加WWW。比如sina.com    =>  www.sina.com但是 baike.sina.com  就不做任何改動我用了正則String regUrl = "[^\\.^\\/]*\\.(com|co|tv|hk|asia|edu|cn|org|so|net|cc|info|biz|gov|name|me|mobi|tel)(\\.[^\\.^\\/]*)?\\/?.*"; boolean result =

搜尋引擎使用者搜尋意圖分析

你可能會覺得很奇怪,在百度裡會有大量的使用者搜百度、google、MSN、yahoo,同樣在google裡也會有大量的人搜百度、新浪,搜尋者它希望搜尋到什麼結果?搜尋引擎要做到更好的使用者體驗,就不得不去分析搜尋使用者的搜尋意圖。  雅虎的研究專家Andrei Broder將搜尋者的意圖分為三類:  一類是導航型搜尋者,這類搜尋者從某種渠道聽說了一個網站,或者曾經訪問過一個網站但忘記了網域名稱,他們就會試圖通過搜尋這個網站的名稱到達這個網站。例如使用者搜尋起點、天Apsara

LinkedHashMap 和 HashMap的區別

顧名思義LinkedHashMap是比HashMap多了一個鏈表的結構。與HashMap相比LinkedHashMap維護的是一個具有雙重鏈表的HashMap,LinkedHashMap支援2中排序一種是插入排序,一種是使用排序,最近使用的會移至尾部例如 M1 M2 M3 M4,使用M3後為 M1 M2 M4

simhash進行文本查重

有1億個不重複的64位的01字串,任意給出一個64位的01字串f,如何快速從中找出與f漢明距離小於3的字串? 大規模網頁的近似查重主要翻譯自WWW07的 Detecting Near-Duplicates for Web Crawling WWW上存在大量內容近似相同的網頁,對搜尋引擎而言,去除近似相同的網頁可以提高檢索效率、降低儲存開銷。當爬蟲在抓取網頁時必須很快能在海量文本集中快速找出是否有重複的網頁。 論文主要2個貢獻:1.       展示了simhash可以用以海量文本查重2.    

Mahout中分布式bayes實現

Mahout中的bayes實現分為三部分,1.   樣本構建; 通過org.apache.mahout.classifier.BayesFileFormatter來實現,它將一組檔案轉換成label\t term1 term2 term3 …這樣的格式,供後面分類器構造和分類時使用; 程式碼分析在前幾篇博文中提供了;2.   訓練; 通過org.apache.mahout.classifier.bayes.TrainClassifier實現,它會調用BayesDriver來構建的map

解析Simhash演算法

Charikar的simhash演算法對檢測數萬億的儲存層級的相似網頁是非常實用的。作為指紋技術的simhash具有相似文檔的指紋代寫論文只存在很小位元的不同特性。在detecting near-duplicates forwebcrawling一文中驗證了,對於8B的網頁,64位的指紋和k=3是合適的。Simhash是一種降維技術,可以將高維向量映射為位元較小的指紋。它在網頁中的應用過程如下:首先將文檔轉化為特徵碼的集合,每個特徵碼附有一個權值。特徵碼的產生採用IR技術,比如分詞、大小寫轉換、

MapReduce and K-Means Clustering

Google offers slides and presentations on many research topics online including distributed systems.  And one of these presentations discusses MapReduce in the context of clustering algorithms.One of the claims made in this particular presentation

使用mahout實現內容分類

Mahout 目前支援兩種根據貝氏統計來實現內容分類的方法。第一種方法是使用簡單的支援 Map-Reduce 的 Naive Bayes 分類器。Naive Bayes 分類器為速度快和準確性高而著稱,但其關於資料的簡單(通常也是不正確的)假設是完全獨立的。當各類的訓練樣本的大小不平衡,或者資料的獨立性不符合要求 時,Naive Bayes 分類器會出現故障。第二種方法是 Complementary Naive Bayes,它會嘗試糾正 Naive Bayes

mahout貝葉斯分類例子運行及測試異常處理

運行貝葉斯20news分類例子測試拋出異常,已經解決,希望各位指教!同樣參照https://cwiki.apache.org/confluence/display/MAHOUT/Twenty+Newsgroups的步驟,其中關於hadoop與mahout的配置啟動之類的以前的文章都記錄過,此處直接在mahout-0.4上運行例子過程(當然也在mahot-0.3上進行了測試,一切正常)。首先,下載資料集20news-bydate.tar.gz,在$MAHOUT_HOME下的examples/bin

常用的資料結構的一點小區別

Vector和ArrayList在使用上非常相似,都可用來表示一組數量可變的對象應用的集合,並且可以隨機地訪問其中的元素。 Vector的方法都是同步的(Synchronized),是安全執行緒的(thread-safe),而ArrayList的方法不是,由於線程的同步必然要影響效能,因此,ArrayList的效能比Vector好。

mahout中bayes分類分析—1

實現包括三部分:The Trainer(訓練器)、The Model(模型)、The Classifier(分類器)1、訓練首先,要對輸入資料進行預先處理,轉化成Bayes M/R

X協議和包管理

1、X是一套協議,為了支援視窗管理而被設計的。使用X協議,可以實現用戶端的介面渲染;Xfree86是協議的一個實現; 2、基於Qt的KDE和基於gtk的gnome是視窗管理器;它們負責將通過X協議獲得的資料交給X應用程式處理; 3、rpm(red hat packet manager), dpkg(debian packet

Hadoop Core 學習筆記(一) SequenceFile檔案寫入和讀取Writable資料

本部落格屬原創文章,轉載請註明出處:http://guoyunsky.iteye.com/blogs/1265944     剛接觸Hadoop時,對SequenceFile和Writable還產生了一點聯想,以為是什麼神奇的東西.後來也明白,不過就是自己IO的一些協議,用於自己的輸入輸出.這裡介紹下如何從sequence file中讀出和寫入Writable資料.     Writable類似傳輸的資料,相對於Java來說等同於對象,只是引用到Hadoop中需要一套協議去進行傳輸轉換這個對象.

JSON的容錯機制

最近在做一個項目用到了json,測試人員發過來的請求不符合JSON格式,之後我的系統就掛了。呵呵。原因分析:Jsoncpp解析非法json時,會自動容錯成字元類型。對字元類型取下標時,會觸發assert終止進程。後來查了查,可以通過下面兩種方式解決:方案1 對Json::Value取下標前,先判斷(value.type()==Json::objectValue)。方案2 啟用strict 模式,讓非法的json解析時直接返回false,不自動容錯。Json::Features f = Json:

Session和Cookie的區別

關於定義:Session:       HTTP協議(http://www.w3.org/Protocols/)是“一次性單向”協議。服務端不能主動串連用戶端,只能被動等待並回覆用戶端請求。用戶端串連服務端,發出一個HTTP Request,服務端處理請求,並且返回一個HTTP Response給用戶端,本次HTTP Request-Response Cycle結束。     我們看到,HTTP協議本身並不能支援服務端儲存用戶端的狀態資訊。於是,Web Server中引入了session的概念,

輸入與輸出外掛

#include<iostream>#include<cstdio>#include<string.h>#include<algorithm>using namespace std;//bool vis[10];int a[10];int b[10];int n;/*void dfs(int cur){if(cur==n){for(int i=0;i<cur;++i)

mahout中k-means例子的運行

首先簡單說明下,mahout下處理的檔案必須是SequenceFile格式的,所以需要把txtfile轉換成sequenceFile。SequenceFile是hadoop中的一個類,允許我們向檔案中寫入二進位的索引值對,具體介紹請看eyjian寫的http://www.hadoopor.com/viewthread.php?tid=144&highlight=sequencefile       mahout中提供了一種將指定檔案下的檔案轉換成sequenceFile的方式。(You

約瑟夫環問題。。。。。

今天猛然間看見約瑟夫環的遞推演算法,,,感覺很精闢,,,,Josephus(約瑟夫)問題的數學方法無論是用鏈表實現還是用數組實現都有一個共同點:要類比整個遊戲過程,不僅程式寫起來比較煩,而且時間複雜度高達O(nm),當n,m非常大(例如上百萬,上千萬)的時候,幾乎是沒有辦法在短時間內出結果的。我們注意到原問題僅僅是要求出最後的勝利者的序號,而不是要讀者類比整個過程。因此如果要追求效率,就要打破常規,實施一點數學策略。為了討論方便,先把問題稍微改變一下,並不影響原意:問題描述:n個人(編號0~(n

白皮書&&黑白映像

深搜模板題~~~#include<iostream>#include<string.h>#include<string>#define N 100using namespace std;int map[N][N];void dfs(int x,int y){if(!map[x][y]||map[x][y]==-1) return; map[x][y]=-1;dfs(x-1,y+1);dfs(x-1,y);dfs(x-1,y-1);dfs(x,y+1);

總頁數: 61357 1 .... 20901 20902 20903 20904 20905 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.