Time of Update: 2018-12-03
查詢處理以及分詞技術 百度分詞演算法分析(一)請見:http://topic.csdn.net/u/20101231/22/763e8601-972f-4459-acba-47435410a7ed.htmlSpelling
Time of Update: 2018-12-03
原版nutch中對中文的處理是按字劃分,而不是按詞劃分。為適應我們的使用習慣必須加上中文分詞,我加的是 IKAnalyzer。下面是我的方法,我把前台和後台爬蟲用兩種方法實現中文分詞,後台直接替換nutch的analyzer,前台則修改NutchAnalysis.jj(註:我的前台和後台是兩個項目)。前台修改:在src/java/org/apache/nutch/analysis包下找到NutchAnalysis.jj(1) 在
Time of Update: 2018-12-03
本文是我在整合中文分詞paoding時積累的經驗,單獨成一篇文章來重點介紹,重點需要瞭解的有下面幾個檔案,a)外掛程式目錄及外掛程式檔案build.xml,plugin.xml b)nutch-0.9/src/plugin/build.xml c)WEB-INF/classes/nutch-site.xml 然後通過按照下面的方式來配置,執行ant package就可以搞定了,這裡用ant的方式來處理整個編譯發布過程。
Time of Update: 2018-12-03
直觀的講,網路就是一些點和串連這些點的線段。這些線段可以有方向,可以沒有方向(雙向)。方便起見,只看那些紐帶是無方向的網路。 大致上,可以把各種不同的網路按照放在“極端有序”(左邊)到“極端無序”(右邊)這個譜繫上。它們都對應一個唯一的數學表達(N*N的矩陣,N是節點的數目,矩陣裡的元素不是0,就是1)。來源:Bordalier
Time of Update: 2018-12-03
bootstrps bagging boosting這幾個概念經常用到,轉載以備用:他們都屬於整合學習方法,(如:Bagging,Boosting,Stacking),將訓練的學習器整合在一起,原理來源於PAC學習模型(Probably Approximately
Time of Update: 2018-12-03
李博士首先用AdaBoost演算法在Face
Time of Update: 2018-12-03
游標控制命令 命令 游標移動h或^h 向左移一個字元j或^j或^n 向下移一行k或^p 向上移一行l或空格 向右移一個字元G 移到檔案的最後一行nG 移到檔案的第n行w
Time of Update: 2018-12-03
本文首先介紹 Nutch 的背景知識,包括 Nutch 架構,爬蟲和搜尋器。然後以開發一個基於 Nutch的實際應用為例向讀者展示如何使用 Nutch 開發自己的搜尋引擎。在該樣本中,首先帶領讀者開發一個作為 Nutch爬蟲抓取的目標網站,目標網站將被部署在網域名稱為 myNutch.com 的伺服器上。然後樣本說明 Nutch爬蟲如何抓取目標網站內容,產生片斷和索引,並將結果存放在叢集的2個節點上。最後使用 Nutch 檢索器提供的 API開發應用,為使用者提供搜尋介面。簡介Nutch
Time of Update: 2018-12-03
Nutch的搜尋前台的預設搜尋方式是and,也就是所有關鍵詞都必須出現。現在想實現or查詢發現nutch本身並不支援,在去官方論壇搜尋無果,改原始碼無果的情況下想到用外掛程式實現or查詢,於是參照query-base外掛程式改寫了個query-or外掛程式,源碼如下:public class OrQueryFilter implements QueryFilter {private Configuration conf;float myBoost = 0f;private String[]
Time of Update: 2018-12-03
1. 搭建Lucene的開發環境:在classpath中添加lucene-core-2.9.1.jar包 2. 全文檢索搜尋的兩個工作: 建立索引檔案,搜尋索引. 3. Lucene的索引檔案邏輯結構 1) 索引(Index)由若干塊(片段)(Segment)組成 ★2) 塊由若干文檔(Document)組成: 一個檔案對應成一個文檔。資料庫表中的一條記錄映射成一個文檔。 ★3)
Time of Update: 2018-12-03
之前說要專門寫一篇文章說明一下我們的開發板在調試過程中遇到的問題,今天終於有時間了,那我就好好地總結一下。主要是兩個問題。 1、Unable to halt ARM core 開發板做好後,我們就迫不及待地想在Nor Flash裡燒寫Supervivi,看看我們的板子是否能正常工作。燒寫Nor Flash通常有2種方法,一種是通過H-jtag,另一種是通過J-Link。我們首先用的是H-jtag,板子上電後,能夠檢測到ARM9晶片,但是在對Nor
Time of Update: 2018-12-03
MAP(Mean average precision):評價一個rank方法效能的一個指標,現在有很多query,首先看rank方法對各個query來說效能分別是怎麼樣的(也就是AP),再平均起來,就是MAP。AP怎麼算那?舉個例子,現有一個query,與之相關的文檔有4——D1,D2,D3,D4,用rank方法檢索後,D2,D3,D4的排序分別是1,3,5;D1沒有搜尋到。那麼AP = (0 + 1/1 + 2/3 + 3/5)/ 4。發現了麼,第一,相關的卻沒檢索到,AP貢獻為0;分母裡1,
Time of Update: 2018-12-03
下 載: 從tomcat的官方下載新的tomcat版本 http://tomcat.apache.org/download-70.cgi注意,一定要下載非源碼檔案(題目中不帶src的),否則運行tomcat時會出現錯誤:could not find the main class:org.apache.catalina.startup.Bootstrap配置環境變數及其他:(1) sudo gedit /etc/environment加入:
Time of Update: 2018-12-03
轉自http://www.infoq.com/cn/articles/zjl-sns-automatic-mining一.為何要在大規模SNS中挖掘興趣圈子隨著國外的facebook、twitter以及國內的人人、新浪微博等SNS及內容分享平台的逐步流行,如何從上億的海量使用者中自動挖掘興趣圈子成為了一個有趣也非常必要的工作。所謂“興趣圈子”,指的是在同一分享平台下,有著共同的興趣愛好的使用者群體,比如新浪微博裡哪些使用者是對雲端運算感興趣的?他們是否形成了一個密切互動的圈子?對這些資訊的挖掘
Time of Update: 2018-12-03
Lucene是一個優秀的開源全文檢索搜尋項目,很多項目的搜尋模組都是使用Lucene。例如大名鼎鼎的eclipse的協助系統就是使用的Luence作為起做索引的核心。Lucene良好的體繫結構使得其API介面非常方便易用,使得非自然語言處理的專業人員可以不用關心內部的索引結構,也可以很快的搭建起一個搜尋引擎。但是對於進階使用者和專業人員,瞭解其背後使用的索引結構也是必不可少的。
Time of Update: 2018-12-03
原帖http://www.diybl.com/course/3_program/java/javajs/20071018/77925.html----------------------------------1.建立一個新的WebDb (admin db -create);2.將抓取起始URLs寫入WebDB中 (inject); 3.根據WebDB產生fetchlist並寫入相應的segment(generate); 4.根據fetchlist中的URL抓取網頁
Time of Update: 2018-12-03
一、Lucene開發環境配置step1.Java開發環境配置JAVA_HOME=C:/j2sdk1.4.2_04CLASSPATH=.;C:/j2sdk1.4.2_04/lib/tools.jar;C:/j2sdk1.4.2_04/lib/dt.jar;C:/j2sdk1.4.2_04/bin;path=C:/j2sdk1.4.2_04/binstep2.Tomcat安裝環境變數的設定 ,其設定都在使用者變數中,而且登陸的也是相應的使用者。以下是使用者變數中設定的路徑:JAVA_HOME=E:/
Time of Update: 2018-12-03
之前虛擬機器安裝Fedora9的時候,只想用來做嵌入式開發用,因此很多組件都沒有安裝。後面隨著程式的不斷增大和演算法的不斷增加,英文注釋難以讓人看明白了(主要還是自己英文水平比較差),裝一個中文IME的需求就日益迫切了。網上找了很多東西,但都是需要上網安裝的,沒辦法,只好放棄。後來,一不小心點入了一個部落格,他是用iso鏡像安裝的^_^,遂學習之~~
Time of Update: 2018-12-03
Nutch可以對多種格式的資源實現抓取,只需要做一些配置上的修改即可,下面就是一些配製方法1、抓取 pdf|doc|xls|ppt|txt預設情況下可以搜尋txt內容,pdf|doc|xls|ppt 需要配置如下檔案:1. parse-plugins.xml: 指定檔案使用的parser,預設nutch使用了第三方的tika作為parser 2.
Time of Update: 2018-12-03
在索引演算法確定的情況下,最為影響Lucene索引速度有三個參數--IndexWriter中的 MergeFactor, MaxMergeDocs, RAMBufferSizeMB