標籤:
之前幾篇博文對nucth抓取周期的幾個命令做了說明,本篇博文將對nutch抓取周期以外的幾個重要的命令的使用進行詳細的說明。
1. mergesegs
合并多個segment為一個segment。
參數:
參數說明:
- output_dir: 輸出目錄
- dir:合并路徑
命令:
bin/nutch mergesegs data2/segments_all -dir data2/segments/
合并結果:
從結果可以看出,是把三個segments合并為了一個segment。
先來看下之前3個segment相關大小:
再來看下合并的結果大小:
從結果來看,大小沒有變,是因為資料量比較小,如果資料量很大的話,效果也會相當的明顯。另外hadoop對於處理大檔案有先天的優勢,所以合并的命令有非常大的作用。
合并的命令有3個:
另外兩個:mergedb和mergelinkdb的使用方法和mergesegs的使用完全一樣,這裡不做詳細說明。
2. invertlinks
反轉串連,得到每一個串連的輸入串連庫。
參數:
參數說明:
- linkdb: linkdb路徑
- dir:輸出路徑
執行命令:
bin/nutch mergesegs data2/segments_all -dir data2/segments/
執行結果:
可以看到,在data目錄下面產生了linkdb目錄了:
3. parsechecker
對一個url進行來源資料的解析以及常值內容的解析。
參數:
參數說明:
執行命令:
bin/nutch parsechecker http://www.cnbeta.com
執行結果:
從執行結果可以看出有213條外鏈,網站簽名等資訊。
4. domainstats
域統計:從crwaldb中計算網域名稱統計資訊。
參數:
參數說明:
- inputDirs:輸入目錄,為crawldb路徑;
- outDir:輸出目錄。
- host|domain|suffix|tld:從小到大的範圍統計。
執行命令:
bin/nutch domainstats data2/crawldb/current/ host hostbin/nutch domainstats data2/crawldb/current/ domian domainbin/nutch domainstats data2/crawldb/current/ suffix suffixbin/nutch domainstats data2/crawldb/current/ tld tld
執行結果如下:
再來看看4個目錄裡面的內容:
5. webgraph
從已經存在的segment從產生一個web graph。
參數:
參數說明:
- segment:單獨或者多個的segment目錄;
- segmentDir:使用的segment的目錄;
- webgraphdb:web graph 資料庫路徑。
執行命令:
bin/nutch webgraph -segmentDir data2/segments/ -webgraphdb data2/webgraphdb
執行結果:
6. nodedumper
查看web graph的內容。
參數:
參數說明:
- asSequenceFile:是否把輸出檔案設定為一個序列檔案;
- group:根據host或者domain分組;
- inlinks:根據輸入串連排序;
- outlinks:根據輸出串連排序;
- sorces:根據分數排序;
- output:輸出目錄;
- topn:根據自然順序顯示N條結果;
- webgraphdb:webgraphdb目錄。
執行命令:
bin/nutch nodedumper -topn 1 -inlinks -output inlinks_topn_1 -webgraphdb data2/webgraphdb
執行結果:
查看結果:
執行命令:
bin/nutch nodedumper -topn 1 -outlinks -output outlinks_topn_1 -webgraphdb data2/webgraphdb
執行結果:
查看結果:
執行命令:
bin/nutch nodedumper -topn 1 -scores -output scores_topn_1 -webgraphdb data2/webgraphdb
執行結果:
查看結果:
7. linkrank
計算分值。
參數:
參數說明:
- webgraphdb:webgraphdb的路徑。
執行命令:
bin/nutch linkrank -webgraphdb data2/webgraphdb
執行結果:
再來通過nodedumper看下分值:
執行命令:
bin/nutch nodedumper -scores -output after_inject_score -topn 1 -webgraphdb data2/webgraphdb
結果:
從中就可以看到分值了。
8. freegen
輕量級抓取:從文字檔裡面產生一個segment,然後對這個segment進行抓取。
參數:
參數說明:
- inputDir:輸入路徑;
- segmentsDir:segments路徑。
執行命令:
mkdir url2vim url2/url.txt//輸入http://cnbbeta.combin/nutch freegen url2 data/segments
執行結果:
可以看到產生了新的segment:
9. indexchecker
對當前所配置的索引的外掛程式進行檢查。
參數:
參數說明:
執行命令:
bin/nutch indexchecker httP://www.163.com
執行結果:
[Nutch]Nutch重要命令使用說明