Heritrix源碼分析(六) Heritrix的檔案結構分析

來源:互聯網
上載者:User

   本部落格屬原創文章,歡迎轉載!轉載請務必註明出處:http://guoyunsky.javaeye.com/blog/642618

       歡迎加入Heritrix群(QQ): 109148319 , 10447185(已滿)  , Lucene/Solr群(QQ) :  11897272

       每通過Heritrix運行一次抓取後,發現在該Job目錄下就會有很多檔案。這裡說明下每個檔案的作用,同時更主要介紹它的記錄檔,因為我們可以通過記錄檔發現Heritrix的抓取情況。首先貼個圖:
 
        以上就是Heritrix完成的檔案結構,現在一一說明

 

序號 檔案名稱 說明
1 order.xml Heritrix啟動並執行所有配置,一個order.xml就代表一個抓取任務
2 seeds.txt 種子檔案,Heritrix從裡面的URL開始抓取
3 state Heritrix採用BDB去儲存URL,這個目錄就是bdb目錄
4 scratch 儲存網頁內容,每一個URL網頁內容都對應一對ris和ros檔案
5 logs 儲存了Heritrix抓取時的日誌,會這種介紹。可以從這些記錄檔挖掘抓取情況
6 checkpoints 等同於資料庫的checkpoint,Heritrix可以設定定時,然後定時備份其所有檔案,也就是這裡介紹的所有檔案。同時在做這個操作的時候Heritrix暫停所有抓取.
7 seeds-report.txt 種子抓取彙報,主要針對seeds.txt裡的種子URL做個說明。等下會詳細說明...
8 responsecode-report.txt 抓取URL的伺服器響應代碼以及該代碼的URL個數。等下會詳細說明...
9 processors-report.txt 每個處理器的抓取報告,等下會詳細說明
10 mimetype-report.txt 網頁類型抓取彙報,等下會詳細說明
11 frontier-report.txt 調度器處理報告,等下會詳細說明
12 crawl-report.txt 抓取彙報,等下會詳細說明
13 crawl-manifest.txt 裡麵包含了Heritrix涉及到的檔案
14 hosts-report.txt 域抓取彙報,等下會詳細說明

 

        現在重點說明一下Heritrix的所有記錄檔:

             1.抓取彙報檔案:crawl-report.txt 
                    抓取名字:Crawl Name
                    抓取狀態:Crawl Status
                    抓取用時:Duration Time
                    成功抓取的種子數:Total Seeds Crawled    
                    沒有抓取的種子數:Total Seeds not Crawled 
                    共抓取的host個數:Total Hosts Crawled
                    共抓取的文檔數(URL數):Total Documents Crawled
                    處理速度(文檔/秒):Processed docs/sec
                    寬頻速率(KB/秒):Bandwidth in Kbytes/sec
                    抓取的位元組數:Total Raw Data Size in Bytes
                    共抓取的位元組數:Novel Bytes: 11644599984 (11 GB)

 

           2.調度器彙報:frontier-report.txt 
                   1)隊列描述:
                             處理中隊列:IN-PROCESS QUEUES
                             準備隊列:READY QUEUES
                             延遲隊列:SNOOZED QUEUES
                             不在活動狀態隊列:INACTIVE QUEUES
                             退休隊列:RETIRED QUEUES
                   2)屬性描述:
                              queue:隊列ID,為class key
                              currentSize:當前隊列包含URL個數
                              totalEnqueues:進入該隊列的URL個數
                              sessionBalance:預算值
                              lastCost:上一個URL所花費成本
                              (averageCost):平均成本
                              lastDequeueTime:上一個URL出隊列的時間 
                              wakeTime:醒來的時間 
                              totalSpend/totalBudget:總花費 
                              errorCount:出現錯誤的URL個數 
                              lastPeekUri:上一個擷取的URL 
                             lastQueuedUri:上一個進入隊列的URL

 

          3.抓取host彙報(按urls個數從大到小排序):hosts-report.txt 
                  [#urls]:該host下URL個數
                  [#bytes]:該host下所抓取的位元組數
                  [host]:host 
                  [#robots]:被爬蟲協議拒絕的url個數
                  [#remaining]:剩下還未處理的URL個數

 

         4.網頁類型(一般為text/dns和text/html)抓取彙報:mimetype-report.txt 
                  [#urls]:該網頁類型的url個數
                  [#bytes]:該網頁類型一共處理的位元組數
                  [mime-types]:網頁類型(text/dns和text/html)

 

         5.處理器彙報:processors-report.txt 
                 1)總體彙報:Processors report
                          Job being crawled:該JOB來源的JOB
                          Number of Processors:處理器個數,包括無效的處理器
                          NOTE:處理器說明
                 2)單個Processor彙報:
                          Processor:處理器名
                          Function:處理器功能
                          CrawlURIs handled:該處理器下處理的URL個數
                          Recovery retries:
                          Links extracted:抽取出來的URL個數

 

          6.Http response彙報:responsecode-report.txt 
                         [rescode]:Http response code
                                     1:請求http
                                     200:http成功相應
                                     302:暫時性重新導向
                                     500:http伺服器內部錯誤
                          [#urls]:是該code的URL個數

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.