Python入門網路爬蟲之精華版

來源:互聯網
上載者:User

標籤:python   網路爬蟲   

Python入門網路爬蟲之精華版

Python學習網路爬蟲主要分3個大的版塊:抓取分析儲存
另外,比較常用的爬蟲架構Scrapy,這裡最後也介紹一下。
先列舉一下相關參考:寧哥的小站-網路爬蟲

抓取

這一步,你要明確要得到的內容是是什嗎?是HTML源碼,還是Json格式的字串等等。

1. 最基本的抓取

一般屬於get請求情況,直接從伺服器上擷取資料。
首先,Python中內建urllib及urllib2這兩個模組,基本上能滿足一般的頁面抓取。另外,requests也是非常有用的包,與此類似的,還有httplib2等等。

Requests:    import requests    response = requests.get(url)    content = requests.get(url).content # string    print "response headers:", response.headers # dict    print "content:", contentUrllib2:    import urllib2    response = urllib2.urlopen(url)    content = urllib2.urlopen(url).read() # string    print "response headers:", response.headers # not dict    print "content:", contentHttplib2:    import httplib2    http = httplib2.Http()    response_headers, content = http.request(url, ‘GET‘)    print "response headers:", response_headers # dict    print "content:", content

此外,對於帶有查詢欄位的url,get請求一般會將來請求的資料附在url之後,以?分割url和傳輸資料,多個參數用&串連。

data = {‘data1‘:‘XXXXX‘, ‘data2‘:‘XXXXX‘} # dict類型Requestsdata為dict,json    import requests    response = requests.get(url=url, params=data) # GET請求發送 Urllib2data為string    import urllib, urllib2        data = urllib.urlencode(data) # 編碼工作,由dict轉為string    full_url = url+‘?‘+data # GET請求發送    response = urllib2.urlopen(full_url)
2. 對於反爬蟲機制的處理

2.1 類比登陸情況
這種屬於post請求情況,先向伺服器發送表單資料,伺服器再將返回的cookie存入本地。

data = {‘data1‘:‘XXXXX‘, ‘data2‘:‘XXXXX‘} # dict類型Requestsdata為dict,json    import requests    response = requests.post(url=url, data=data) # POST請求發送,可用於使用者名稱密碼登陸情況Urllib2data為string    import urllib, urllib2        data = urllib.urlencode(data) # 編碼工作,由dict轉為string    req = urllib2.Request(url=url, data=data) # POST請求發送,可用於使用者名稱密碼登陸情況    response = urllib2.urlopen(req)

2.2 使用cookie登陸情況
使用cookie登陸,伺服器會認為你是一個已登陸的使用者,所以就會返回給你一個已登陸的內容。因此,需要驗證碼的情況可以使用帶驗證碼登陸的cookie解決。

import requests         requests_session = requests.session() # 建立會話對象requests.session(),可以記錄cookieresponse = requests_session.post(url=url_login, data=data) # requests_session的POST請求發送,可用於使用者名稱密碼登陸情況。必須要有這一步!拿到Response Cookie

若存在驗證碼,此時採用response = requests_session.post(url=url_login, data=data)是不行的,做法應該如下:

response_captcha = requests_session.get(url=url_login, cookies=cookies)response1 = requests.get(url_login) # 未登陸response2 = requests_session.get(url_login) # 已登陸,因為之前拿到了Response Cookie!response3 = requests_session.get(url_results) # 已登陸,因為之前拿到了Response Cookie!

相關參考:網路爬蟲-驗證碼登陸
參考項目:爬取知乎網站

2.3 偽裝成瀏覽器,或者反“反盜鏈”

headers = {‘User-Agent‘:‘XXXXX‘} # 偽裝成瀏覽器訪問,適用於拒絕爬蟲的網站headers = {‘Referer‘:‘XXXXX‘} # 反“反盜鏈”,適用於有“反盜鏈”的網站headers = {‘User-Agent‘:‘XXXXX‘, ‘Referer‘:‘XXXXX‘}Requests:    response = requests.get(url=url, headers=headers)Urllib2:    import urllib, urllib2       req = urllib2.Request(url=url, headers=headers)    response = urllib2.urlopen(req)
3. 使用代理

適用情況:限制IP地址情況,也可解決由於“頻繁點擊”而需要輸入驗證碼登陸的情況。

proxies = {‘http‘:‘http://XX.XX.XX.XX:XXXX‘}Requests:    import requests    response = requests.get(url=url, proxies=proxies)Urllib2:    import urllib2    proxy_support = urllib2.ProxyHandler(proxies)    opener = urllib2.build_opener(proxy_support, urllib2.HTTPHandler)    urllib2.install_opener(opener) # 安裝opener,此後調用urlopen()時都會使用安裝過的opener對象    response = urllib2.urlopen(url)
4. 對於斷線重連
def multi_session(session, *arg):    while True:        retryTimes = 20    while retryTimes>0:        try:            return session.post(*arg)        except:            print ‘.‘,            retryTimes -= 1

或者

def multi_open(opener, *arg):    while True:        retryTimes = 20    while retryTimes>0:        try:            return opener.open(*arg)        except:            print ‘.‘,            retryTimes -= 1

這樣我們就可以使用multi_session或multi_open對爬蟲抓取的session或opener進行保持。

5. 多進程抓取

這裡針對華爾街見聞進行多進程的實驗對比:Python多進程抓取 與 Java多進程抓取
相關參考:關於Python和Java的多進程多線程計算方法對比

6. 對於Ajax請求的處理

對於“載入更多”情況,使用Ajax來傳輸很多資料。它的工作原理是:從網頁的url載入網頁的原始碼之後,會在瀏覽器裡執行JavaScript程式。這些程式會載入更多的內容,“填充”到網頁裡。這就是為什麼如果你直接去耙梳頁本身的url,你會找不到頁面的實際內容。
這裡,若使用Google Chrome分析”請求“對應的連結(方法:右鍵→審查元素→Network→清空,點擊”載入更多“,出現對應的GET連結尋找Type為text/html的,點擊,查看get參數或者複製Request URL),迴圈過程。
* 如果“請求”之前有頁面,依據上一步的網址進行分析推導第1頁。以此類推,抓取抓Ajax地址的資料。
* 對返回的json格式資料(str)進行正則匹配。json格式資料中,需從’\uxxxx’形式的unicode_escape編碼轉換成u’\uxxxx’的unicode編碼。
參考項目:Python多進程抓取

7. 驗證碼識別

對於網站有驗證碼的情況,我們有三種辦法:

  1. 使用代理,更新IP。
  2. 使用cookie登陸。
  3. 驗證碼識別。

使用代理和使用cookie登陸之前已經講過,下面講一下驗證碼識別。
可以利用開源的Tesseract-OCR系統進行驗證碼圖片的下載及識別,將識別的字元傳到爬蟲系統進行類比登陸。如果不成功,可以再次更新驗證碼識別,直到成功為止。
參考項目:Captcha1

分析

抓取之後就是對抓取的內容進行分析,你需要什麼內容,就從中提煉出相關的內容來。
常見的分析工具有Regex,BeautifulSoup,lxml等等。

儲存

分析出我們需要的內容之後,接下來就是儲存了。
我們可以選擇存入文字檔,也可以選擇存入MySQL或MongoDB資料庫等。

Scrapy

Scrapy是一個基於Twisted的開源的Python爬蟲架構,在工業中應用非常廣泛。
相關內容可以參考基於Scrapy網路爬蟲的搭建

著作權聲明:本文為博主原創文章,未經博主允許不得轉載。

Python入門網路爬蟲之精華版

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.