python爬蟲之基本知識

來源:互聯網
上載者:User

標籤:res   語言   介紹   爬蟲   values   直接   reason   user   get   

隨著資料的海量增長,我們需要在互連網上選取所需要的資料進行自己研究的分析和實驗。這就用到了爬蟲這一技術,下面就跟著小編一起初遇python爬蟲!

一、要求-回應

在利用python語言實現爬蟲時,主要用到了urllib和urllib2兩個庫。首先用一段代碼說明如下:

1 import urllib2 import urllib23 4 url="http://www.baidu.com"5 request=urllib2.Request(url)6 response=urllib2.urlopen(request)7 print response.read()

我們知道一個網頁就是以html為骨架,js為肌肉,css為衣服所構成的。上述代碼所實現的功能就是把百度網頁的源碼爬取到本地。

其中,url為要爬取的網頁的網址;request發出請求,response是接受請求後給出的響應。最後用read()函數輸出的就是百度網頁的源碼。

二、GET-POST

兩者都是向網頁傳遞資料,最重要的區別是GET方式是直接以連結形式訪問,連結中包含了所有的參數,當然如果包含了密碼的話是一種不安全的選擇,不過你可以直觀地看到自己提交了什麼內容。

POST則不會在網址上顯示所有的參數,不過如果你想直接查看提交了什麼就不太方便了,大家可以酌情選擇。

POST方式:

1 import urllib2 import urllib23 values={‘username‘:‘[email protected]‘,‘Password‘:‘XXXX‘}4 data=urllib.urlencode(values)5 url=‘https://passport.csdn.net/account/login?from=http://my.csdn.net/my/mycsdn‘6 request=urllib2.Request(url,data)7 response=urllib2.urlopen(request)8 print response.read()

GET方式:

import urllibimport urllib2values={‘username‘:‘[email protected]‘,‘Password‘:‘XXXX‘}data=urllib.urlencode(values)url = "http://passport.csdn.net/account/login"geturl = url + "?"+datarequest=urllib2.Request(geturl)response=urllib2.urlopen(request)print response.read()

三、異常處理

處理異常時,用到了try-except語句。

1 import urllib22 3 try:4     response=urllib2.urlopen("http://www.xxx.com")5 except urllib2.URLError,e:6     print e.reason

通過上述的介紹及代碼展示,我們已經初步認識了爬蟲過程,希望對大家有所協助。

python爬蟲之基本知識

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.