python爬蟲常用的模組分析_python

來源:互聯網
上載者:User

本文對Python爬蟲常用的模組做了較為深入的分析,並以執行個體加以深入說明。分享給大家供大家參考之用。具體分析如下:

creepy模組

某台灣大神開發的,功能簡單,能夠自動抓取某個網站的所有內容,當然你也可以設定哪些url需要抓。

地址:https://pypi.python.org/pypi/creepy

功能介面:

set_content_type_filter:
設定抓取的content-type(header中的contenttype)。包括text/html

add_url_filter:
過濾url,傳入的可以是Regex

set_follow_mode:
設定遞迴模式,F_ANY:該頁面上所有連結都會抓取。 F_SAME_DOMAIN和F_SAME_HOST類似。即同一個網域名稱的都會抓取。F_SAME_PATH:同一路徑的抓取。例如bag.vancl.com/l1/d3/1.jpg path為l1/d3/1.jpg,則path為l1/d3/*的都會抓取。這裡可以根據需要增加自己的遞迴模式

set_concurrency_level:
設定線程最大數

process_document:
一般需要重寫,處理網頁內容,提取自己需要的內容。

selenium
可視化介面,抓取自動化,api使用超簡單,完全像是自己在操作瀏覽器。

官方網站:http://www.seleniumhq.org/
python官方網站
http://pypi.python.org/pypi/selenium
webdriver api(很好用,建議多瞭解一下)
http://www.seleniumhq.org/docs/03_webdriver.jsp

以下是一個抓取凡客網站的例子:

from selenium import webdriverfrom selenium.webdriver.common.keys import Keysimport timebrowser = webdriver.Firefox()browser.get('http://bag.vancl.com/28145-28167-a18568_18571-b1-n3-s1.html#ref=hp-hp-hot-8_1_1-v:n')elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search boxtime.sleep(1)print elem.get_attribute("href")elem.click()time.sleep(1)elem = browser.find_element_by_name('ch_bag-3-page-next') # Find the search boxprint elem.get_attribute("href")elem.click()

希望本文所述對大家的Python程式設計有所協助。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.