Python之爬蟲工具包__Python

來源:互聯網
上載者:User

requests包:是一個實用的python的http用戶端庫,編寫爬蟲從web上爬取資料時經常用到 ,簡單實用,介面簡單 ,requests.get(URL)。


lxml包:主要用來解析通過requests抓取的html內容,從中提取出我們需要的資料,在對html常值內容進行提取、篩選時用到的是xpath文法 ,lxml使用的是xpath文法對html內容進行的定位篩選提取。


lxml包的使用: 
通過lxml工具可以從html代碼中提取我們需要的資料
一個網頁就是一個html的檔案  
需要通過lxml對一個html格式的檔案內容進行組織(組織成一個樹形結構) 
html檔案是一個樹形結構 - 類型linux系統的目錄結構  
通過lxml組織成樹形結構後,然後再使用xpath文法對內容進行定位、篩選、過濾


xpath的文法使用: 
路徑表示(使用xpath文法來表示xml文本中標籤的路徑)
//div  定位到根節點下的所有的div標籤,並返回一個可迭代對象
//div[class="j-r-list-c-desc"]/hl/text()   提取某個標籤下的文本資料
/@href   提取的是某個標籤下的屬性名稱為href的屬性值

篩選條件 
//div[@class="link"] 定位到根目錄下的包含class屬性並且屬性值為link的div標籤
//div[li]  篩選出根目錄下所有的包含li子標籤的div標籤
//div[@class] 篩選出包含class屬性的div標籤

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.