python爬蟲---beautifulsoup(2)

來源:互聯網
上載者:User

標籤:容錯   瀏覽器   容錯性   速度慢   c語言   python爬蟲   html   parse   官網   

  之前我們使用的是python的內建的解析器html.parser。官網上面還有一些其餘的解析器,我們分別學習一下。

解析器 使用方法 優點 缺點
htm.parser BeautifulSoup(markup,‘html.parser‘)

1、python內建的

2、解析速度過得去

3、容錯強

2.7之前的版本,和3.3之前不包括2.7的都不支援
lxml`s HTML parser BeautifulSoup(markup,‘lxml‘)

1、非常快

2、容錯強

要安裝C語言庫
lxml`s xml parser 

BeautifulSoup(markup,[‘lxml‘,‘xml‘])

BeautifulSoup(markup,‘xml‘)

1、速度快

2、唯一支援xml的解析器 

需安裝C語言庫
html5lib BeautifulSoup(markup,‘html5lib‘)

1、容錯性最強

2、以瀏覽器方式解析文檔

3、產生html5格式文檔

1、速度慢

2、不依賴外部擴充

  這個瞭解一下就可以了

  

python爬蟲---beautifulsoup(2)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.