python.beatifulsoup入門,pythonsoup
最先想試試python的爬蟲功能,於是用easy_install安裝了beautifulsoup,下面是我寫的demo代碼,可以簡單看看
#coding=utf-8import urllib2from BeautifulSoup import BeautifulSoup as bsurl_addr = 'http://car.autohome.com.cn/baoyang/detail_74_442_0_0_0_57.html'def save_to_file(content, fileName):with open(fileName, 'w+') as f:if not f:return Falsef.write(content)f.close()def parse_content(content):soup = bs(content)tds = soup.findAll('td')for i in tds:print i.textdef is_unicode(c):if isinstance(c, unicode):return Truereturn Falsedef is_asii(c):if isinstance(c, str):return Truereturn Falseif __name__ == '__main__':content = urllib2.urlopen(url_addr).read()#對於任何格式的str先轉換為中間編碼unicode#調用decode轉換為unicode編碼【根據自身的編碼】#然後再調用encode將unicode轉換為指定的編碼#將content【編碼為gb2312】轉換為unicode編碼c = content.decode('gb2312')print('c is unicode:', is_unicode(c))#print(c)save_to_file(c.encode('gb2312'), 'd:/content.html')parse_content(content)