標籤:
分享一個擷取代理ip的python函數
| 123456789101112131415161718 |
#coding:utf-8from bs4 import BeautifulSoupimport requestsimport random def getproxyip():headers = {‘Accept‘:‘text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8‘,‘Accept-Encoding‘:‘gzip,deflate,sdch‘,‘Host‘:‘www.ip-adress.com‘,‘User-Agent‘:‘Mozilla/5.0 (Windows NT 6.3; WOW64; rv:24.0) Gecko/20100101 Firefox/24.0‘} proxy_url = ‘http://www.ip-adress.com/Proxy_Checker/‘proxy_req = requests.get(proxy_url,headers=headers)proxy_soup = BeautifulSoup(proxy_req.text)proxy_ip = proxy_soup.find_all(‘tr‘,{‘class‘:‘yellow‘})return proxy_ip[random.randrange(0,4)].td.text |
python編寫的自動擷取代理IP列表的爬蟲
#/usr/local env python
#coding utf-8
import os
import urllib
from bs4 import BeautifulSoup
def log():
f=open("f:\daili.txt",‘a‘)
f.write(ip)
f.close()
def fenxi():
page = urllib.urlopen(url)
data = page.read()
soup=BeautifulSoup(data)
#print soup
list=soup.find_all(‘span‘)
for i in list:
#print i.get_text()
global ip
ip= i.get_text()
s="\n".join(ip.split(‘#‘))
print s
log()
for i in range(1,10):
if i==1:
url = ‘http://www.youdaili.cn/Daili/http/556.html‘
print url
fenxi()
else:
url = ‘http://www.youdaili.cn/Daili/http/556_‘+str(i)+‘.html‘
print url
fenxi()
運行結果:
||||||||IP知識庫最新代理IPwww.Youdaili.Cn07-09免費代理國內外http代理ip地址1.186.200.211:[email protected]#印度
2.135.238.92:[email protected]#哈薩克
2.181.177.7:[email protected]#伊朗
2.183.155.2:[email protected]#伊朗
分享一個擷取代理ip的python函數