獻給所有想學習正則和採集的朋友_PHP教程

來源:互聯網
上載者:User

function get_url_content($Url,$Method = c) {
//引入需要的語言編碼.如果沒有, 就會預設為utf-8,不必擔心.
global $Charset;
$Urlarr = parse_url($Url);
//如果檢測不出網域名稱,就返回.
if (!isset($Urlarr[host])) {
return false;
}
//我們用智能方式定義header頭倍資訊.
foreach (@getallheaders() as $key => $val){
$key===Host && $val = $Urlarr[host];
$key===Referer && $val =http://.$Urlarr[host];
$str .= "$key:$val, ";
}
//虛擬來路.
!eregi(Referer,$str) && $str .="Referer:http://{$Urlarr[host]}, ";
//經過修正, 基本上, 來路也是那個站, 主機也是Url網站.
$Header = array(trim($str));
//下面僅僅是選擇用哪個程式來採集.
if($Method === f&&function_exists(file_get_contents)) {
$opts = array(
http=>array(
method=>"GET",
header=>$Header,
)
);
$cxContext = stream_context_create($opts);
$file_contents = @file_get_contents($Url, false, $cxContext);
} elseif ($Method === c&&function_exists(curl_init)) {
$Ch = curl_init();
$Timeout = 5;
curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
curl_setopt ($Ch, CURLOPT_URL, $Url);
curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
$file_contents = curl_exec($Ch);
curl_close($Ch);
}
//為了讓樣式顯示得漂亮,我們給它加一句目標引向.
$file_contents = str_replace(,"",$file_contents);
//處理最常見的幾種編碼, 如果目標網站沒有編碼, 就預設為GBK
!preg_match(/charset=([^<>"]*)"/isU,$file_contents,$lang) && $lang[1]=GBK;
function_exists(mb_convert_encoding) && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?UTF-8:$Charset,$lang[1]);
//登出部分代碼;
unset($Url,$lang,$Timeout,$Urlarr,$Charset);
return $file_contents;
}

//測試開始 測試用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html 這是採集不到.
$file = get_url_content("http://www.hao123.com",f);
$file = strip_tags($file,);
preg_match_all(/(http:[^"<>]*)>/isU,$file,$link);unset($link[0]);
$link = $link[1];

//我們來類比獲得資料. 自己更換數字.0-151 下面是用curl方式
$x = 10;
$file = get_url_content($link[$x]);
echo $file;
?>

全部寫上說明, 注釋..

有不明白的回複.. 我來給採集普及一下知識.

原文地址:http://bbs.phpchina.com/viewthread.php?tid=99263

http://www.bkjia.com/PHPjc/486604.htmlwww.bkjia.comtruehttp://www.bkjia.com/PHPjc/486604.htmlTechArticle?php function get_url_content($Url,$Method = c) { //引入需要的語言編碼.如果沒有, 就會預設為utf-8,不必擔心. global $Charset; $Urlarr = parse_url($Url); //如果檢...

  • 聯繫我們

    該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

    如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

    A Free Trial That Lets You Build Big!

    Start building with 50+ products and up to 12 months usage for Elastic Compute Service

    • Sales Support

      1 on 1 presale consultation

    • After-Sales Support

      24/7 Technical Support 6 Free Tickets per Quarter Faster Response

    • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.