標籤:put row out 讀取 mpi reader return com fan
爬蟲的實質就是開啟網頁原始碼進行匹配尋找,然後擷取尋找到的結果。
/*
* 擷取
* 將正則規則進行對象的封裝。
* Pattern p = Pattern.compile("a*b");
* //通過正則對象的matcher方法字串相關聯。擷取要對字串操作的匹配器對象Matcher .
* Matcher m = p.matcher("aaaaab");
* //通過Matcher匹配器對象的方法對字串進行操作。
* boolean b = m.matches();
*/
package com.js.ai.modules.pointwall.testxfz;import java.io.BufferedReader;import java.io.FileReader;import java.io.IOException;import java.io.InputStreamReader;import java.net.MalformedURLException;import java.net.URL;import java.util.ArrayList;import java.util.List;import java.util.regex.Matcher;import java.util.regex.Pattern;public class Spider {public static List<String> getMailsByWeb() throws IOException{//1,讀取源檔案。URL url=new URL("http://www.cnblogs.com/Renyi-Fan/p/6896901.html");BufferedReader bufr=new BufferedReader(new InputStreamReader(url.openStream()));//2,對讀取的資料進行規則的匹配。從中擷取符合規則的資料.String mail_regex = "\\[email protected]\\w+(\\.\\w+)+";List<String> list=new ArrayList<String>();Pattern p = Pattern.compile(mail_regex);String line = null;while((line=bufr.readLine())!=null){Matcher m = p.matcher(line);while(m.find()){//3,將符合規則的資料存放區到集合中。list.add(m.group());}}return list;}public static List<String> getMails() throws IOException{//1,讀取源檔案。BufferedReader bufr=new BufferedReader(new FileReader("c:\\mail.html"));//2,對讀取的資料進行規則的匹配。從中擷取符合規則的資料. String mail_regex = "\\[email protected]\\w+(\\.\\w+)+"; List<String> list = new ArrayList<String>(); Pattern p = Pattern.compile(mail_regex); String line = null; while((line=bufr.readLine())!=null){ Matcher m = p.matcher(line); while(m.find()){ //3,將符合規則的資料存放區到集合中。 list.add(m.group()); } }return list;}public static void main(String[] args) throws IOException {// List<String> list = getMails();// for(String mail : list){// System.out.println(mail);// }List<String> list=getMailsByWeb();for(String mail:list){System.out.println(mail);}}}
java爬蟲簡單一實例