Python即時網路爬蟲項目啟動說明詳解,python項目啟動

來源:互聯網
上載者:User

Python即時網路爬蟲項目啟動說明詳解,python項目啟動

作為酷愛編程的老程式員,實在按耐不下這個衝動,Python真的是太火了,不斷撩撥我的心。

我是對Python存有戒備之心的,想當年我基於Drupal做的系統,使用php語言,當語言升級了,推翻了老版本很多東西,不得不花費很多時間和精力去移植和升級,至今還有一些隱藏在某處的代碼埋著雷。我估計Python也避免不了這個問題(其實這種聲音已經不少,比如Python 3 正在毀滅 Python)。 但是,我還是啟動了這個Python即時網路爬蟲項目。我用C++、Java和Javascript編寫爬蟲相關程式超過10年,要追求高效能,非C++莫屬,同時有完善的標準體系,讓你和你的系統十分自信,只要充分測試,就能按照預期的方式運行。在GooSeeker項目中,我們不斷向一個方向努力——“收割資料”,而且讓廣大使用者(不僅是專業的資料擷取使用者)都能體驗到收割互連網資料的快感。“收割”的一個重要含義就是大批量。現在,我要啟動“即時網路爬蟲”,目的是要補充“收割”沒有覆蓋的情境,我看到的是:

  • 在系統層面:“即時”代錶快速部署資料應用系統
  • 在資料流層面:“即時”代表採集資料到資料使用是即時的,單個資料對象可以獨自全流程處理,不用等待一批存入資料庫,然後從資料庫中拿出來用
  • “即時”另一個含義就是網路爬蟲是一個嵌入模組,跟整個資訊處理系統整合在一起

        一眾程式員都在玩Python網路爬蟲,我擬定了一個計劃:建立一個模組化更強的軟體組件,專門解決最耗費精力的內容提取問題(有人總結說大資料和資料分析整個鏈條上,資料準備佔了80%工作量,我們不妨延展一下,網路資料抓取的工作量有80%是在為各種網站的各種資料結構編寫抓取規則)。

        我把他想象成一個小機器(見),輸入的是原始網頁,輸出的是提取出來的結構化的內容,這個小機器還有一個可替換組件:將輸入轉化成輸出結構的一個指令塊,我們成為“提取器”,讓大家不再為調試Regex或者XPath而苦惱。

        這是一個開放的項目,兩年前啟動了一個手機上的即時網路爬蟲項目,因為是給某商業集團開發的,所以不便開放,同樣的思想和方法將開放到這個項目中,而且用當前最熱的python來做,希望大家能共同參與。在執行過程中,我們會開放所有資料和成果、已經遇到的坑。

近期做的實驗是

python使用xslt提取網頁資料
Python爬蟲使用Selenium+PhantomJS抓取Ajax和動態HTML內容

以上就是本文的全部內容,希望對大家的學習有所協助,也希望大家多多支援幫客之家。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.