java - PHP或者python進行資料擷取和分析,有什麼比較成熟的架構?

來源:互聯網
上載者:User
我現在需要對一個網站的文章列表和列表裡面的實際內容進行自動化資料擷取,列表裡面能夠取得每個文章的id,而每個文章又是通過一個統一的介面(參數帶上那個文章id即可擷取到對應的json)裡面又有一部分資料需要採集然後進行資料分析。

目前有什麼比較成熟的架構或者輪子能夠實現我的需求嗎?(要多線程,而且可以7x24小時穩定運行,因為採集數量巨大)

另外問一下,採集到的內容如何儲存(百萬到千萬),資料裡面有一些數字資料,需要進行統計分析,用mysql可以嗎?或者說還有其他更加成熟簡便的輪子可以用嗎?

回複內容:

我現在需要對一個網站的文章列表和列表裡面的實際內容進行自動化資料擷取,列表裡面能夠取得每個文章的id,而每個文章又是通過一個統一的介面(參數帶上那個文章id即可擷取到對應的json)裡面又有一部分資料需要採集然後進行資料分析。

目前有什麼比較成熟的架構或者輪子能夠實現我的需求嗎?(要多線程,而且可以7x24小時穩定運行,因為採集數量巨大)

另外問一下,採集到的內容如何儲存(百萬到千萬),資料裡面有一些數字資料,需要進行統計分析,用mysql可以嗎?或者說還有其他更加成熟簡便的輪子可以用嗎?

如果是資料分析。
map-reduce 做日誌分析
Dpark 可以解決PV和UV的分析
Spark也是不錯的哦。
生產資料報表後可以用Pandas進行分析和展示。。

如果是資料擷取。工具就很多了。

我怎麼覺得你是要搞搜尋引擎呀。。。量比較大。建議分布式的東西。
用MYSQL不太現實。。。

少年, 你這不就是個爬蟲的需求麼?

  1. 爬蟲架構: scrapy

  2. 資料庫選取: 你這個量級用MySQL做好索引完全可以再戰五百年

也可以嘗試用MongoDB

你沒說什麼語言什麼環境。多線程的話,目前一般用nodejs、python。這兩個都可以使用mysql之類的儲存資料。幾百萬上千萬不成問題。

有玩過 python selenium + PhantomJs 嗎?

python語言的這個scrapy這個還是

  • 聯繫我們

    該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

    如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

    A Free Trial That Lets You Build Big!

    Start building with 50+ products and up to 12 months usage for Elastic Compute Service

    • Sales Support

      1 on 1 presale consultation

    • After-Sales Support

      24/7 Technical Support 6 Free Tickets per Quarter Faster Response

    • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.