從資料來源到資料呈現說說目前的情況吧,
資料來源:
1、mysql
2、記錄檔
呈現:
1、csv檔案匯出或者發送郵件
2、提供介面資料給web呈現表徵圖
當前涉及的一些技術點:
從記錄檔讀取資料主要是 shell + awk ,從 mysql 主要是 php 讀取資料存放區到檔案,之後通過 php 或者 shell 來進行一些運算或者統計處理, 相應資料入庫或者發送郵件提供給需求方。
目前項目積累了大量的指令碼,和一些臨時性的解決辦法(零散指令碼),而且隨著資料的增長, mysql 這部分效率也越來越慢, 複雜的指令碼已經變得越來越難維護。這些指令碼有一些是需要的時候手工跑一次,還有很多是定時跑,如果繼續下去已經快不可控了。
尋求一套從資料入口到資料呈現的解決方案,或者是各位有經驗的同學分享分享。
記錄檔儲存在 hadoop 上一部分,目前沒有寫 mapreduce 直接去處理這部分。
->3Q
回複內容:
從資料來源到資料呈現說說目前的情況吧,
資料來源:
1、mysql
2、記錄檔
呈現:
1、csv檔案匯出或者發送郵件
2、提供介面資料給web呈現表徵圖
當前涉及的一些技術點:
從記錄檔讀取資料主要是 shell + awk ,從 mysql 主要是 php 讀取資料存放區到檔案,之後通過 php 或者 shell 來進行一些運算或者統計處理, 相應資料入庫或者發送郵件提供給需求方。
目前項目積累了大量的指令碼,和一些臨時性的解決辦法(零散指令碼),而且隨著資料的增長, mysql 這部分效率也越來越慢, 複雜的指令碼已經變得越來越難維護。這些指令碼有一些是需要的時候手工跑一次,還有很多是定時跑,如果繼續下去已經快不可控了。
尋求一套從資料入口到資料呈現的解決方案,或者是各位有經驗的同學分享分享。
記錄檔儲存在 hadoop 上一部分,目前沒有寫 mapreduce 直接去處理這部分。
->3Q
0、方案取決於你的目標和團隊實力。自建方案的複雜度和你的期望成正比,和資料量成正比。
1、你可以研究一下Splunk或者Logstash + ES + Kibana這兩個方案,相信會有驚喜。
2、如果還想更深入,可以瞭解一下SIEM。
3、Dirty And Quick是一種選擇;Flexable是另一種選擇。
來源資料整理好格式,定好Schema,用Hive統計,用Oozie定時跑作業,結果放在約定好的地方,用Web呈現。
基本上都是這麼個套路。
只能採納一個答案.
其實這是一個討論性的話題,希望有更多的人蔘與吧。