標籤:實習 總結 大資料
這倆月,偶很忙~~~~
1. 起初的日子
剛來HW,一切都是新的,小編有點不習慣,由於資訊保密很嚴格,這裡是不能串連外網的,所以小編擷取知識的途徑是自己的知識儲備、查書、向同事請教。小編之前沒有大資料相關的實戰經驗,花了3天的時間便看書便做實驗,掌握了HIVE和PIG處理資料規則。然後PM給我們講解了業務知識,重點涉及到R1,R2,R3這三張表之間的關係及各維度意義。這也是小編第一次接觸到上千維度資料表。其中R3 的資料有1000+億,慢慢就習慣這裡,最開心的是每天都可以玩這些原汁原味的工業資料,兩周的時間,小編對業務知識和工作流程有了基本的掌握,寫了一些處理資料的指令碼。
2. 漸入佳境
時間飛逝,經過兩周的時間,小編很好的融入了團隊。正式進入模型組,小編接手的是任務是對光模組中變壓器進行預警,其背景是HW單板產品的生產廠家,像上海劍橋、海信等各廠每天生產量過千,需要定位出光模組中有問題變壓器的單板,提供預警功能。小編拿到這個工作任務後,確立了3個步驟。首先是提取出光模組中變壓器的相關資料,其次是對提取的資料建模分析,最後是編寫實現該功能的演算法。
-
提取光模組中變壓器的相關資料
核心資料主要從R3中提取,小編寫了一個hql指令碼來完成這個任務。由於R3有1000+億的資料,同時還要與R1和R2關聯,整個過程在Hadoop平台用了近3個小時完成。這已經讓小編很開心了,如果放到Oracle上做,這麼大的資料量沒有兩三天是跑不完的。。。分布式平台真的很強大。
-
建模分析
驗證提取資料沒有問題之後,就開始了建模工作,小編也是摸著石頭過河。資料採礦本身帶有很多不確定性,小編開始也做了些探索性的工作,將資料集中分成變壓器有問題資料集和沒有問題資料集,然後嘗試了機器學習中的決策樹演算法和SVM演算法,發現效果不好,最後運用線性迴歸,準確性有提升,但效果裡目標還是有差距,小編陷入了困境,怎麼破?另闢蹊徑,從統計學角度出發,小編用CDF模型發現兩者有很好的區分度,達到目標,leader對模型滿意,整個過程小編花了一周的時間,這也是該任務最核心也是比較困難的部分。
-
實現
建模階段小編採用的是R,考慮到綜合效能,最終邏輯實現採用的是python,python在處理資料的時候還是要比R快不少,這個過程小編完成還是挺快的,加上最後的測試階段2天就完成了。
3. 難說再見
時間在來去匆匆的日 子裡悄然飛逝,隨著月末的到來,小編完成了變壓器品質預警、溫循前後發送光功率差值預警、老化後發送光功率預警、消光比、BOSA來料品質預警5個功能模組的工作,對於小編來說這些既是挑戰更是機遇,因為知識都是相通的,這段日子會在小編的人生中留下珍貴的記憶,每天的世界裡,很多種事,有的甜蜜,有的溫馨,有的婉轉成歌,有的綿延不息,在這些故事裡,唯一的共通之處就是,某年,某月,某個波瀾不驚的日子裡,曾經很愛很愛你!愛你—這 段忙碌的日子裡,帶給小編的種種的驚喜。
著作權聲明:本文為博主原創文章,未經博主允許不得轉載。
七八月總結