七八月總結

來源:互聯網
上載者:User

標籤:實習   總結   大資料   

這倆月,偶很忙~~~~

1. 起初的日子

剛來HW,一切都是新的,小編有點不習慣,由於資訊保密很嚴格,這裡是不能串連外網的,所以小編擷取知識的途徑是自己的知識儲備、查書、向同事請教。小編之前沒有大資料相關的實戰經驗,花了3天的時間便看書便做實驗,掌握了HIVE和PIG處理資料規則。然後PM給我們講解了業務知識,重點涉及到R1,R2,R3這三張表之間的關係及各維度意義。這也是小編第一次接觸到上千維度資料表。其中R3 的資料有1000+億,慢慢就習慣這裡,最開心的是每天都可以玩這些原汁原味的工業資料,兩周的時間,小編對業務知識和工作流程有了基本的掌握,寫了一些處理資料的指令碼。

2. 漸入佳境

時間飛逝,經過兩周的時間,小編很好的融入了團隊。正式進入模型組,小編接手的是任務是對光模組中變壓器進行預警,其背景是HW單板產品的生產廠家,像上海劍橋、海信等各廠每天生產量過千,需要定位出光模組中有問題變壓器的單板,提供預警功能。小編拿到這個工作任務後,確立了3個步驟。首先是提取出光模組中變壓器的相關資料,其次是對提取的資料建模分析,最後是編寫實現該功能的演算法。

  • 提取光模組中變壓器的相關資料

    核心資料主要從R3中提取,小編寫了一個hql指令碼來完成這個任務。由於R3有1000+億的資料,同時還要與R1和R2關聯,整個過程在Hadoop平台用了近3個小時完成。這已經讓小編很開心了,如果放到Oracle上做,這麼大的資料量沒有兩三天是跑不完的。。。分布式平台真的很強大。

  • 建模分析

    驗證提取資料沒有問題之後,就開始了建模工作,小編也是摸著石頭過河。資料採礦本身帶有很多不確定性,小編開始也做了些探索性的工作,將資料集中分成變壓器有問題資料集和沒有問題資料集,然後嘗試了機器學習中的決策樹演算法和SVM演算法,發現效果不好,最後運用線性迴歸,準確性有提升,但效果裡目標還是有差距,小編陷入了困境,怎麼破?另闢蹊徑,從統計學角度出發,小編用CDF模型發現兩者有很好的區分度,達到目標,leader對模型滿意,整個過程小編花了一周的時間,這也是該任務最核心也是比較困難的部分。

  • 實現

    建模階段小編採用的是R,考慮到綜合效能,最終邏輯實現採用的是python,python在處理資料的時候還是要比R快不少,這個過程小編完成還是挺快的,加上最後的測試階段2天就完成了。

3. 難說再見

時間在來去匆匆的日 子裡悄然飛逝,隨著月末的到來,小編完成了變壓器品質預警、溫循前後發送光功率差值預警、老化後發送光功率預警、消光比、BOSA來料品質預警5個功能模組的工作,對於小編來說這些既是挑戰更是機遇,因為知識都是相通的,這段日子會在小編的人生中留下珍貴的記憶,每天的世界裡,很多種事,有的甜蜜,有的溫馨,有的婉轉成歌,有的綿延不息,在這些故事裡,唯一的共通之處就是,某年,某月,某個波瀾不驚的日子裡,曾經很愛很愛你!愛你—這 段忙碌的日子裡,帶給小編的種種的驚喜。

著作權聲明:本文為博主原創文章,未經博主允許不得轉載。

七八月總結

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.