攜程機器學習實習面試

來源:互聯網
上載者:User

2018/3/10更

2018.02.06-攜程面試問題:

(1) 決策樹的節點劃分準則:

1、資訊熵的前後變化-資訊增益 2、資訊增益率 :克服計算資訊增益過程中,由於某特徵取值過大,造成資訊增益大,但是該特徵對分類來說,協助不大,故通過資訊增益率來克服該類問題3、基尼指數:反應樣本集合純度,基尼指數越小,樣本集合純度越高;論文指出,三個準則的選擇對結果不會有太大影響;

(2) 學習率問題:

學習率設定,太大導致跳過最優點,太小導致迭代過程時間較長,改進的辦法是變長度:即在最開始的時候增加步長,往後減小步長;

(3) Xgboost和文本挖掘是否瞭解:

自己要學習一下,一般我是用隨機森林,然後也沒做過文本挖掘相關的東西,根據實習,但是有過純SQL和Python,進行模組開發,自己寫爬蟲爬資料和洗資料;第二家是Cisco,一般是做一些機器學習的Demo,Cisco面試經曆後面會再寫一篇博文,可以關注。

(4) 隨機森林調參問題:

一般是用實驗法,迭代到滿足效能的棵樹,並且取最小值,以減少計算代價損耗;

(5)SQL左串連和右串連區別:

左串連以左表為主表,將右表中與左表欄位相同的資料,形成映射,並保留在左表中,右串連反之;

(6)是否有過機器學習項目:

這裡沒答好,應該準備充分,把簡曆裡面KAGGLE比賽的所有過程所做的東西,講得更加具體,其他公司實習的項目講得細緻一點,自己的論文和公司實習的Demo也是,自己三言兩語帶過,給了第二面技術官一種沒有實踐經驗的感覺。反思。

(7)樣本資料不平衡處理方法:

因為我的第二篇小論文就是這個,所以答的比較好。因為在不平衡資料集上訓練模型,將導致其對小樣本類的識別精度和準確率低、但是小樣本類往往又是及其重要的,例如簡訊欺詐等;處理方法一般是用SMOTE、過採樣、欠採樣技術在資料集上進行相應處理,減少資料集的傾斜率;在演算法層面一般可以用級聯、代價敏感轉化和整合學習(adboost)等;

總結:

這次面試的問題不難,但是感覺自己準備不夠充分、對面試還是缺乏經驗、沒有達到個人的最佳水平,引以為鑒,下次再接再厲。結果還未知,但是我認為每次面試都是一次學習的過程,特此分享,希望對大家有所協助。

最後面試官問你有什麼問題,這個怎麼問。我只是問了公司主要在做什麼,我應該還需要問什麼。當然,突然想到,可以問面試官,我在面試中有什麼不足,協助下次提高。

轉載請註明出處,謝謝。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.