Python在資料科學愛好者中越來越受歡迎了,重要的一點就是它為通用程式設計語言帶來了一個完整的體系。使用python你不僅可以轉換操作資料,而且還可以在單一體系中建立強大的管道命令和機器學習流程。
在Analytics Vidhya,我們都非常喜歡使用python,大多數人拿它作為機器學習的首選工具。另外,如果你想學習深度學習,很明顯,python在這個領域有著比其它程式設計語言更大的優勢,它已經形成了一個成熟的生態體系。
如果你正在為資料科學而學習python,那麼這個測試可以用來協助評估你在這方面的python水平。該測試是作為DataFest2017的一部分進行的,總共近1300人蔘加了這些測試,其中超過300人蔘加了此次測試。
下面是參加這個測試的人的得分情況:
你可以在這個網址獲得最終的得分情況:https://datahack.analyticsvidhya.com/contest/avdatafest-powertool-python-for-data-science/lb
下面列出一些統計結果:
平均分:14.16
中位元:15
眾數:0
Questions & Answers
問題1描述;
想必你肯定看過“How I met your mother”這個娛樂節目,當他們在玩這個遊戲時,一旦有人說“but,um",那麼每個人都必須喝一杯飲料。現在我想改變一下這個遊戲,用你的技術來玩這個遊戲。遊戲的目的就是你需要寫一個代碼來確定一個人在整個遊戲中喝了多少杯飲料。
以下是一個樣本欄位。
提示:已經匯入了python的Regex庫re
1)下面哪一個代碼能完成這個任務。
答案(C)
你需要找到所有的大小寫字母“but",所以C是正確的
問題2描述
給定以下字串:
為了從上面的字串中提取出Email地址的網域名稱(例如“aaa","bbb",…),你寫了下面的代碼:
2) 上面代碼中的“___"處應該填寫什麼是數字呢。
提示:已經匯入了python的Regex庫re
A) 0
B) 1
C) 2
D) 3
答案(C)
參看Regex文法
問題3描述
你的朋友有一個假設 - “所有那些以字母”y“發音結尾的人(例如:Hollie)都是聰明的人。”請注意:這個名字應該以"y"的發音結束,而不能以字母“y"結尾"。現在,你需要根據這個假設從你們學校網站上抓取出這些資料。下面是已經收集到的資料
你寫了下面的代碼來列出所有符合這個假設的人的名單:
3) 在Regex中,"pattern"處應該怎麼寫。
答案(B)
你需要找出所有以"I"或"ie"結尾的字串,所以B是正確的。
問題4描述
給出下面兩個列表:
現在需要將兩個列表的元素合在一塊形成一個新的列表,如下
4) 你會選擇下面哪個選項呢。
答案(B)
5) 假設你已經建立了一個機器學習模型,但是你現在不想用它,過一會再使用。下面哪個命令能滿足這個要求。
提示:庫pickle已被匯入為pkl
答案(C)
問題6描述
將下面的字串轉換成日期值
6) 為了實現這個目的,“date_format"處的運算式應該填寫出什麼。
答案(D)
我已經建立了一個簡單的神經網路用於Image Recognition問題。現在,我想測試是否為隱藏層正確設定了權重和偏差。為了實現這個目的,我需要一個單位矩陣作為輸入。以下是我的單位矩陣:
7) 在python中如何產生這樣的單位矩陣。
提示:庫numpy已匯入為np
答案(A)
選項B應該為np.identity(),選項C的文法是錯誤的。
8) 為了檢測兩個數組是否佔據了同樣的空間,應該怎麼做。
例如,這裡有兩個數組
當你改變第一個數組的值時,第二個數組也會隨著改變。如下所示將第一個數組的前五個數改為0,那麼最終兩個數組的輸出結果如下:
A) 檢查兩個數組的記憶體,如果相互匹配就是一樣的
B) 看“np.array_equal(e, f)”的輸出,如果結果是“True",那麼他們是一樣的
C) 輸出"e.flags"和“f.flags"的值,如果其中一個是”False",則這兩個數組分配了同樣的空間
D) 以上都不對
答案(C)
問題9描述
假設你要將訓練數組(train_set)和測試數組(test_set)都加入到結果數組(resulting_set)中做資料處理,如下;
9) 你怎樣合并這兩個數組。
答案(C)
A和B都是水平放置,但是結果應該是垂直放置。
問題10描述
假設你正在調節Iris資料集的隨機數分布參數
10) 對於“random_state (Seed value)”,下面哪個是最好的值。