標籤:
著作權說明:內容來自互連網及書籍
一、資料擷取方法1.資料來源一手資料:資料的直接來源。二手資料:資料的間接來源。內部來源:比如財務報表,包括會計計算,成本資料等。外部來源:比如各類統計年鑒等,調查機構發布的資料等。
2. 抽樣方法1. 分類
按照樣本抽取方式不同分為:有放回抽樣,無放回抽樣
2.非機率抽樣
3. 機率抽樣方法分類
機率抽樣主要分為 簡單隨機抽樣, 系統抽樣, 分類抽樣, 整群抽樣, 多階段抽樣... 現實生活中絕大多數 抽樣調查都採用機率抽樣方法來抽取樣本。
4.簡單隨機抽樣的樣本量
二、市場調研市場調研:對營銷決策相關的資料進行計劃、收集和分析,並把分析結果向管理者溝通的過程。
1. 市場調研的過程1. 不同的營銷調研目標(識別問題、需要什麼資訊)2. 產生調研設計(描述性研究、還是因果性研究)3. 選擇調研方法(調查法、實驗法、觀察法)4. 選擇抽樣方法 5. 收集資料6. 分析資料7. 撰寫並提交報告8. 跟蹤
2. 調查問卷1.問卷分類(1)結構型問卷:封閉式問卷、開放式問卷、半封閉式問卷(2)非結構型問卷: 事先不準備表格、提問方式和標準化的備選答案,只是按照調查放向和詢問內容,和被調查者自由交談的問卷。2. 封閉式和開放式問卷
3. 問卷設計原則目的性原則順序性原則簡明性原則匹配性原則可接受原則
4. 問題的類型
5. 問卷編碼
各色各樣的問卷題目的類型大致可以分為單選、多選、排序、開放題目四種類型,他們的變數的定義和處理的方法各有不同,我們詳細舉例介紹如下:
1 單選題:答案只能有一個選項
例一 當前貴組織機構是否設有面向組織的職業生涯規劃系統?
A有 B 正在開創 C沒有 D曾經有過但已中止
編碼:只定義一個變數,Value值1、2、3、4分別代表A、B、C、D 四個選項。
錄入:錄入選項對應值,如選C則錄入3
2 多選題:答案可以有多個選項,其中又有項數不定多選和項數定多選。
(1)方法一(二分法):
例二 貴處的職業生涯規劃系統工作涵蓋哪些組群?畫鉤時請把所有提示考慮在內。
A月薪員工 B日薪員工 C鐘點工
編碼:把每一個相應選項定義為一個變數,每一個變數Value值均如下定義:“0” 未選,“1” 選。
錄入:被調查者選了的選項錄入1、沒選錄入0,如選擇被調查者選AC,則三個變數分別錄入為1、0、1。
(2)方法二:
例三你認為開展保持黨員先進性教育活動的最重要的目標是那三項:
1( ) 2 ( ) 3( )
A、提高黨員素質
A、提高黨員素質 B、加強基層組織 C、堅持發揚民主
D、激發創業熱情 E、服務人民群眾 F、促進各項工作
D、激發創業熱情 E、服務人民群眾 F、促進各項工作
編碼:定義三個變數分別代表題目中的1、2、3三個括弧,三個變數Value值均同樣的以對應的選項定義,即:“1” A,“2” B,“3” C,“4” D,“5” E,“6” F
錄入:錄入的數值1、2、3、4、5、6分別代表選項ABCDEF,相應錄入到每個括弧對應的變數下。如被調查者三個括弧分別選ACF,則在三個變數下分別錄入1、3、6。
[註:能用方法二編碼的多選題也能用方法編碼,但是項數不定的多選只能用二分法,即方法一是多選題一般處理方法。]
3 排序題: 對選項重要性進行排序
例四 您購買商品時在 ①品牌 ②流行 ③品質 ④實用 ⑤價格 中對它們的關注程度先後順序是(請填代號重新排列)
第一位 第二位 第三位 第四位
第一位 第二位 第三位 第四位 第五位
編碼:定義五個變數,分別可以代表第一位 第五位,每個變數的Value都做如下定義:“1” 品牌,“2” 流行,“3” 品質,“4” 實用,“5” 價格
錄入:錄入的數字1、2、3、4、5分別代表五個選項,如被調查者把品質排在第一位則在代表第一位的變數下輸入“3“。
4 選擇排序題:
例五 把例三中的問題改為“你認為開展保持黨員先進性教育活動的最重的目標是那三項,並按重要性從高到低排序”,選項不變。
編碼:以ABCDEF6個選項分別對應定義6個變數,每個變數的Value都做同樣的如下定義:“1” 未選,“2” 排第一,“3” 排第二,“4” 排第三。
錄入:以變數的Value值錄入。比如三個括弧裡分別選的是 ECF,則該題的6個變數的值應該分別錄入:1(代表A選項未選)、1、 3(代表C選項排在第二)、1、2、4。
[註:該方法是對多選題和排序題的方法結合的一種方法,對一般排序題(例四)也同樣適用,只是兩者用的分析方法不同(例四用頻數分析、例五用描述分析),輸出結果從不同的側面反映問題的重要性(前一種方法從位次從變數的頻數看排序,後一種方法從變數出發看排序)。]
5 開放性數值題和量表題:這類題目要求被調查者自己填入數值,或者打分
例六 你的年齡(實歲):______
編碼:一個變數,不定義Value值
錄入:即錄入被調查者實際填入的數值。
6開放性文字題:
如果可能的話可以按照含義相似的答案進行編碼,轉換成為封閉式選項進行分析。如果答案內容較為豐富、不容易歸類的,應對這類問題直接做定性分析。
三、資料預先處理方法1. 資料預先處理的基本步驟
(1)資料清洗 —— 去雜訊和無關資料
(2)Data Integration —— 將多個資料來源中的資料結合起來存放在一個一致的資料存放區中
(3)資料變換 —— 把未經處理資料轉換成為適合資料採礦的形式
(4)資料規約 —— 主要方法包括:資料立方體聚集,維度歸約,資料壓縮,數值歸約,離散化和概念分層等。
2. 資料清洗
(1)處理缺失值
(2)平滑雜訊值
BIN方法(分箱):通過考察鄰近值,來光滑有序資料的值
聚類方法
(3)識別和處理異常值
異常值outlier:指樣本中的個別值,其數值明顯偏離它(或他們)所屬樣本的其餘觀測值,也稱異常資料,離群值
識別方法:
處理方法:蓋火鍋法
(4)解決不一致問題
3. Data Integration
(1)、實體識別問題
資料分析多半涉及Data Integration。Data Integration將多個資料來源中的資料合併,存放那個在一個一致的資料存放區中,如存放在資料倉儲中。這些資料來源可能包括多個資料庫、資料立方體或一般檔案。
自Data Integration時,有許多問題需要考慮。模式整合和對象匹配可能需要技巧。來自多個資訊源的現實世界的等價實體如何才能“匹配”?這涉及實體識別問題。例如,資料分析者或者電腦如何才能確定一個資料庫的customer_id與另一個資料庫中的cust_number指的是相同的屬性呢 ?每個屬性的中繼資料套件括名字、含義、資料類型和屬性的允許取值範圍,以及處理空白、零或NULL值得空值規則。這樣的中繼資料可以用來協助避免模式整合的錯誤。中繼資料還可以用於變換資料(例如,pay_type的資料編碼在一個資料庫中可以是“H”和“S”,而在另一個資料庫中是1和2)。因此,這一步也與前面介紹的資料清理有關。
在整合期間,當一個資料庫的屬性和另一個資料庫的屬性匹配時,必須特別注意資料的結構。這旨在確保源系統中的函數和參考約束與目標系統中的匹配。例如,在一個系統中,discount可以用於訂單,而在另外一個系統中,它被用於訂單內的商品。如果在整合之前未發現,則目標系統中的商品可能被不正確地打折。
(2)、冗餘和相關分析
冗餘是Data Integration的另一個重要問題。一個屬性(例如,年度營收)如果能由另一個或另一組屬性”匯出”,則這個屬性可能是冗餘的。屬性或維命名的不一致可能導致結果資料集中的冗餘。
有些冗餘可以被相關分析檢測到。給定兩個屬性,這種分析可以根據可用的資料,度量一個屬效能在多大程度上蘊涵另一個。對於標稱資料,我們使用x^2(卡方)檢測。對於數值屬性,我們使用相關係數(correlation coefficient)和共變數(covariance),他們都評估一個屬性的值如何隨另一個變化。
(3)、元組重複
除了檢測屬性間的冗餘外,還應當在元組級檢測重複。去規範表是資料冗餘的另一個來源。不一致通常出現在各種不同的副本之間,由於不正確的資料輸入,或者由於更新了資料庫的某些地方,但未更新所有的。
4. 資料變換
(1)資料的泛化和聚集(2)資料標準化:最大最小規範 z-score規範 小數定標
min-max標準化(Min-max normalization)
也叫離差標準化,是對未經處理資料的線性變換,使結果落到[0,1]區間,轉換函式如下:
其中max為樣本資料的最大值,min為樣本資料的最小值。這種方法有一個缺陷就是當有新資料加入時,可能導致max和min的變化,需要重新定義。
z-score 標準化(zero-mean normalization)
也叫標準差標準化,經過處理的資料符合標準常態分佈,即均值為0,標準差為1,其轉化函數為:
其中μ為所有樣本資料的均值,σ為所有樣本資料的標準差。
5. 資料消減(1)維數消減:主成分分析,變數群集(2)離散化(連續)(3)分類重組(離散)
資料擷取及預先處理