標籤:
這一個部分都將只涉及到選擇特徵的某個子集的方法,將高緯度的特徵空間映射到低維度空間的方法(如PCA)都不會涉及到。
一. 單變數
優點:運算速度快,獨立於分類器
缺點:忽略的特徵之間的聯絡,忽略了與分類器的聯絡(在訓練模型的時候不能調參來提高效能)
1. 卡方檢驗
主要內容參考來自 http://blog.sina.com.cn/s/blog_6622f5c30101datu.html
卡方檢驗的思想是同過觀察實際值與理論值的偏差來確定理論正確與否。原假設H0( null hypothesis) 假設觀察值與理論值沒有區別。首先假設原假設成立,基於此算出卡方值,它表示觀察值與理論值的偏離程度。根據卡方分布及自由度可以確定在H0假設成立的情況下獲得當前統計量及更極端情況P。如果P值很小,應當拒絕無效假設。否則就不能拒絕無效假設。
在特徵選取中,我們可以假設原假設H0: 第i個特徵與類別C 不相關,這樣,算出的卡方值越大就說明這個特徵與類別C越相關,也就是說這個特徵越重要。
特徵選取 |
屬於DNA-binding protein |
不屬於DNA-binding protein |
總計 |
包含”AA” |
A |
B |
A+B |
不包含”AA” |
C |
D |
C+D |
總數 |
A+C |
B+D |
N |
A:表示包含AA片段的DNA-binding protein的個數
B:表示包含AA片段的non DNA-binding protein的個數
C:表示不包含AA片段的DNA-binding protein的個數
D:表示不包含AA片段的non DNA-binding protein的個數
原假設:AA片段與DNA-binding protein不相關。
根據原假設,出現在DNA-bindig protein包含的AA的比例應該和所有文檔中包含AA的比例相同,所以,理論值應該是:
同理可以計算D12,D21,D22.
因為我們只需要相對值,所以:
comment: 因為在計算中,並沒有考慮到在一條蛋白質中某個片段出現的頻率,所以一個片段某類蛋白質所有的樣本中出現一次的卡方值會大於,在該類蛋白質99%的樣本中出現10次的片段。這就是“低頻詞缺陷”。
在bioinformatics 中應用卡方檢驗來檢驗某種特徵對特定類別的作用,我想是可行的。但是有個問題,是不是正樣本和負樣本都會包含AA這個片段呢?只是頻度的區別?如果是這樣,那麼這種方法就不可行了。因為它並沒有考慮到某一個蛋白質序列中某個特徵的頻度。但是我還是覺得這個方法可以研究的,需要檢查一下我們組的特徵提取方法,看看是否適用。
Feature Selection 其一 —— Filter Approach