Feature Selection 其一 —— Filter Approach

來源:互聯網
上載者:User

標籤:

這一個部分都將只涉及到選擇特徵的某個子集的方法,將高緯度的特徵空間映射到低維度空間的方法(如PCA)都不會涉及到。

 

一. 單變數

     優點:運算速度快,獨立於分類器

     缺點:忽略的特徵之間的聯絡,忽略了與分類器的聯絡(在訓練模型的時候不能調參來提高效能)

 

1.  卡方檢驗

 

       主要內容參考來自 http://blog.sina.com.cn/s/blog_6622f5c30101datu.html

 

      卡方檢驗的思想是同過觀察實際值與理論值的偏差來確定理論正確與否。原假設H0( null hypothesis) 假設觀察值與理論值沒有區別。首先假設原假設成立,基於此算出卡方值,它表示觀察值與理論值的偏離程度。根據卡方分布及自由度可以確定在H0假設成立的情況下獲得當前統計量及更極端情況P。如果P值很小,應當拒絕無效假設。否則就不能拒絕無效假設。

 

 

 

       在特徵選取中,我們可以假設原假設H0: 第i個特徵與類別C 不相關,這樣,算出的卡方值越大就說明這個特徵與類別C越相關,也就是說這個特徵越重要。

 

特徵選取

屬於DNA-binding protein

不屬於DNA-binding protein

總計

包含”AA”

A

B

A+B

不包含”AA”

C

D

C+D

總數

A+C

B+D

N

 

A:表示包含AA片段的DNA-binding protein的個數

 

B:表示包含AA片段的non DNA-binding protein的個數

 

C:表示不包含AA片段的DNA-binding protein的個數

 

D:表示不包含AA片段的non DNA-binding protein的個數

 

 

 

原假設:AA片段與DNA-binding protein不相關。

 

 

 

根據原假設,出現在DNA-bindig protein包含的AA的比例應該和所有文檔中包含AA的比例相同,所以,理論值應該是:

 

 

 

 

 

        同理可以計算D12,D21,D22.

 

 

 

        因為我們只需要相對值,所以:

 

 

 

 

 

        comment: 因為在計算中,並沒有考慮到在一條蛋白質中某個片段出現的頻率,所以一個片段某類蛋白質所有的樣本中出現一次的卡方值會大於,在該類蛋白質99%的樣本中出現10次的片段。這就是“低頻詞缺陷”。

 

        在bioinformatics 中應用卡方檢驗來檢驗某種特徵對特定類別的作用,我想是可行的。但是有個問題,是不是正樣本和負樣本都會包含AA這個片段呢?只是頻度的區別?如果是這樣,那麼這種方法就不可行了。因為它並沒有考慮到某一個蛋白質序列中某個特徵的頻度。但是我還是覺得這個方法可以研究的,需要檢查一下我們組的特徵提取方法,看看是否適用。

 

Feature Selection 其一 —— Filter Approach

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.