Applied Nonparametric Statistics-lec4

來源:互聯網
上載者:User

標籤:判斷   常態分佈   c99   sam   log   amp   man   位置   int   

Ref:

https://onlinecourses.science.psu.edu/stat464/print/book/export/html/5

Two sample test

  • 直接使用R的t-test

t.test(n, t, alternative="two.sided", var.equal=T)

  • permutation test

當我們判斷兩個樣本的均值或者中值是否相等時,如果樣本數量足夠大,可以使用t-test。

但是,當兩個樣本的數量都很小時,它們的分布可能是有偏的,所以考慮permutation test。

原理:假設樣本X1有m個資料,均值為mean(X1);X2有n個資料,均值為mean(X2)。定義:Dobs=mean(X1)-mean(X2)

那麼我們可以把m+n個資料放在一起,從中挑m個放到X1裡,剩下的放到X2中。這樣挑的方法共有k種:

計算Di=mean(X1)-mean(X2) for i = 1...k

這樣再與α比較,就可以判斷要不要拒絕原假設。

當然,不止可以比較均值和中值,還可以比較trimmed mean.這三種方法的選擇標準是:

資料接近常態分佈,使用均值的差;

資料分布對稱,但有離群值,使用trimmed mean(去掉極端值)的差;

資料分布不對稱,使用中值的差。

那麼,當m+n比較大時,遍曆所有的Di(i=1...k)就變成一件很耗時的事情。因此,我們希望可以估計這個p值,而不是計數然後計算。

同時,當k很大時,如果我們指定一個遍曆次數,如999,那麼這樣計算出的p值和真實的p值之間的誤差是很小的,因此,我們通過

指定k值,來減少耗時。其他步驟與前面一直,只是迴圈的次數是指定的而已。

 

  • Wilcoxon Rank Sum Test

兩樣本非參數檢驗。我們首先將兩個樣本的資料合在一起,進行排序。然後計算樣本1的rank的和,使用上面的方法,做permutation

當然,也可以使用樣本2的rank sum。

另外,如果m和n小的話,可以使用表格。對於相等的數,排序時,我們使用均值。

此處參考University of Auckland的講義:

  • 相比t-test,Wilcoxon test對離群值更不敏感;
  • Wilcoxon test更適合於檢查兩個樣本分布的位置(圖上可以用均值,中值描述),而非形狀等其他方面的區別;
  • Mann-Whitney test與Wilcoxon是等價的,雖然test statistic不一樣。 

 

不管原理的話,直接用R就好了啊~

wilcox.test(m, w, alternative="greater", exact=T)

 

Applied Nonparametric Statistics-lec4

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.