標籤:判斷 常態分佈 c99 sam log amp man 位置 int
Ref:
https://onlinecourses.science.psu.edu/stat464/print/book/export/html/5
Two sample test
t.test(n, t, alternative="two.sided", var.equal=T)
當我們判斷兩個樣本的均值或者中值是否相等時,如果樣本數量足夠大,可以使用t-test。
但是,當兩個樣本的數量都很小時,它們的分布可能是有偏的,所以考慮permutation test。
原理:假設樣本X1有m個資料,均值為mean(X1);X2有n個資料,均值為mean(X2)。定義:Dobs=mean(X1)-mean(X2)
那麼我們可以把m+n個資料放在一起,從中挑m個放到X1裡,剩下的放到X2中。這樣挑的方法共有k種:
計算Di=mean(X1)-mean(X2) for i = 1...k
這樣再與α比較,就可以判斷要不要拒絕原假設。
當然,不止可以比較均值和中值,還可以比較trimmed mean.這三種方法的選擇標準是:
資料接近常態分佈,使用均值的差;
資料分布對稱,但有離群值,使用trimmed mean(去掉極端值)的差;
資料分布不對稱,使用中值的差。
那麼,當m+n比較大時,遍曆所有的Di(i=1...k)就變成一件很耗時的事情。因此,我們希望可以估計這個p值,而不是計數然後計算。
同時,當k很大時,如果我們指定一個遍曆次數,如999,那麼這樣計算出的p值和真實的p值之間的誤差是很小的,因此,我們通過
指定k值,來減少耗時。其他步驟與前面一直,只是迴圈的次數是指定的而已。
兩樣本非參數檢驗。我們首先將兩個樣本的資料合在一起,進行排序。然後計算樣本1的rank的和,使用上面的方法,做permutation
當然,也可以使用樣本2的rank sum。
另外,如果m和n小的話,可以使用表格。對於相等的數,排序時,我們使用均值。
此處參考University of Auckland的講義:
- 相比t-test,Wilcoxon test對離群值更不敏感;
- Wilcoxon test更適合於檢查兩個樣本分布的位置(圖上可以用均值,中值描述),而非形狀等其他方面的區別;
- Mann-Whitney test與Wilcoxon是等價的,雖然test statistic不一樣。
不管原理的話,直接用R就好了啊~
wilcox.test(m, w, alternative="greater", exact=T)
Applied Nonparametric Statistics-lec4