Time of Update: 2018-08-23
最近接到了一些真實的資料,資料中包含著許多缺失值,如何對缺失值處理,能更好的為我們做資料分析,更高效率的建模,縮小在測試集上預測性分析的偏差,當然這個偏差越小我們肯定越高興的。 資料準備 我用的是一份地理樣本資料,裡面有座標,各種物質成分(Ca,N,P等) 對於缺失資料的檢驗,有多個方法。 第一種: library(VIM) aggr(env,prop=T,numbers=T) 函數用法,可以在控制台載入完包後help()或者?函數
Time of Update: 2018-08-23
統計類比隨機數分布 1.什麼是中心極限定理。 2.二項分布類比中心極限定理 (也稱為拉普拉斯定理) #首先產生二項分布隨機數m=100;n=10;p=0.25z <- rbinom(m,n,p) #對100個二項分布隨機數進行標準化x <- (z-n*p)/sqrt(n*p*(1-p))hist(x,prob=T,main=paste("n=",n)) #添加正態曲線curve(dnorm(x),add=T) 用函數來進行類比sim.clt <-
Time of Update: 2018-08-23
K-Means演算法 這是基於劃分的聚類演算法,該演算法效率較高,對大規模資料進行聚類時被廣泛使用。 基本思路:把資料集劃分成k個簇,每個簇內部的樣本非常相似,不同簇之間的差異非常大。 K-Means演算法是一個迭代演算法,先隨機播放k個對象,每個對象代表了起中心,對於剩下的對象,將其賦給最近的簇,然後重新計算簇的中心。不斷重複,直到準則函數收斂。 演算法: 1 資料預先處理 l 連續屬性:標準化,如
Time of Update: 2018-08-23
該包主要用於資料清洗和整理,coursera課程連結:Getting and Cleaning Data 也可以載入swirl包,載入課Getting and Cleaning Data跟著學習。 如下: library(swirl)install_from_swirl("Getting and Cleaning Data")swirl() 此文主要是參考R內建的簡介:Introduce to dplyr 1、示範資料 >
Time of Update: 2018-08-23
引言 本學期也開了一門多元統計分析課程,也趁機想把課後上機題實現一遍,以增強理解。 教材使用的是約翰遜的《多元統計分析》第六版,中英文版教材、資料集、講義見 還參考了王斌會老師的《多元統計分析及R語言建模》 本文內容主要為第4章多元常態分佈的上機題,圖略。 [rmd文檔見](http://pan.baidu.com/s/1ntkuXQT) 可以直接用Rstudio開啟(之前先安裝knitr包) 4.28 data_4.28<-read.table("E:\\研究生\\
Time of Update: 2018-08-23
<span style="font-family: 'Helvetica Neue', Helvetica, Arial, sans-serif; background-color: rgb(255, 255, 255);"></span> <span style="font-family: 'Helvetica Neue', Helvetica, Arial, sans-serif; background-color: rgb(255, 255, 255);"
Time of Update: 2018-08-23
說明 ks-Kolmogorov-Smirnow,這種檢測常被用來應用於比較樣本是否符合某個已知分布,而雙樣本的KS檢測兩個資料集累積分布的比較。 產生常態分佈樣本資料(單樣本) 檢測資料集X是否符合常態分佈,100個數x = rnorm(100)ks.test(x,"pnorm) One-sample Kolmogorov-Smirnov testdata: xD = 0.12261, p-value = 0.09889alternative hypothesis: two-
Time of Update: 2018-08-23
一、統計學基本原理 1 兩樣本t檢驗的條件:①兩總體都服從常態分佈;②兩總體方差相等,即方差齊性。 2 配對t檢驗的條件:差值的總體服從常態分佈即可。 二、使用R進行正態性檢驗和方差齊性檢驗 1 正態性檢驗 1.1 ①Shapiro-Wilk檢驗(W檢驗):n≤50;②Shapiro-Francia檢驗(W’檢驗):50<n<100. #R語言實現:W/W'檢驗,Sample size:3 < n < 5000
Time of Update: 2018-08-23
題目1 : 分隔相同字元 時間限制: 10000ms 單點時限: 1000ms 記憶體限制: 256MB 描述 給定一個只包含小寫字母'a'-'z'的字串 S ,你需要將 S 中的字元重新排序,使得任意兩個相同的字元不連在一起。
Time of Update: 2018-08-23
R是用於統計分析、繪圖的語言和作業環境。R是屬於GNU系統的一個自由、免費、原始碼開放的軟體,它是一個用於統計計算和統計製圖的優秀工具。它是一套由資料操作、計算和圖形展示功能整合而成的套件。包括:有效資料存放區和處理功能,一套完整的數組(特別是矩陣)計算操作符,擁有完整體系的資料分析工具,為資料分析和顯示提供的強大圖形功能,一套(源自S語言)完善、簡單、有效程式設計語言(包括條件、迴圈、自訂函數、輸入輸出功能)。 如何用RStudio做分位元圖呢。
Time of Update: 2018-08-23
一幅圖解決R語言繪製圖例的各種問題 2016-11-01 用R畫圖的小夥伴們有木有這樣的感受,“命令寫的很完整,運行沒有報錯,可圖例藏哪去了。”“圖畫的很美,怎麼總是圖例不協調。”“啊~~啊,抓狂,圖例蓋住關鍵的點了。”“怎麼才能讓圖例指哪站哪。” “圖例太長怎麼辦”…… 吐槽吐到累,不如多掌握幾個圖例(Legend)的軟肋,更好地利用R語言繪圖。 legend(x, y = NULL, legend, fill = NULL,
Time of Update: 2018-08-23
1、如何用R語言畫二元常態分佈的曲面圖形 下面主要用兩種技術來實現: 注意:z 的列維是 y 的長度,行維是 x 的長度(即 z 包含每一種可能的 (x, y) 點 的值) 第一種使用 persp(x, y, z)函數:下面看代碼 fn = function(x, y) { sigma <- matrix(c(20,0,0,20), c(2,2)) u <- c(0,0)
Time of Update: 2018-08-23
在資料分析中如果某個資料服從常態分佈的話,我們可以利用常態分佈的性質做出很多有意義的分析,例如t-檢驗。。 如何檢驗樣本是否服從常態分佈。 可以使用Q-Q圖來進行檢驗,Q-Q圖是一個散佈圖,點(x, y)表示資料x的某個分位元,y表示和x的分位元相同的分位元(即 FX(x)=FY(y) ),如果說兩個分布的QQ圖在一條直線上,則說明每個 [xi,xi+1],[yi,yi+1] 區間所包含的資料在整個資料集中的比例相同,也就是說明如果對x或y進行放縮的話可以讓它們。
Time of Update: 2018-08-23
office2016自訂安裝組件簡明教程 引言 以往Office的安裝包都採用的是MSI安裝器,允許使用者在安裝時選擇安裝的組件, 但是微軟發布的Office 2016安裝包只提供了C2R(ClickToRun)方式,因此預設情況下使用者無法選擇安裝組件,會安裝所有。大多數人可能只需要其中的幾個組件,那麼該如何操作呢。 著作權聲明:本文主要目的是練習markdown文法,部分內容啟發自IT之家和知乎,故我將文章類型設定為轉載,
Time of Update: 2018-08-23
線性函數擬合(y=a+bx) 1. R運行執行個體 R語言運行代碼如下:綠色為要提供的資料,黃色標識資訊為需要儲存的。 x<-c(0.10,0.11, 0.12, 0.13, 0.14, 0.15,0.16, 0.17, 0.18, 0.20, 0.21, 0.23) y<-c(42.0,43.5, 45.0, 45.5, 45.0, 47.5,49.0, 53.0,
Time of Update: 2018-08-23
首先簡要介紹一下最小二乘法 在我們研究兩個變數(x,y)之間的相互關係時,通常可以得到一系列成對的資料(x1,y1.x2,y2… xm,ym);將這些資料描繪在x -y直角座標系中,若發現這些點在一條直線附近,可以令這條直線方程如y=a0+a1x(式1-1) 現在我們隨便給三個點(1,2),(2,2),(3,1),先看一下散佈圖
Time of Update: 2018-08-23
利用R語言進行線性/非線性迴歸擬合執行個體(1) 1、 產生一組資料 vector<float>xxvec; vector<float>yyvec; ofstreamfout("data2.txt");
Time of Update: 2018-08-23
看兩者是否算相關要看兩方面:顯著水平以及相關係數
Time of Update: 2018-08-23
http://www.xiaowanxue.com/up_files/201218184029.html 摘自:吳喜之:《非參數統計》(第二版),中國統計出版社,2006年10月:P164-165 1、ks.test() 例如零假設為N(15,0.2),則ks.test(x,"pnorm",15,0.2)。如果不是常態分佈,還可以選"pexp",
Time of Update: 2018-08-23
資料規範中的歸一化與標準化: A.歸一化 vs. 標準化 歸一化:要把你需要處理的資料經過處理後(通過某種演算法)限制在你需要的一定範圍內。首先歸一化是為了後面資料處理的方便,其次是保正程式運行時收斂加快。一般指將資料限制在[0 1]之間。 》把數變為(0,1)之間的數,主要是為了資料處理方便提出來的,把資料對應到0-1之間處理,更便攜快速;