從qplot開始入門_ggplot2包

本文使用的資料集為ggplot2包內建的diamonds資料集,其包含了約54000顆鑽石的價格和品質的資訊。這組資料涵蓋了反映鑽石品質的四個“C”——克拉重量(carat)、切工(cut)、顏色(color)和淨度(clarity),以及五個物理指標——深度(depth)、鑽石寬度(table)、x、y、z。如下圖: 本文使用的另一個資料集是未經處理資料的一個容量為100的隨機樣本 set.seed(1410) #使樣本可重複

多重共線性產生原因、判別、檢驗、解決方案_資料採礦

最近做迴歸分析,出現了相關係數與迴歸方程係數符號相反的問題,經過研究,確認是多重共線性問題並探索瞭解決方法。 在此將多重共線性相關知識整理如下。 解釋變數理論上的高度相關與觀測值高度相關沒有必然關係,有可能兩個解釋變數理論上高度相關,但觀測值未必高度相關,反之亦然。所以多重共線性本質上是資料問題。 造成多重共線性原因有一下幾種: 1、解釋變數都享有共同的時間趨勢; 2、一個解釋變數是另一個的滯後,二者往往遵循一個趨勢;

R語言中str_extract_all函數_R語言

這個函數是在stringr包下面的一個函數,在做資料清洗的時候還是很有用的,大概用法就是去提取一個字串下的某種內容,按照一些自己想要的規則,具體用法如下: x<-"abacdef12g"  str_extract_all(x,"[f0-9]") [[1]] [1] "f" "1" "2" > str_extract_all(x,"[f0-9]{1,3}") [[1]] [1] "f12" > str_extract_all(x,"[f0-9]{1,2}

R語言中描述統計量的多種方法summary()、describe()、str()等_r語言

1. summary()函數可以擷取描述性統計量 可以提供最小值、最大值、四分位元和數值型變數的均值,以及因子向量和邏輯型向量的頻數統計 2. misc包中的describe()函數 可返回變數和觀測的數量、缺失值和唯一值的數目、平均值、分位元,以及五個最大的值和五個最小的值 3.psych包中的describe()函數

【R語言學習】split函數_r語言

usage split(x, f, drop = false,...) arguments x: data to be divided f: define the grouping example 1 > split(1:10, 2)$`2` [1] 1 2 3 4 5 6 7 8 9 10> split(1:10,1:2)$`1`[1] 1 3 5 7 9$`2`[1] 2 4 6 8 10 example 2 >

R語言︱基本函數、統計量、常用操作函數_R︱資料操作與清洗

先言:R語言常用介面操作 協助:help(nnet) = ?nnet =??nnet 清除命令框中所有顯示內容:Ctrl+L 清除R空間中記憶體變數:rm(list=ls())、gc() 擷取或者設定當前工作目錄:getwd、setwd 儲存指定檔案或者從磁碟中讀取出來:save、load 讀入、讀出檔案:read.table、wirte.table、read.csv、write.csv 1、一些簡單的基本統計量

STL---對STL中的各類常用函數的小總結_資料結構

STL = Standard Template Library,標準模板庫,惠普實驗室開發的一系列軟體的統稱。它是由Alexander Stepanov、Meng Lee和David R

使用Yahoo API擷取雅虎的證券股票資料介面(時價 K線等)_API

從網上搜尋到的Yahoo 財經API介面,基本可以取到世界各個市場的股票,指數,外匯等資料 但是測試下來好像日本國內資料沒有,不過調查之後發現可以使用其他方式擷取,擷取的方法會在隨後的博文再附上。 1.擷取即時資料 http://finance.yahoo.com/d/quotes.csv?s=股票名稱&f=資料列選項 s — 表示股票名稱,多個股票之間使用英文加號分隔,如“XOM+BBDb.TO+JNJ+MSFT”

下載yahoo股票曆史資料_web

http://table.finance.yahoo.com/table.csv?s=ibm&d=8&e=5&f=2013&g=d&a=11&b=16&c=1991&ignore=.csv上面的連結可以抓取IBM股票從1991年11月16日起到2013年8月5日的資料。http://table.finance.yahoo.com/table.csv?s=sohu&d=8&e=5&f=2013&g=d&

R語言迴歸篇_R

1.迴歸的多面性 迴歸類型 用途 簡單線性 個量化的解釋變數來預測一個量化的響應變數(一個因變數、一個自變數) 多項式 一個量化的解釋變數預測一個量化的響應變數,模型的關係是 n階多項式(一個預測變數,但同時包含變數的冪) 多元線性 用兩個或多個量化的解釋變數預測一個量化的響應變數(不止一個預測變數) 多變數    用一個或多個解釋變數預測多個響應變數 Logistic 用一個或多個解釋變數預測一個類型變數 泊松

時間序列預測(資料使用passengers.csv,演算法用ARIMA)_人工智慧

查看資料結構: import pandas as pddata = pd.read_csv('/Users/liailan/tmp/AirPassengers.csv')print(data.head()) Unnamed: 0 time value0 1 1949-01 1121 2 1949-02 1182 3 1949-03 1323 4 1949-04

Rstudio-處理缺失值的方法_r語言

1. 剔除含有缺失值的案例(行) algae[!complete.case(algae),]  %找出algae資料集中具有缺失值的全部案例 剔除分兩種:一種是剔除具有缺失值的全部案例;另一種是剔除缺失值較多的案例。 (1) 刪除algae資料集中具有缺失值的全部案例:algae <- na.omit(algae)     (2) 剔除algae資料集中缺失值較多的案例 Step1

R語言︱缺失值處理_R︱資料操作與清洗

#缺失值 an=c(1,2,NA)is.na(an) #會形成一個布爾向量 布爾向量就是一群像(FALSE,FALSE,TURE)這樣的向量。 關於缺失值還有一個函數:complete.cases函數 該函數與is.na的區別在於: 1、輸出資料格式不同。is.na按照資料框格式形成一個(FALSE,FALSE,TURE)列,而complete.cases形成是一個數列向量,不再是按照資料框格式;

時間序列分析之ARIMA模型預測_資料採礦

轉載自 http://blog.sina.com.cn/s/blog_70f632090101bnd8.html#cmt_3111974 今天學習ARIMA預測時間序列。  指數平滑法對於預測來說是非常有協助的,而且它對時間序列上面連續的值之間相關性沒有要求。但是,如果你想使用指數平滑法計算出預測區間, 那麼預測誤差必須是不相關的, 而且必須是服從零均值、 方差不變的常態分佈。即使指數平滑法對時間序列連續數值之間相關性沒有要求,在某種情況下,

R語言筆記3:提取R對象的子集,模糊比對和移除資料框缺失值_R

Subsetting R Objects 取子集的三種基本方法 [ :“單方括弧”返回的對象和原來相同,如向量的子集還是向量;也可用於在對象中選擇多個元素 [ [:“雙方括弧”僅可用於提取單一元素,並且用來提取列表或者資料框中的元素,但是,由於列表或者資料框中的元素類別不唯一,因此它返回對象的類型不一定是列表或者資料框 $ :“貨幣符號”是提取有名字的列表或資料框中的一個元素 (一)向量取子集 舉例 單括弧+數字索引: > x <- c("a", "b", "c",

在R語言中利用mice包進行缺失值的線性迴歸填補_R語言

在資料分析中,我們會經常遇到缺失值問題。一般的缺失值的處理方法有刪除法和填補法。通過刪除法,我們可以刪除缺失資料的樣本或者變數。而缺失值填補法又可分為單變數填補法和多變數填補法,其中單變數填補法又可分為隨機填補法、中位元/中值填補法、迴歸填補法等。本文簡單介紹一下如何在R語言中利用mice包對缺失值進行迴歸填補。 假設未經處理資料只有兩列P(壓力)和T(溫度),具體資料如下: orig_data <- data.frame( T = c(0.47, 0.45, 0.48, 0.4

R語言處理缺失資料的進階方法_R

主要用到VIM和mice包 install.packages(c("VIM","mice")) 1.處理缺失值的步驟 步驟: (1)識別缺失資料; (2)檢查導致資料缺失的原因; (3)刪除包含缺失值的執行個體或用合理的數值代替(插補)缺失值 缺失值資料的分類: (1)完全隨機缺失:若某變數的缺失資料與其他任何觀測或未觀測變數都不相關,則資料為完全隨機缺失(MCAR)。

R語言 處理缺失值資料_r語言

主要用到VIM和mice包 install.packages(c("VIM","mice")) 1.處理缺失值的步驟 步驟: (1)識別缺失資料; (2)檢查導致資料缺失的原因; (3)刪除包含缺失值的執行個體或用合理的數值代替(插補)缺失值 缺失值資料的分類: (1)完全隨機缺失:若某變數的缺失資料與其他任何觀測或未觀測變數都不相關,則資料為完全隨機缺失(MCAR)。

R語言:常用統計檢驗方法_R

轉自http://blog.sciencenet.cn/home.php?mod=space&uid=255662&do=blog&id=240107 正態總體均值的假設檢驗 t檢驗 單個總體 例一  某種元件的壽命X(小時),服從常態分佈,N(mu,sigma^2),其中mu,sigma^2均未知,16隻元件的壽命如下:問是否有理由認為元件的平均壽命大於255小時。 命令: X<-c(159, 280, 101, 212

使用R完成均值檢驗_R

t檢驗和 Z檢驗都可用於均值檢驗。 單樣本均值檢驗 當樣本容量小於30時使用t檢驗,當樣本容量大於30時使用Z檢驗 Z檢驗使用例子: library(UsingR)x<-rnorm(50,0,5)simple.z.test(x,5)運行結果: [1] -2.947929 3.250022 結果說明在信賴度為95%的情況下總體的均值區間為[-2.947929 3.250022]

總頁數: 61357 1 .... 22850 22851 22852 22853 22854 .... 61357 Go to: 前往

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.