Time of Update: 2018-08-23
參數估計是在抽樣及抽樣分布的基礎上,根據樣本統計量來推斷所關心的母體參數。 1 參數估計基本原理 1 估計量與估計值 估計量:參數估計中,用來估計母體參數的統計量的名稱,如樣本均值、樣本比例 估計值:根據一個具體的樣本計算出來的估計量的數值 2 點估計與區間估計 參數估計的方法有點估計和區間估計。 點估計:用樣本統計量的某個取值直接作為母體參數的估計值。無法機率度量可靠程度
Time of Update: 2018-08-23
1 統計量 統計量:由樣本構造一個函數,不依賴任何參數 常用統計量:樣本均值( X ¯ )、樣本方差( S 2 )、樣本變異係數( V=SX ¯ )、樣本k階距、樣本k階中心距、樣本偏度、樣本峰度 次序統計量:樣本極差(最大值減最小值) 充分統計量:統計量加工過程中一點資訊都不損失的統計量。判別定理:因子分解定理 2 由常態分佈匯出的幾個重要分布 1
Time of Update: 2018-08-23
一、資料清洗 1.重複資料的處理 (1)countif函數構造輔助列 對c列進行篩選,選出非1的,然後刪除,就可以留下非重複項; 或者對c列進行降序排序,然後刪除前幾行非1的 (2)Excel進階篩選 (3)條件式格式設定:突出重複值 (4)樞紐分析表:計數 (5)Excel重複資料刪除項 2.填充缺失的資料 (1)如果缺失值過多,說明存在問題,可以接受的缺失值在10%以下 (2)處理趨勢值的四種方式:
Time of Update: 2018-08-23
有三張表,student表 sc表和course表; Student表:學號sno、姓名sname、性別ssex Course表:課程號cno、課程名cname、學分ccredit Sc表:學號sno、課程號cno、成績grade 請使用sql語句查詢學生姓名及其課程總學分 (註:如果課程不及格,那麼此課程學分為0) 答案: select st.sname,sum(cou.ccredit)&
Time of Update: 2018-08-23
預備實驗(選做) 實驗名稱:SQL Server 2005的安裝與系統設定 實驗目的和要求:掌握SQL Server 2005的安裝和配置方法,熟悉SQL Server的系統內容,主要是對“查詢分析器”和“企業管理器”的熟悉和使用。 實驗裝置: (1) 作業系統為WINDOWS xp/ 2003 server的電腦一台;
Time of Update: 2018-08-23
<span style="font-family: 'Microsoft YaHei'; line-height: 18.1818px; white-space: pre-line; background-color: rgb(255, 255, 255);">有一個對象數組,裡面儲存著通訊錄。</span> 函數 lookUp 有兩個參數: firstName 和prop 。 函數將會檢查通訊錄是否存在 firstName值 和 prop 屬性。
Time of Update: 2018-08-23
sum()、max()、min()、mean()、median() prod(x) 對x中的元素都連乘 which.max(x) 返回x中最大元素的下標 which.min(x) 返回x中最小元素的下標 range(x) 範圍 rev(x) 對x中的元素取逆序 sort(x) 將x中的元素將升序排列 pmin(x,y) 返回一個向量,它的第i個元素是x[i], y[i] 中最小值
Time of Update: 2018-08-23
plyr包簡介 plyr包是Hadley Wickham為解決split – apply – combine問題而寫的一個包,其動機在與提供超越for迴圈和內建的apply函數族的一個一攬子解決方案。使用plyr包可以針對不同的資料類型,在一個函數內同時完成split – apply – combine三個步驟,以實現最大限度的高效和簡潔。 plyr包特別適合處理大型資料集問題,比如對空間資料的空間位置或時間序列面板資料的時間點建模,或者在高維數組中進行資料探索等等。
Time of Update: 2018-08-23
查看協助文檔 help.start() 擷取函數的協助文檔 help(functionname) 在網頁中顯示 ?functionname 在控制台顯示 args(functionname) 快速擷取函數的參數 example(functionname) 查看函數的執行個體 搜尋協助文檔 help.search("pattern") ??pattern 查看R軟體包協助資訊
Time of Update: 2018-08-23
分類器是一個可以確切分析為何代碼耗時如此之長的方便工具,並提供一些建議來解決你的問題。 system.time 取出並分析任意一條R語句,然後函數告訴你運行那個語句所需的時間 (1)使用者時間 user time 運行這行語句需要佔用中央處理器的時間,即電腦運算的時間 (2)已耗用時間 elapsed time ,也稱時鐘時間 walk clock time,是你所經曆的時間 例:已耗用時間比使用者時間長
Time of Update: 2018-08-23
https://docs.scipy.org/doc/numpy/reference/routines.math.html 三角函數(Trigonometric) Function Describe sin(x[, out]) 正弦值 cos(x[, out]) 餘弦值 tan(x[, out]) 正切值 arcsin(x[, out]) 反正弦 arccos(x[, out]) 反餘弦 arctan(x[, out]) 反正切 hypot(x1, x2[,
Time of Update: 2018-08-23
1 資料的預先處理 資料審核:檢查資料中是否有錯誤,主要從完整性和準確性兩個方面。對二手資料,則著重適用性和時效性。 資料篩選:根據需要找出符合特定條件的某類資料。 資料排序:按一定順序將資料排列 樞紐分析表 2 品質資料的整理與展示 對品質資料主要做分類整理,對數值型資料主要做分組整理。 1 分類資料的整理與展示 頻數與頻數分布 分類資料的圖示 橫條圖 帕累托圖:按各類別資料出現的頻數多少排序後繪製的橫條圖 餅圖 環形圖:餅圖的擴充,去掉中間的“洞” 2
Time of Update: 2018-08-23
1 資料的來源 資料的間接來源:二手資料 資料的直接來源 2 調查資料 資料採樣階段:如何抽選出一個好的樣本 使用抽樣的方式採集資料的具體方式有很多種,可以分為兩類:機率抽樣和非機率抽樣 機率抽樣:也稱隨機抽樣。主要包括簡單隨機抽樣、分層抽樣、整群抽樣、系統抽樣、多階段抽樣 分層抽樣:將抽樣樣本按某種特徵或某種規則劃分為不同的層,然後從不同的層中獨立、隨機地抽取樣本。將各層的樣本結合起來對總體的目標量進行估計。
Time of Update: 2018-08-23
1 統計及其應用領域 資料分析所用方法可分為描述統計方法和推斷統計方法。 描述統計:研究資料收集、處理、匯總、表徵圖描述、概括與分析等統計方法 推斷統計:研究如何利用樣本資料來推斷總體特徵的統計方法 2 統計資料的類型 按照所採用的計量尺度不同,可以將統計資料分為分類資料、順序資料和數值型資料。 分類資料是無序的如男女,企業按行業劃分等; 順序資料是有序的非數字型資料,如一等品,二等品等 按照統計資料的收集方法,可以將其分為觀測資料和實驗資料。區別為有無人為控制條件。
Time of Update: 2018-08-23
一般時間序列的均值函數是完全任意的時間函數,平穩時間序列的均值函數是一定時域上的常數。 1 確定性趨勢與隨機趨勢 下文考慮確定趨勢的建模方法 2 常數均值的估計 假設均值函數是常數,模型可以寫為 Y t =μ+X t 其中對所有的 t 有 E(X t )=0 若用樣本觀測到的時間序列
Time of Update: 2018-08-23
1 隨機事件及其機率 實驗、事件 隨機事件(偶然事件)、必然事件、不可能事件 機率 2 機率的性質與運演算法則 互斥事件:事件A和時間B不可能同時發生, P(A∪B)=P(A)+P(B) 乘法公式: P(AB)=P(B)P(A|B) 當兩個事件獨立時, P(AB)=P(B)P(A) 一般情形,設n個事件 A 1 ,A 2 ,...,A n 互不相容,
Time of Update: 2018-08-23
1 時間序列與隨機過程 隨機變數序列 Y t :t=0,±1,±2,±3,... 稱為一個隨機過程,並以之作為觀測時間序列的模型。 2 均值、方差和共變數 對隨機過程 Y t :t=0,±1,±2,±3,... ,均值函數定義如下: μ t =E(Y t ),t=0,±1,±2,... 即 μ t 恰是過程在
Time of Update: 2018-08-23
library(arules) #載入arules程式包 data(Groceries) #調用資料檔案 frequentsets=eclat(Groceries,parameter=list(support=0.05,maxlen=10)) #求頻繁項集 inspect(frequentsets[1:10]) &
Time of Update: 2018-08-23
為什麼要進行資料預先處理。 現實情況中,你的資料可能是不完整的(缺少屬性值或某些感興趣的屬性或僅包含聚類資料)、含雜訊的(包含錯誤或存在偏離期望的離群值)、並且是不一致的。 資料清理:填寫缺失的值、光滑雜訊資料、識別或刪除離群點並解決不一致性 Data Integration:當資料來自多個資料來源時,而同一個屬性在不同資料來源不同,合成時存在冗餘 資料規約:資料集的簡化 描述性資料匯總 1 度量資料的中心趨勢 均值、中位元、眾數、中列數(
Time of Update: 2018-08-23
qplot()的局限在於它只能使用一個資料集和一組圖形屬性對應,解決這個問題的辦法就是使用圖層。每個圖層可以有自己的資料集合圖形屬性對應,附加的資料元素可通過圖層添加到圖層中。 一個圖層主要由5個部分組成:資料、一組圖形屬性對應、幾何對象、統計變換和位置調整。 1. 建立繪圖對象 當調用qplot()時,它其實做了很多幕後工作:建立一個繪圖物件,添加圖形並且展示結果。