1、input: 輸入資料
例: inpurt x y
1 4
2 3.5
3 7
end
2、by: 按照某一變數的取值來進行分析
例:by group,sort: regress Y x1 x2 //按照不同的組,對Y做迴歸分析
3、weight: 加權或者頻數
例:fw=頻數變數 //多用在四格表資料中或者未原資料未給出所有值,只給出了值和對應的頻數
4、if: 用條件陳述式指定條件
例:drop if group==1|group==2 //把group變數值為1或者2的記錄刪除掉
5、in:指定觀察值的範圍,對在範圍內的觀察值做分析處理
例:replace x1="123" in 100/200 //把第100-200條記錄中的X1變數值改為123
6、for: 用來指定變數
例:for y1-y10 z1-z5: regress @x1-x22
//把y1-y10,z1-z5分別於x1-x22做迴歸,一次性代表15次迴歸,其中@是替換符,代表y1-y10, z1-z5
7、函數:
abs(x) 絕對值
exp(x) 指數函數
log(x) 自然對數
log10(x) 常用對數
sqrt(x) 平方根
uniform(x) 產生(0,1)內均勻分布的偽隨機數
length(x) 計算長度
substr(s,n1,n2) 獲得從S的n1個字元開始的n2個字元組成的字串
real(x) 將字串s轉換為數值函數
trim(x) 去除字串前面和後面的空格
int(x) 去掉x的小數部分,得到整數
sum(X) 求和
max(x) min(x) 最大值最小值
_n 當前觀察值的位置
_N 觀察值的總個數
8、ren: 重新命名
例:ren var1 var123 // 把var1重新命名為var123
9、des:描述資料庫的基本情況
10、label: 為變數添加一些說明,以示說明
11、sort: 按照某一變數從小到大排序
gsort +/-:按照某一變數從大到小或者從小到大排序
sort var1 var2:按照var1大小排序,相同的var1按照var2大小排序
12、drop:刪除變數或者記錄
drop x1 x2
drop x1-x5
drop if x<0\
drop in 1/100
drop if x==.|y==.
drop _all //清空資料庫
13、keep: 與drop對應,儲存變數
14、append:縱向串連資料庫
15、merge:橫向串連資料庫
16、gen: 產生新變數
gen bh=_n //將資料庫的內部編號賦給變數bh
17、replace:更改變數值
replace z=. if z=9 //將所有z=9的值用缺失值代替
renvars: 批量修改變數名
renvars X1-X5, prefix(mono_) //把變數X1-X5的變數名前加首碼mono_;同理尾碼是postfix
18、set obs: 增加空記錄
set obs 20 //增加20條空白記錄
19、format: 改變資料格式
format tjrq %td //將tjrq改成日期形式
20、l: list 將結果列出
21、su: 對分析資料進行描述,均值標準差等,與des不同,des是描述資料庫變數個數,格式等
su x, d // 對x進行統計描述,如果加了d,那麼就會更加detail
22、centile: 百分位元計算
centile x, centile(2.5,50,97.5) //計算變數x的2.5,50.97.5百分位元
23、tab:頻數表達
tab sex //計算兩個性別各自的頻數
tab sex group //看看各組性別分布的情況
tab group, sum(x1) //在各組內對x1統計分析
24、ci: 計算可信區間
25、長條圖:gra x, bin(9) xlab(10,20,30,40) ylab(0,1,2,3) norm gap(4) b2("height (cm)")
//對x畫長條圖,分為9組,X軸為10,20,30,40,y軸為0,1,2,3,加上常態分佈曲線,標題與座標軸的距離(1-8),下座標軸加標題為height(cm)
b1/t1/l1/r1("") 給各個座標軸加標題
b2/t2/l2/r2("") 給各個座標軸加副標題
title 給圖加總標題
條圖:gra x1 x2, bar by(group) sh(31) l1("rate of die") b1("comparison of rate of die")
// 對x1,x2畫條圖,分組變數為group,兩組的明暗對比為3:1,左標題rate of die,下標題comparison of rate of die
餅圖:gra x1 x2 x3 x4 x5, pie by(group) sh(31) total
散佈圖與線圖:connect(簡寫c)——串連散點的方式:
. 不串連
l 直線串連
s 平滑曲線串連
|| 直線串連在同一縱向上的兩點
J 階梯式線條串連
symbol(簡寫s)——各個散點的圖形:
O 大圓圈
S 大方塊
T 大三角型
o 小圓圈
d 小菱形
p 小加號
. 小點
gra y x, xlab ylab c(l) s(d)
箱式圖: gra y x, oneway/twoway box
26、單樣本均數t檢驗: ttest x=14.02(總體均數μ)
ttesti n mean sd μ
配對t檢驗: ttest x1==x2
兩樣本均數t檢驗:ttest x1==x2,unpaired
ttest x, by(group)
27、方差分析:
方差齊性檢驗:sdtest x1=x2
sdtest x, by (group)
正態性檢驗: sktest x
單因素方差分析: oneway 相應變數 分組變數
兩因素方差分析:anova 相應變數 分組變數1 分組變數2
多因素方差分析:anova x a b c ... a*b b*c a*b*c... //乘積項代表互動作用
28、率、構成比的比較: tab var1 var2 [fw=頻數變數]
chi2 pearson卡方檢驗
exact fisher確切機率法
如果是原始資料RXC列聯表: tabi 第一行數字從左至右\第二行從左至右...\最後一行從左至右, row chi2 exact
29、 隊列研究(暴露,不暴露):
ir 病例變數 暴露變數 時間變數 ./ irs a b n1 n2
cs 病例變數 暴露變數 / csi a b c d
病例對照研究(發病,不發病):cci a b c d
30、等級資料:
genrank 編秩 genrank rankx=x
signtest 符號檢驗 類似t檢驗,signtest x=常數,signtest x1=x2, signrank x1=x2
signrank 符號秩和檢驗
ranksum/Wilcoxon 兩樣本秩和檢驗 wilcoxon var, by (group_var)
kwallis 多樣本秩和檢驗(Kruskal-Wallis) kwallis var,by (group_var)
spearman 等級相關 spearman x y
ktau 等級相關(kendall) ktau x y
31、直線相關與迴歸: 相關 corr y x
迴歸 reg y x
估計與預測 pre yhat
畫圖 gra y yhat l1 l2 l3 l4 x, c(.lssss) s(oiiii) xlab() ylab()
32、多元線性迴歸及逐步迴歸:
散佈圖矩陣: gra y x1 x2, matrix
相關係數矩陣: corr
多元迴歸方程: reg y x1 x2 //標準化偏迴歸係數,reg y x1 x2, beta
逐步迴歸: stepwise y x1-x4, forward fe(2.73) //α等於0.05時F界值為2.73,fe代表fenter選入標準,fs代表fstay剔除標準
逐步迴歸法:forward,backward,stepwise,stepwise forward 例如:step y x1-x4, step fe(2.5) fs(2.6) back
33、logistic迴歸:
logit y x [fw=f]
blogit y x1 x2 x3/ glogit y x1 x2 x3
也可以同上做逐步Logistic迴歸
34、生存曲線:
中位存留時間:survsum 時間變數 截尾變數, by(分組變數)
生存曲線:kapmeier 時間變數 截尾變數, by(分組變數) // kaplan-meier生存曲線
生存率比較: 兩組:wilcoxon 時間變數 截尾變數, by(分組變數)
多組:logrank 時間變數 截尾變數, by(分組變數)
COX分析: cox 時間變數 自變數, dead(截尾變數)