GLM 廣義線性模型
George Box said: “All models are wrong, some are useful” 1. 始於 Linear Model
作為 GLM 的基礎,本節 review 經典的 Linear Regression,並闡述一些基礎 term。
我們線性迴歸的基本如下述公式,本質上是想通過觀察 x x,然後以一個簡單的線性函數 h(x) h(x) 來預測 y y:
y=h(x)=wTx y=h(x)=w^Tx
1.1 dependent variable y y
這是我們的預測目標,也稱 response variable。這裡有一個容易混淆的點,實際上 y y 可以表達三種含義(建模用的是分布,觀察到的是採樣,預測的是期望): distribution;抽象地討論 response variable 時,我們實際上關注對於給定資料和參數時, y| x,w y|\ x,w 服從的分布。Linear Regression 的 y y 服從高斯分布,具體取值是實數,但這裡我們關注的是分布。 observed outcome;我們的 label,有時用 t t 區分表示;這是真正觀察到的結果,只是一個值。 expected outcome; y=E[y|x]=h(x) y=\mathbf{E}[y|x]=h(x) 表示模型的預測;注意 y y 實際上服從一個分布,但預測結果是整個分布的均值 μ \mu,只是一個值。 1.2 independent variable x x
這是我們的特徵,可以包含很多維度,一個特徵也稱為一個 predictor。 1.3 hypothesis h(x) h(x)
線性模型的假設非常簡單,即 h(x)=wTx h(x) = w^Tx inner product of weight vector and feature vector,被稱為 linear predictor。這是就是線性模型,GLM 也是基與此的推廣。
深入來看,各個維度特徵(predictor) xj x_j 通過係數 wj w_j 線性加和,這一過程將資訊進行了整合;而不同的 weight(coefficient) 反映了相關特徵不同的貢獻程度 。 2. 推廣到 Generalized Linear Model 2.1 Motive & Definition
線性模型有著非常強的局限,即 response variable y y 必須服從高斯分布;主要的局限是擬合目標 y y 的 scale 是一個實數 (−∞,+∞) (-\infty,+\infty)。具體來說有倆個問題: y y 的取值範圍和一些常見問題不匹配。例如 count(遊客人數統計恒為正)以及 binary(某個二分類問題) y y 的方差是常數 constant。有些問題上方差可能依賴 y y 的均值,例如我預測目標值越大方也越大(預測越不精確)
所以這時我們使用 Generalized Linear Model 來克服這倆個問題。
一句話定義 GLM 即(from wiki):
In statistics, the generalized linear model (GLM) is a flexible generalization of ordinary linear regression that allows for response variables that have error distribution models other than a normal distribution.
詳細來說,我們可以把 GLM 分解為 Random Component、System Component 和 Link Function 三個部分。 2.2 Random Component
An exponential family model for the response
這裡是指 response variable 必須服從某一 exponential family distribution 指數族分布,即 y|x,w