Skip to content

第 6 章 回归与相关分析(Regression & Correlation)

对应课件 6 Regression.pdf,覆盖 Rosner 第 11 章(与第 12.5 节 ANCOVA)。 回归是把 ANOVA 拓展到连续型自变量:研究 y 如何随 x 变化。最终我们会看到 ANOVA 也只是回归的一个特例。


1. 简单线性回归(Simple Linear Regression)

1.1 研究问题

  • yx 怎么变?正/负/无关?
  • 给定 x,能预测 y 吗?
  • xy 是否"相关"?

统计框架

  • y(因变量):随机变量
  • x(自变量):当作固定的(非随机)
  • 关心条件期望 E(yx) 如何随 x

1.2 模型

yiN(α+βxi,σ2)E(yixi)=α+βxi

三个参数:

  • α(截距,intercept):x=0 时直线的高度
  • β(斜率,slope):x 增加一个单位,y 平均变化多少
    • β>0:正相关
    • β<0:负相关
    • β=0:无线性关系
  • σ2:残差方差,越小拟合越紧

1.3 最小二乘法(Method of Least Squares, OLS)

每个点的残差 di=yiy^i=yi(α+βxi)

目标:极小化残差平方和

(α^,β^)=argminα,βi=1n(yiαβxi)2

求导可得闭式解

β^=(xix¯)(yiy¯)(xix¯)2=xiyinx¯y¯xi2nx¯2α^=y¯β^x¯

性质:回归直线必经过样本均值点 (x¯,y¯)


1.4 例:孕妇雌三醇与新生儿出生体重

n=31 名孕妇:y = 出生体重(克/100),x = 雌三醇(mg/24h)。

拟合直线:y^=21.5+0.61x

斜率解释:雌三醇每增加 1 mg/24h,新生儿体重平均增加 0.61×100=61 克。

预测:若 x=15y^=0.61(15)+21.5=30.65(即约 3065 克)。


2. 回归系数的假设检验

2.1 平方和分解(Decomposition of TSS)

yiy¯=(yiy^i)+(y^iy¯)

平方求和:

(yiy¯)2TSS=(y^iy¯)2RegSS+(yiy^i)2ResSS
  • TSS(Total):y 的总变异
  • RegSS(Regression):被回归直线"解释"的部分
  • ResSS(Residual):未解释、剩余噪声

自由度:n1=k+(nk1)k = 自变量个数,简单回归 k=1)。

均方:

RegMS=RegSSk,ResMS=ResSSnk1

2.2 F 检验

H0:β=0,H1:β0F=RegMSResMSFk,nk1(H0)

ANOVA 表(简单回归 k=1):

来源SSdfMSF
回归RegSS1RegSSRegMS/ResMS
残差ResSSn2ResSS/(n-2)
TSSn1

2.3 t 检验(直接对斜率)

t=β^se(β^),se(β^)=ResMS(xix¯)2

ttn2H0 下)。

重要等价:在简单线性回归中,F=t2。两种检验等价。

自由度 n2 的来源:从 n 中扣除 α^,β^ 两个估计参数。

斜率的 1α 置信区间

β^±tn2,1α/2se(β^)

3. 相关系数(Correlation)

3.1 总体相关系数

ρ=Corr(X,Y)=Cov(X,Y)σXσY

性质:

  • 无量纲,ρ[1,1]
  • ρ1:强正线性
  • ρ1:强负线性
  • ρ0:无线性关系(注意:可能存在非线性!

经典反例:Y=X2X[1,1] 均匀分布,ρ=0Y 完全由 X 决定。


3.2 Pearson 样本相关系数

ρ^=r=(xix¯)(yiy¯)(xix¯)2(yiy¯)2

与回归斜率的关系

β^=ρ^σ^Yσ^X

→ 斜率的符号与相关系数一致;斜率的大小还受 Y/X 尺度影响。


3.3 Spearman 秩相关

动机:Pearson 假设近似正态、且只能测线性关系。当数据非正态/有异常值/关系单调但非线性时,用 Spearman 更稳健。

步骤

  1. xiyi 各自换成秩 rx(i)ry(i)(同值取均秩)
  2. 对秩做 Pearson 相关:
ρ^Spearman=[rx(i)r¯x][ry(i)r¯y][rx(i)r¯x]2[ry(i)r¯y]2

性质

  • 单调关系(增/减),不要求线性
  • 对异常值稳健
  • ±1 对应秩完全同/反序

4. 拟合优度与残差分析

4.1 决定系数 R2

R2=RegSSTSS=1ResSSTSS

R2[0,1]:被回归解释的方差比例。

  • R2=0x 完全无解释力
  • R2=1:所有点完美落在直线上
  • 简单回归中 R2=r2(相关系数的平方)

4.2 调整 R2

加入更多自变量会机械地抬高 R2。调整版考虑了自变量数:

Radj2=1ResSS/(nk1)TSS/(n1)=1ResMSTMS

性质:

  • 总有 Radj2R2
  • 加入"无用"自变量会让 Radj2 下降
  • 多元回归首选 Radj2 来比较模型

(雌三醇 vs 出生体重):

R2=250.57/6740.37,Radj2114.6/22.47=0.35

4.3 简单线性回归的三大假设

  1. 线性性(Linearity)E(yx)=α+βx
  2. 正态性(Normality):给定 xy 服从正态
  3. 独立性(Independence):误差 ei 之间独立

加上"等方差性"(同方差,homoscedasticity)通常合称四大假设。


4.4 残差及诊断

残差e^i=yiy^i

学生化残差(Studentized):

e^isd(e^i)˙N(0,1)

残差图诊断要点

诊断目标看什么异常表现
同方差残差 vs y^ 散点图"扇形 / 漏斗" → 异方差
线性残差 vs x弯曲、U 形 → 非线性
正态Q-Q 图(残差 vs N(0,1) 分位数)系统偏离对角线

应对

  • 异方差 → 对 ylog 等变换
  • 非线性 → 加多项式项、变换、用非线性回归
  • 非正态 → 大样本下 CLT 仍可保(估计无偏);严重时用稳健方法

5. 预测(Prediction)

5.1 两种"预测"

Case 1:群体均值Case 2:单个个体
关心给定 x0平均 y给定 x0某一个 y
"雌三醇=15 时,平均出生体重?""我朋友雌三醇=15,孩子有多重?"
不确定性仅来自参数估计参数估计 + 个体随机误差

预测值都是 y^0=α^+β^x0,但方差不同


5.2 群体均值(CI)

Var(y^0)=σ2[1n+(x0x¯)2(xix¯)2]

CI:

y^0±tn2,1α/2Var^(y^0)

5.3 个体预测(PI,Prediction Interval)

Var(y^0y0)=σ2[1+1n+(x0x¯)2(xix¯)2]

注意比群体均值多了 σ2 那一项 → PI 总是比 CI 宽

PI:

y^0±tn2,1α/2Var^(y^0y0)

关键直觉:估计"群体平均值"比"某一个体的值"精确得多——后者还要承担个体随机噪声 σ2

两种区间在 x0=x¯ 处最窄,越远离 x¯ 越宽。


6. 多元线性回归(Multiple Linear Regression)

6.1 模型

E(yixi1,,xik)=α+β1xi1+β2xi2++βkxik

6.2 偏回归系数(Partial Regression Coefficient)

βj 解释为:控制其他变量不变时,xj 增加 1 单位 y 的平均变化。

与简单回归的差别:

  • 简单回归 β1:忽略其他变量
  • 多元回归 β1:固定其他变量
  • 当变量之间相关时,两者可能差很多甚至符号相反(辛普森悖论可能出现)。

6.3 假设检验

整体 F 检验

H0:β1==βk=0,F=RegMSResMSFk,nk1

单系数 t 检验

t=β^jse(β^j)tnk1

6.4 例:婴儿 SBP ~ Birthweight + Age

n=16,k=2

SBP^=53.45+0.126BWt+5.888Age
  • 体重每增加 1 oz,SBP 平均增加 0.126 mmHg(控制日龄)
  • 日龄每增加 1 天,SBP 平均增加 5.888 mmHg(控制体重)
  • 预测 BWt=128, Age=3 的 SBP:53.45+0.126(128)+5.888(3)=87.24 mmHg

6.5 标准化回归系数(重要性比较)

不同自变量量纲不同,直接比较 β^j 不公平

标准化系数

β^js=β^jσ^Xjσ^Y

含义:xj 增加 1 个标准差,y 平均增加 β^js 个标准差。

简单回归特例β^s=Corr(X,Y)

等价构造:直接在标准化后的 (X,y) 上回归,得到的系数就是 β^s


6.6 共线性警告(Collinearity)

如果两自变量几乎完全相关

  • 回归系数估计不稳定,标准误膨胀
  • 报告"奇怪的"符号、巨大的方差
  • 软件可能直接报错

应对

  • 删除其中一个
  • 主成分分析(PCA)压缩
  • 岭回归 / 套索(lasso)等正则化方法

7. 哑变量(Dummy Variables):把 ANOVA 装进回归

7.1 思路

类别变量 Xk 个水平 → 用 k1 个 0/1 哑变量(剩 1 个作为参照组)。

例:k=3 类(A, B, C),以 A 作参照:

观测DrugBDrugC
A00
B10
C01

回归模型:

y=α+β1DrugB+β2DrugC+e

系数解释

  • α:参照组(A)的均值
  • β1:B 与 A 的均值差
  • β2:C 与 A 的均值差

7.2 ANOVA = 含哑变量的回归

ANOVA 整体 F 检验等价于:

H0:β1==βk1=0

两两比较等价于:

比较ANOVA (LSD)回归
j vs 参照组t=y¯jy¯0s1/nj+1/n0t=β^jse(β^j)
j vs h(均非参照)t=y¯jy¯hs1/nj+1/nht=β^jβ^hse(β^jβ^h)

关键洞见:ANOVA 只是回归的一个特例。


7.3 例:阿司匹林退热

3 种药 A、B、C,5 名儿童一组测试 30 分钟内的退热程度 y。以 A 为参照:

y=α+β1DrugB+β2DrugC+e

得到:

  • A 组:y=α
  • B 组:y=α+β1
  • C 组:y=α+β2

整体 F 检验等价于一因素 ANOVA。


8. 协方差分析(ANCOVA)

8.1 动机

比较多组(如三种药),但担心年龄等连续协变量在组间不平衡 → ANCOVA:在调整连续协变量后再比较组间差异。

8.2 模型(等斜率)

E(yAge,Z)=α+βAgeAge+β1z1++βk1zk1

每组的回归直线斜率相同(即年龄效应一致),只是截距不同:

  • 参照组:y=α+βAgeAge
  • j 组:y=(α+βj)+βAgeAge

8.3 含交互的 ANCOVA(不同斜率)

加交互项 zj×Age 允许各组斜率不同

E(yAge,Z)=α+βAgeAge+β1z1+β2z2+β3(z1×Age)+β4(z2×Age)

各组:

  • Z=(0,0):截距 α,斜率 βAge
  • Z=(1,0):截距 α+β1,斜率 βAge+β3
  • Z=(0,1):截距 α+β2,斜率 βAge+β4

数值例

y=100+0.5Age30z1+55z2+1.75(z1Age)1.0(z2Age)
截距斜率
1(参照)1000.5
2702.25
3155-0.5

→ 三条不同的回归直线(不同截距和斜率)。


9. 公式速查表

公式
斜率 OLSβ^=(xix¯)(yiy¯)(xix¯)2
截距α^=y¯β^x¯
斜率与相关β^=ρ^σY/σX
F 检验(简单)F=RegMS/ResMSF1,n2
t 检验(斜率)t=β^/se(β^)tn2
R2RegSS/TSS
Radj21ResMS/TMS
群体均值 CIy^0±tσ2[1/n+(x0x¯)2/(xix¯)2]
个体 PIy^0±tσ2[1+1/n+(x0x¯)2/(xix¯)2]
标准化系数β^s=β^σX/σY

10. 自测要点(Checklist)

简单回归

  • [ ] 模型 yN(α+βx,σ2) 的三个参数
  • [ ] OLS 推导(最小化残差平方和、求偏导得正规方程)
  • [ ] 直线必经过 (x¯,y¯)
  • [ ] F 检验、t 检验在简单回归中的等价性
  • [ ] β^=ρ^σY/σX

相关

  • [ ] Pearson 相关与 Spearman 相关的差别
  • [ ] 相关 = 0 不等于独立
  • [ ] 相关与因果的区别

拟合度

  • [ ] R2Radj2 的差别
  • [ ] 何时用 Q-Q 图、何时用残差散点图
  • [ ] 异方差/非线性的对应处理(变换、多项式)

预测

  • [ ] CI vs PI 的方差差别(+σ2
  • [ ] 为什么 x0=x¯ 时区间最窄

多元回归

  • [ ] 偏回归系数的"控制其他变量"含义
  • [ ] 整体 F 与单系数 t 检验
  • [ ] 标准化系数的尺度统一意义
  • [ ] 共线性的危害与对策

ANOVA = 回归

  • [ ] k 类用 k1 个哑变量,参照组的选择
  • [ ] 截距 = 参照组均值,系数 = 与参照组的差
  • [ ] LSD 检验 ↔ 哑变量回归 t 检验

ANCOVA

  • [ ] 等斜率模型的 几何含义(平行线)
  • [ ] 加入交互后允许不同斜率
  • [ ] 何时需要 ANCOVA:组间协变量不平衡

思考题

  1. 一个研究发现"喝咖啡和长寿正相关",回归系数显著。这能说明咖啡延寿吗?
  2. 简单回归中 R2=0.9,但残差 vs y^ 图呈明显 U 形,可信吗?
  3. 多元回归中两自变量相关性很高(0.95),t 检验都不显著但 F 检验非常显著,怎么解释?
  4. 为什么 ANCOVA 模型默认假设各组斜率相同?检验是否能放松?
  5. PI 比 CI 宽,但当 n 时它们趋同吗?为什么?