Skip to content

第 13 章:线性回归与 Lasso

本章从传统线性模型进入现代高维统计:先用最小二乘建立回归推断,再用正则化和 Lasso 处理变量选择与高维预测。


0. 本章定位

前面章节主要比较均值、方差、比例。
回归分析把问题改写为:

Y 如何随多个解释变量 X1,,Xp 改变?

知识链条:

线性模型
  -> 设计矩阵 X
  -> 最小二乘估计
  -> 投影与残差
  -> OLS 分布与检验
  -> 模型选择 / ANOVA / R²
  -> 正则化
  -> Lasso 稀疏估计
  -> KKT / 路径算法 / 风险界

本章信息量较大,可以分成两条并行主线:

  1. 经典低维回归p<n,重点是最小二乘、投影几何、精确分布、置信区间、t/F 检验、ANOVA、R2
  2. 高维稀疏回归p 可以很大,甚至 p>n,重点是正则化、Lasso、KKT、解路径、预测误差界、支持恢复。

两条主线的共同对象都是

y=Xβ+ε

区别在于:经典回归假设 XX 可逆,追求可解释的精确推断;高维回归允许变量很多,追求稳定预测和变量筛选。

0.1 内容结构导航

内容板块本指导对应位置要解决的问题
Advertising data1.0、1.1线性回归为什么自然出现?
Linear model / design matrix1.2-1.4如何把回归写成线性代数形式?
Least squares2OLS 怎么推出来?几何意义是什么?
Orthogonality / Gauss-Markov2.4、3.4为什么残差正交?OLS 为什么最优?
Statistical properties3-4β^、RSS、t/F 统计量如何分布?
Variable selection / ANOVA / R24如何比较 full/reduced model?
Risk of least squares5为什么高维时 OLS 有风险?
Regularization60,1,2 惩罚分别做什么?
Lasso KKT / uniqueness / path7-8Lasso 为什么稀疏?路径如何变化?
Slow/fast rates9Lasso 预测误差为什么是这些量级?
Support recovery9.6Lasso 何时能选对变量?
Non-convex penalties9.8为什么有人要改进 Lasso 的偏差?

1. 线性回归模型

1.0 从 Advertising Data 理解回归

以 Advertising data 为例:

  • 样本量:n=200
  • 响应变量:Sales,记为 yi
  • 三个解释变量:TV、Radio、Newspaper 广告预算,记为 xi1,xi2,xi3
  • 维度:p=3

我们关心的问题不是简单比较两组均值,而是:

在 TV、Radio、Newspaper 投放不同的情况下,Sales 的平均水平如何变化?

如果图上每个广告预算和销售额之间近似呈线性趋势,就可以尝试用线性模型描述:

yi=β0+β1xi1+β2xi2+β3xi3+εi

这里每个系数都有直观解释:

  • β0:所有广告预算为 0 时的基准销售额;
  • β1:TV 预算增加 1 个单位,其他预算固定时,平均销售额的线性变化;
  • β2:Radio 的边际线性影响;
  • β3:Newspaper 的边际线性影响。

“其他变量固定”是多元回归系数解释的关键,否则会把变量之间的相关性误当成某个单独变量的作用。

1.1 标量形式

对第 i 个观测:

yi=β0+β1xi1++βpxip+εi

其中:

  • yi:响应变量;
  • xij:第 j 个解释变量;
  • βj:回归系数;
  • εi:噪声。

通常假设:

E(εi)=0,Var(εi)=σ2

若进一步假设正态噪声:

εiN(0,σ2)

就可以做精确 t/F 推断。

1.1.1 响应变量、协变量和噪声

这里同时使用了几组术语:

角色常见名称
yiresponse、dependent variable、output
xicovariate、independent variable、predictor、feature、input、regressor
εinoise、error、随机扰动

线性回归并不是说真实世界没有非线性,而是说在当前建模尺度下,我们用一个线性平均结构解释主要趋势,把剩余部分放进 εi

1.1.2 噪声假设分层

不同结论需要不同强度的假设:

假设可推出的典型结论
E(εi)=0OLS 无偏
同方差、互不相关Gauss-Markov:OLS 是 BLUE
正态噪声β^ 正态、RSS 卡方、t/F 精确推断
独立同分布便于似然、预测和渐近分析

所以不要把“最小二乘估计能算出来”和“t 检验严格有效”混为一谈。前者主要是优化问题,后者需要概率模型。

1.2 矩阵形式

y=(y1,,yn)

设计矩阵:

X=(1x11x1p1x21x2p1xn1xnp)

参数:

β=(β0,β1,,βp)

模型:

y=Xβ+ε

1.3 抽象线性模型的空间表述

这里给出更抽象的线性模型定义。设

Y1,,YnN(μ,σ2)

线性模型就是对均值向量 μ 施加一个仿射子空间约束:

H0:μμ0Ω0

其中 Ω0Rn 中的线性子空间,维度为 k

如果

Ω0=span{x1,,xk}

则可写成:

μμ0=Xβ,βRk

此时 X 就是设计矩阵。

这套语言有两个好处:

  1. 回归就是投影:估计 μ 等于把 y 投影到由 X 张成的线性空间;
  2. 模型检验就是比较子空间:full model 与 reduced model 是两个嵌套子空间。

1.4 维度与截距项

若模型包含截距和 p 个解释变量,则参数个数为 p+1
在本章的符号里,有时 p 表示变量数,有时公式里的自由度写成 np1,原因正是截距消耗了 1 个自由度。

常见对应:

对象维度
样本向量 yn
设计矩阵 Xn×(p+1)
参数 βp+1
fitted space C(X)维度 p+1,若满列秩
residual space维度 np1

2. 最小二乘估计

2.1 目标函数

最小化残差平方和:

minβyXβ22

XX 可逆,则解为:

β^=(XX)1Xy

2.1.1 正规方程推导

展开目标函数:

Q(β)=yXβ22=(yXβ)(yXβ)

Q(β)=yy2βXy+βXXβ

β 求导:

Qβ=2Xy+2XXβ

令导数为 0:

XXβ^=Xy

这称为正规方程。若 XX 可逆,就得到

β^=(XX)1Xy

2.1.2 和最大似然的关系

εN(0,σ2I)

yXN(Xβ,σ2I)

对数似然中和 β 有关的部分为:

12σ2yXβ22

最大化似然等价于最小化残差平方和。因此在正态噪声下,OLS 也是 MLE。

2.2 拟合值与残差

拟合值:

y^=Xβ^

残差:

ε^=yy^

残差平方和:

RSS=ε^22=i=1n(yiy^i)2

2.3 投影矩阵

帽子矩阵:

H=X(XX)1X

于是

y^=Hy

残差:

ε^=(IH)y

关键几何性质:

Xε^=0

即残差向量与 X 的列空间正交。

2.4 投影几何:为什么残差正交?

拟合值 y^=Xβ^ 位于 X 的列空间:

C(X)={Xb:bRp+1}

最小二乘是在这个空间中找离 y 最近的点。欧氏空间中“最近点”的几何条件是:

yy^C(X)

因为 C(X)X 的列向量张成,等价于

X(yy^)=0

这就是正规方程:

Xy=XXβ^

2.5 Hat matrix 的性质

H=X(XX)1X

它是投影矩阵,因此满足:

H=H,H2=H

残差投影矩阵为:

IH

也满足:

(IH)=IH,(IH)2=IH

如果 X 满列秩且有 p+1 列:

rank(H)=p+1,rank(IH)=np1

这解释了为什么 RSS/σ2 的自由度是 np1


3. OLS 的统计性质

3.1 正态噪声下的分布

εN(0,σ2I)

β^N(β,σ2(XX)1)

并且

RSSσ2χnp12

无偏方差估计:

s2=RSSnp1

3.2 单个系数的 t 检验

cjj(XX)1 的第 j 个对角元素,则

β^jβjscjjtnp1

因此 βj 的置信区间:

β^j±tα/2,np1scjj

检验变量是否有用:

H0:βj=0

对应的 p-value 可用于变量筛选,但不能机械等同于因果结论。

3.2.1 β^ 与 RSS 独立

在正态线性模型中:

β^=(XX)1Xy

y 在线性空间 C(X) 上的投影坐标;而

ε^=(IH)y

y 在正交补空间上的投影。正态向量在正交子空间上的投影彼此独立,因此:

β^  RSS

这一步是 t 统计量成立的关键:

β^jβjσcjjN(0,1)

(np1)s2σ2=RSSσ2χnp12

两者独立,合起来就是 t 分布。

3.2.2 同时检验所有系数

还可写出整体二次型:

(β^β)XX(β^β)/(p+1)s2Fp+1,np1

它来自:

(β^β)XX(β^β)σ2χp+12

RSSσ2χnp12

相互独立。

3.3 Gauss-Markov 定理

若噪声满足:

E(εi)=0,Var(εi)=σ2,Cov(εi,εj)=0

则最小二乘估计是 BLUE:

Best Linear Unbiased Estimator

即在线性无偏估计量中方差最小。

3.4 Gauss-Markov 证明思路

本章的证明用矩阵半正定序来说明“OLS 方差最小”。

设某个线性估计量写成

Ay

要估计 β,无偏性要求:

E(Ay)=AXβ=β,β

所以

AX=I

OLS 对应的矩阵是:

A0=(XX)1X

任意其他线性无偏估计可写成:

A=A0+D

DX=0

方差矩阵:

Var(Ay)=σ2AA

代入:

AA=(A0+D)(A0+D)=A0A0+DD

交叉项为 0,因为 DX=0。因此

AAA0A0=(XX)1

这说明任意线性无偏估计的方差矩阵都不小于 OLS 的方差矩阵。

3.5 这一部分要形成的直觉

OLS = 投影
残差 = 正交补
正态 + 正交 = 独立
独立正态平方和 = χ²
正态 / sqrt(χ²/df) = t
两个χ²比 = F

这条链贯穿了第 10 章、第 12 章和本章的回归推断。


4. 预测、模型缩减与 ANOVA

4.1 均值响应置信区间

给定新输入向量 x,均值响应为 βx,估计为 β^x

置信区间:

β^x±tα/2,np1sx(XX)1x

严格说,这里是均值响应的置信区间
若要预测一个新的随机观测值

Ynew=xβ+εnew

则还要把新噪声方差 σ2 加进去,预测区间标准误通常为:

s1+x(XX)1x

“prediction interval”一词有时更接近“mean response interval”的形式,学习时要区分:

目标标准误
估计平均响应 E(Yx)sx(XX)1x
预测新观测 Ynews1+x(XX)1x

4.2 模型缩减检验

若想检验一组变量是否都无用:

H0:βi1==βir=0

通常比较 full model 与 reduced model 的残差平方和。

这里用投影空间语言表达:

H0:P(y)L(Ac)

核心统计量是 F 比:

F=reduced model 相比 full model 增加的解释平方和/rRSSfull/(np1)

F 大,说明删掉这些变量会显著恶化拟合,拒绝模型缩减。

4.2.1 full model 与 reduced model

设 full model 的拟合值为 y^,reduced model 的拟合值为 y^0

由于 reduced model 是 full model 的子模型:

C(X0)C(X)

因此可以分解:

yy^0=(yy^)+(y^y^0)

并且两部分正交。于是平方和分解:

yy^02=yy^2+y^y^02

也就是:

RSSreduced=RSSfull+SSextra

其中

SSextra=y^y^02

衡量被删掉变量额外解释的变异。

4.2.2 本章中的 F 统计量

若 full model 相比 reduced model 多了 q 个参数,则:

F=(RSSreducedRSSfull)/qRSSfull/(np1)Fq,np1

可写为:

F=y^y^02/(p+1r)yy^2/(np1)

这只是用投影距离表达同一件事。

4.2.3 常见整体显著性检验

最常见的是:

H0:β1==βp=0

即除了截距以外所有变量都没有线性解释力。
reduced model 只包含截距,拟合值是:

y^0=y¯1

若拒绝 H0,说明至少有一个解释变量有线性关联。

4.2.4 Deviance / ANOVA 表

常用 deviance table 或 ANOVA table 描述平方和分解。在线性回归里可理解为:

来源平方和自由度均方F 比
模型解释TSSRSSp(TSSRSS)/p(TSSRSS)/pRSS/(np1)
残差RSSnp1RSS/(np1)
总变异TSSn1

其中

TSS=i=1n(yiy¯)2

ANOVA 表背后的几何事实仍然是:投影分量正交,所以平方和可以相加。

4.3 R2 与 adjusted R2

R2 表示总变异中被模型解释的比例:

R2=1RSSTSS

加入变量通常不会降低 R2,所以 adjusted R2 会对变量数做惩罚,更适合比较复杂度不同的模型。

4.3.1 R2 的含义

如果不用任何解释变量,最好的预测是 y¯,对应总变异:

TSS=yy¯12

使用模型后,残差变异是:

RSS=yy^2

所以

R2=1RSSTSS

表示模型解释掉的总变异比例。

4.3.2 adjusted R2

这里给出的修正思想是用自由度惩罚变量数量:

Radj2=1RSS/(nk)TSS/(n1)

其中 k 是模型参数个数。若包含截距和 p 个变量,通常 k=p+1

加入变量时:

  • RSS 一定不增;
  • 但自由度 nk 减少;
  • 如果新增变量带来的 RSS 降幅不足,Radj2 会下降。

因此 Radj2R2 更适合比较不同复杂度模型。


5. 为什么需要正则化?

p 较大或变量高度相关时,最小二乘会出现问题:

  • XX 不可逆;
  • OLS 解不唯一;
  • 预测方差大;
  • 变量选择不稳定;
  • p>n 时传统 OLS 无法直接使用。

正则化的思想:

拟合数据
  + 控制模型复杂度
  -> 更稳定的预测 / 更稀疏的变量选择

5.1 最小二乘在高维下的风险

本章在进入 Lasso 前先讨论 Least Squares 的风险。

最小二乘问题:

minβRpyXβ22

rank(X)=p

则解唯一。

但当 p>n 或列之间线性相关时:

rank(X)<p

此时可能有无穷多个 β 给出同样的训练误差。虽然 fitted value Xβ^ 可能仍然确定,但系数本身不稳定。

5.2 预测不稳定的原因

在训练样本上,两个解可能满足:

Xβ^(1)=Xβ^(2)

但对新样本 x0

x0β^(1)x0β^(2)

也就是说,训练集上等价的模型,在样本外可能预测不同。

这正是高维或共线性条件下需要正则化的原因:我们不仅要拟合训练数据,还要选择一个稳定、简单、可泛化的解。

5.3 正则化的两种等价视角

约束形式:

minβCyXβ22

惩罚形式:

minβyXβ22+P(β)

直观区别:

形式含义
约束形式只在“允许的复杂度集合”中找最优拟合
惩罚形式拟合误差和复杂度惩罚之间做 trade-off

在凸问题中,很多约束形式和惩罚形式可以通过调节参数互相对应。


6. 三类正则化:Subset、Ridge、Lasso

6.1 约束形式

Best subset:

minβyXβ22s.t.β0k

Lasso:

minβyXβ22s.t.β1t

Ridge:

minβyXβ22s.t.β22t

6.2 惩罚形式

Best subset:

minβ12yXβ22+λβ0

Lasso:

minβ12yXβ22+λβ1

Ridge:

minβ12yXβ22+λβ22

6.3 三者区别

方法惩罚是否稀疏特点
Best subset0直接选变量,但计算困难
Lasso1凸优化,可变量选择
Ridge2稳定收缩,但不会置零

6.4 三种范数的几何差异

β0=j=1p1{βj0}

统计的是非零系数个数,最直接表达“稀疏”,但优化是组合问题。

β1=j=1p|βj|

是凸的,并且约束集合有尖角,最优解容易落在坐标轴上,因此产生稀疏。

β2=(j=1pβj2)1/2

约束集合圆滑,主要产生连续收缩,很少把系数精确压成 0。

6.5 正交设计下的三类解

XX=I,最小二乘系数为

z=Xy

则:

Best subset

β^j=zj1{|zj|>2λ}

这是 hard-thresholding:小系数直接置零,大系数不收缩。

Lasso

β^j=sign(zj)(|zj|λ)+

这是 soft-thresholding:小系数置零,大系数也向 0 收缩 λ

Ridge

β^j=zj1+2λ

所有系数按比例缩小,不会精确置零。

6.6 Oracle estimator

假设真实非零集合为

S=supp(β0),s0=|S|

如果有“神谕”提前告诉我们 S,最理想的做法是在真实支持集上做最小二乘:

β^Soracle=(XSXS)1XSy,β^Soracle=0

它的样本内预测风险量级为:

1nXβ^oracleXβ022σ2s0n

真实问题中 S 不知道,Lasso 的目标之一就是在不知道 S 的情况下尽量接近 oracle 的表现。


7. Lasso 的 KKT 条件

Lasso 解 β^ 满足:

X(yXβ^)=λs

其中 sβ^1,逐坐标为:

sj={1,β^j>01,β^j<0[1,1],β^j=0

等价理解:

  • 若变量进入模型,残差与该变量的相关达到阈值 λ
  • 若变量没进入模型,残差与该变量的相关不超过 λ

这解释了 Lasso 为什么会产生稀疏解。

7.1 KKT 条件的逐坐标解释

令残差

r=yXβ^

KKT 条件为:

Xjr=λsj

因此:

β^j0

|Xjr|=λ

β^j=0

|Xjr|λ

这说明 Lasso 的变量选择规则是:只有当某个变量与当前残差的相关性足够大,达到阈值 λ,它才可能进入模型。

7.2 Lasso 解的唯一性

需要注意:Lasso 的系数解 β^ 不一定唯一,因为当 XX 奇异时,目标函数不是严格凸的。

但 fitted value 通常是唯一的:

Xβ^ 唯一

原因是平方损失关于 Xβ 是严格凸的。即使有多个 β^,它们给出的 Xβ^ 相同。

这带来两个后果:

  1. 残差 r=yXβ^ 唯一;
  2. 最优 subgradient s=Xr/λ 唯一。

7.3 等相关集(Equicorrelation Set)

定义等相关集:

E={j:|Xj(yXβ^)|=λ}

等价地:

E={j:|sj|=1}

它表示与 Lasso 残差相关性达到最大阈值的变量集合。

主动集:

A=supp(β^)

一定满足:

AE

因为若 β^j0,KKT 必然要求 |sj|=1
但反过来不一定成立:某些变量达到相关阈值,却未必在某个 Lasso 解中非零。

7.4 给定 active set 时的解形式

若主动集为 A,符号为

sA=sign(β^A)

KKT 在 active set 上给出:

XA(yXAβ^A)=λsA

解得:

β^A=(XAXA)1(XAyλsA),β^A=0

与 active set 上的 OLS 解

(XAXA)1XAy

相比,Lasso 多了

λ(XAXA)1sA

这正是 Lasso 的 shrinkage bias 来源。

7.5 Lasso 的偏差

Lasso 通过 1 惩罚换来稀疏性,但代价是系数向 0 收缩。
因此即使选对了变量,系数估计也通常有偏。

这就是 后续介绍非凸惩罚的动机:希望保留稀疏性,同时减少大信号的收缩偏差。


8. Lasso 路径与软阈值

8.1 正交设计下的直观解

X 的列正交,则:

Best subset 是 hard-thresholding:

β^subset=H2λ(Xy)

Lasso 是 soft-thresholding:

β^lasso=Sλ(Xy)

Ridge 是连续缩小:

β^ridge=Xy1+2λ

8.2 Lasso solution path

随着 λ 从大到小:

  • λ 很大时,β^=0
  • 变量逐渐进入模型;
  • 系数路径是分段线性的;
  • 路径算法通过 KKT 条件跟踪 knot。

这与 Least Angle Regression (LARS) 密切相关。

8.3 为什么路径是分段线性的?

Lasso 的 KKT 条件为:

X(yXβ^(λ))=λs

在某一段路径上,如果 active set A 和符号 sA 不变,则

β^A(λ)=(XAXA)1(XAyλsA)

这是 λ 的线性函数。
只有当发生下面两种事件之一时,路径才换到下一段:

  1. 某个 inactive variable 与残差相关达到阈值,进入等相关集;
  2. 某个 active coefficient 变成 0,离开 active set。

因此 Lasso solution path 是连续、分段线性的。

8.4 路径算法的起点

λ 足够大时:

β^(λ)=0

由 KKT:

Xy=λs,s1

所以零解成立当且仅当:

λXy

路径第一个 knot:

λ1=Xy

λλ1 继续下降,首先进入模型的是与 y 绝对相关最大的变量。

8.5 hitting time 与 crossing time

路径算法反复检查两类时间:

  • hitting time:某个当前未选变量满足 |Xjr|=λ,准备进入;
  • crossing time:某个当前已选变量的系数沿线性路径变成 0,准备退出。

算法每一步选更早发生的事件,更新 active set 和 signs,然后继续沿新的线性方向走。

这就是 LARS in lasso mode 的核心。

8.6 路径算法的直观流程

初始化:λ1 = ||X^T y||∞, β(λ)=0
重复:
  1. 当前 active set A 和 signs sA 固定
  2. 按 βA(λ)=(XA^T XA)^(-1)(XA^T y-λsA) 线性移动
  3. 计算下一个 hitting time
  4. 计算下一个 crossing time
  5. 取较大的下一个 λ knot
  6. 更新 A 和 sA
直到 λ=0 或达到所需模型复杂度

高可读性的理解:Lasso 不是对每个 λ 从头优化,而是沿着一条由 KKT 条件控制的分段直线走。


9. Lasso 的风险界:慢速率与快速率

9.1 慢速率

在线性模型

y=Xβ0+ε

Xj22n、高斯噪声下,Lasso 可得预测误差界,量级类似:

1nXβ^Xβ022β01σlogpn

这是较一般条件下的慢速率。

9.2 快速率

若设计矩阵满足 compatibility condition 或 restricted eigenvalue condition,则可得到更强的 oracle 型界:

1nXβ^Xβ022σ2s0logpn

其中:

  • s0=|supp(β0)| 是真实非零变量个数;
  • logp 是高维变量选择代价;
  • 该速率接近 best subset 的理想表现。

9.3 支持恢复

若还满足更强条件,例如:

  • true support 上设计矩阵条件良好;
  • irrelevant variables 与 relevant variables 相关不太强;
  • 非零系数足够大;

则 Lasso 有可能恢复真实支持集:

supp(β^)=supp(β0)

9.4 慢速率推导的核心不等式

先考虑 bound form,取

β^1β01

因为 β^ 最小化训练误差,所以

yXβ^22yXβ022

代入 y=Xβ0+ε

Xβ^Xβ0222ε,Xβ^Xβ0

再写成:

2Xε,β^β02Xεβ^β01

由于

β^β01β^1+β012β01

得到:

Xβ^Xβ0224β01Xε

εN(0,σ2I)Xj22n,则高概率下:

Xεσnlog(ep/δ)

所以:

1nXβ^Xβ022σβ01log(ep/δ)n

这就是慢速率的来源。

9.4.1 penalized form 的慢速率

惩罚形式:

β^=argminβ12yXβ22+λβ1

由最优性:

12yXβ^22+λβ^112yXβ022+λβ01

整理:

Xβ^Xβ0222Xε,β^β0+2λ(β01β^1)

若选择

λXε

就得到与约束形式同量级的预测误差界。

9.5 快速率:compatibility condition

慢速率只需要列归一化,因此很一般,但速率包含 β01,不一定体现真实稀疏度 s0

为了得到

s0logpn

这样的快速率,需要对设计矩阵加条件。

本章的 compatibility condition:

对真实支持集 S,存在 ϕ0>0,使得对所有满足

vS13vS1

v,有

1nXv22ϕ02s0vS12

直觉:如果一个向量主要集中在真实支持集附近,那么 Xv 不能太小。
也就是说,设计矩阵不能把真实方向上的信号“压扁”。

在该条件下,可得:

1nXβ^Xβ02272σ2s0log(ep/δ)nϕ02

高概率至少为 1δ

9.5.1 cone condition 从哪里来?

快速率推导中会先证明:

β^Sβ0,S13β^Sβ0,S1

因为 β0,S=0,所以

β^S13β^Sβ0,S1

这说明误差向量 β^β0 落在一个 cone 里。
compatibility condition 正是只要求设计矩阵在这个 cone 上表现良好,而不是在整个 Rp 上满秩。

9.5.2 Restricted eigenvalue condition

另一个常用条件是 restricted eigenvalue:

对所有 |J|=s0

vJc13vJ1

v,有

1nXv22ϕ02v22

它可以推出系数误差界:

β^β022s0logpnϕ04

直觉:虽然 p>nXX 不可能全局正定,但我们只需要它在稀疏方向上像正定矩阵。

9.6 支持恢复:Primal-Dual Witness

本章的支持恢复部分目标更强:

supp(β^)=S,sign(β^S)=sign(β0,S)

方法叫 primal-dual witness,流程:

  1. 假设真实支持集 S 就是 active set;
  2. S 上解 restricted Lasso;
  3. Sc 上构造 dual variable;
  4. 验证 S 上符号正确;
  5. 验证 Sc 上 strict dual feasibility:
sS<1

如果这些条件成立,就证明 Lasso 选对了变量和符号。

9.6.1 支持恢复所需条件

可归纳为三类条件。

1. Mutual incoherence

对某个 γ>0

(XSXS)1XSXj11γ,jS

含义:非真实变量不能被真实变量线性解释得太好。否则 Lasso 很难区分谁是真变量、谁是替代变量。

2. Minimum eigenvalue

Λmin(1nXSXS)C

含义:真实变量之间不能严重共线。

3. Minimum signal

β0,min=minjS|β0,j| 足够大

含义:真实非零系数必须大到能从噪声和 Lasso 收缩中被识别出来。

9.6.2 支持恢复比预测难

预测误差小不代表变量一定选对。
若两个变量高度相关,选 X1X2 可能预测差不多,但支持集完全不同。

因此:

慢速率:几乎不要求 X
快速率:要求 X 在稀疏方向上好
支持恢复:还要求非真变量与真变量低相关、真信号足够大

9.7 Minimax bounds

最后给出稀疏线性模型的 minimax prediction error:

M(s0,n,p)=infβ^supβ00s01nXβ^Xβ022

在适当条件下,上下界同阶:

M(s0,n,p)s0log(p/s0)n

这说明 s0logp/n 不是 Lasso 分析的偶然产物,而是高维稀疏预测问题本身的统计难度。

9.8 非凸惩罚:为什么要超越 Lasso?

Lasso 的 1 惩罚会对所有非零系数持续施加同样的收缩,因此大信号也会被拉向 0,产生偏差。

改进思路:使用非凸惩罚,使小系数被压成 0,但大系数受到较小惩罚。

常见的还有两类:

γ penalty

P(t)=tγ,0<γ<1

它比 1 更强烈鼓励稀疏,但优化非凸。

SCAD

SCAD 的思想是:

  • 小系数附近像 Lasso 一样强惩罚;
  • 中等系数逐渐降低惩罚;
  • 大系数几乎不再惩罚,从而减少偏差。

非凸惩罚通常有更好的统计性质,但优化更难,可能存在局部最优。


10. 本章知识图谱

                    线性回归与 Lasso
                            |
       ┌────────────────────┼────────────────────┐
       |                    |                    |
    经典回归              模型推断              正则化
       |                    |                    |
 y=Xβ+ε                 β_hat 分布             subset / ridge / lasso
       |                    |                    |
 最小二乘               t 检验 / CI            ℓ0 / ℓ2 / ℓ1
       |                    |                    |
 投影 H                 F 检验 / ANOVA         KKT 条件
       |                    |                    |
 残差正交               R² / adjusted R²       稀疏性 / 路径算法
                                                |
                                          慢速率 / 快速率 / 支持恢复

更完整地看,本章知识图谱可以展开为:

线性回归与 Lasso
 |
 |-- 经典线性模型
 |     |
 |     |-- 数据结构
 |     |     y_i = β0 + β1x_i1 + ... + βp x_ip + ε_i
 |     |     y = Xβ + ε
 |     |
 |     |-- 最小二乘
 |     |     min ||y-Xβ||²
 |     |     β_hat = (X'X)^(-1)X'y
 |     |
 |     |-- 几何
 |     |     H = X(X'X)^(-1)X'
 |     |     y_hat = Hy
 |     |     residual = (I-H)y
 |     |     X'residual = 0
 |     |
 |     |-- 分布
 |     |     β_hat ~ N(β, σ²(X'X)^(-1))
 |     |     RSS/σ² ~ χ²_{n-p-1}
 |     |     β_hat ⟂ RSS
 |     |
 |     |-- 推断
 |           coefficient t-test
 |           model reduction F-test
 |           ANOVA / deviance table
 |           R² / adjusted R²
 |
 |-- 高维正则化
       |
       |-- OLS 风险
       |     rank(X)<p -> 解不唯一 / 不稳定
       |
       |-- penalty
       |     ℓ0 subset: sparse but hard
       |     ℓ1 lasso: sparse and convex
       |     ℓ2 ridge: stable but not sparse
       |
       |-- Lasso 优化
       |     min 1/2||y-Xβ||² + λ||β||1
       |     KKT: X'(y-Xβ_hat)=λs
       |     active set A ⊂ equicorrelation set E
       |
       |-- Lasso 路径
       |     λ1=||X'y||∞
       |     piecewise linear path
       |     hitting / crossing events
       |
       |-- 理论
             slow rate: ||β0||1 sqrt(log p/n)
             fast rate: s0 log p/n
             support recovery: incoherence + signal strength
             minimax: s0 log(p/s0)/n
             nonconvex penalties reduce bias

11. 易错点与考点

误区正确认识
回归系数显著就是因果显著性不等于因果,需要设计或识别假设
残差和响应变量正交残差与设计矩阵列空间正交
R2 越高模型越好加变量可机械提高 R2,要看 adjusted R2 和泛化
Ridge 能做变量选择Ridge 收缩但通常不置零
Lasso 解总唯一系数不一定唯一,但 fitted value 常唯一
Lasso 无偏Lasso 有收缩偏差
p>n 时 OLS 还能正常唯一通常不可逆,需要正则化
R2 可以直接用于变量选择R2 会随变量增加而不降,应看 adjusted R2、验证误差或检验
Lasso 选中变量就说明因果有效Lasso 是预测/选择工具,不自动给因果解释
快速率不需要设计条件必须有 compatibility 或 restricted eigenvalue 等条件
预测好就一定支持恢复好高相关变量下预测可好,但变量选择可能错
λ 越小越好λ 小偏差小但方差大,可能过拟合

12. 关键公式速查表

内容公式
线性模型y=Xβ+ε
OLSβ^=(XX)1Xy
Hat matrixH=X(XX)1X
残差ε^=(IH)y
残差正交Xε^=0
OLS 分布β^N(β,σ2(XX)1)
方差估计s2=RSS/(np1)
系数 t(β^jβj)/(scjj)
Lassominβ12|yXβ|22+λ|β|1
Lasso KKTX(yXβ^)=λs
快速率|Xβ^Xβ0|22/nσ2s0logp/n
等相关集$E={j:
active set 解β^A=(XAXA)1(XAyλsA)
第一个 knotλ1=|Xy|
慢速率|Xβ^Xβ0|22/nσ|β0|1logp/n
compatibility|Xv|22/n(ϕ02/s0)|vS|12
minimax rateM(s0,n,p)s0log(p/s0)/n

13. 学习建议

  1. 先把线性模型的几何图像想清楚:拟合是投影,残差与列空间正交。
  2. 经典推断围绕 β^ 的正态分布和 RSS 的卡方分布。
  3. 模型缩减检验本质上比较 full model 和 reduced model。
  4. 正则化要从“控制复杂度”理解,不只是为了计算。
  5. Lasso 的核心是 1 惩罚带来的稀疏性,KKT 条件是理解它的最好入口。
  6. 高维理论重点看速率:为什么出现 s0logp/n,以及它需要什么设计条件。
  7. 若时间有限,经典回归先掌握 OLS -> 投影 -> t/F 推断;Lasso 先掌握 KKT -> 稀疏 -> 路径 -> 风险界
  8. 对 Lasso 理论不要只背结论,要分清三种目标:预测误差小、系数估计准、支持集恢复正确。它们所需条件越来越强。

14. 本章复习清单

14.1 线性回归部分必须会

  1. 用 Advertising data 说清楚 n,p,y,X,β 分别是什么。
  2. 从最小二乘目标函数推导正规方程。
  3. 解释 H=X(XX)1X 为什么是投影矩阵。
  4. 证明或说明残差正交:
X(yXβ^)=0
  1. 写出 β^ 的分布:
β^N(β,σ2(XX)1)
  1. 写出 RSS 的分布和自由度:
RSS/σ2χnp12
  1. 写出单个系数的 t 检验统计量。
  2. 写出模型缩减的 F 检验。
  3. 解释 R2 为什么随变量数增加而不降。
  4. 解释 adjusted R2 如何惩罚变量数。

14.2 Lasso 算法部分必须会

  1. 说清楚 best subset、ridge、Lasso 的惩罚差异。
  2. 解释为什么 1 会导致稀疏。
  3. 正交设计下写出 hard-thresholding、soft-thresholding、ridge shrinkage。
  4. 写出 Lasso KKT:
X(yXβ^)=λs
  1. 用 KKT 说明:
β^j=0|Xjr|λ
  1. 定义等相关集 E,并说明 AE
  2. 说明 fitted value 唯一但系数不一定唯一。
  3. 解释 Lasso path 为什么分段线性。
  4. 写出第一个 knot:
λ1=Xy
  1. 说清 hitting time 与 crossing time 的含义。

14.3 Lasso 理论部分必须会

  1. 慢速率需要的假设:列归一化 + 高斯噪声。
  2. 慢速率形式:
1nXβ^Xβ02σβ01logpn
  1. 快速率为什么需要 compatibility / restricted eigenvalue。
  2. 快速率形式:
1nXβ^Xβ02σ2s0logpn
  1. 支持恢复需要更强条件:mutual incoherence、minimum eigenvalue、minimum signal。
  2. 解释为什么支持恢复比预测更难。
  3. 知道 minimax rate:
s0log(p/s0)n
  1. 知道非凸惩罚的目的:减少 Lasso 对大系数的偏差。

15. 综合深化:条件效应、可识别性与高维稳定性

15.1 边缘相关与条件相关

简单回归中的系数描述 XjY 的边缘线性关系;多元回归中的 βj 描述在其他协变量固定时,Xj 增加一个单位所对应的条件均值变化。两者可能大小不同,甚至符号相反。

例如广告数据中,报纸预算可能因与电视、广播预算相关而呈现边缘相关;进入多元模型后,其系数检验回答的是“控制其他媒体预算后,额外报纸预算是否仍有线性关联”。这不是边缘相关问题,也不能自动作因果解释。

15.2 秩亏时参数为什么不可识别

rank(X)<p,则存在非零向量 η 使 Xη=0。于是对任意 β

X(β+η)=Xβ.

数据无法区分 ββ+η,所以单个系数不可识别。训练样本上的最小二乘拟合值仍是 YC(X) 上的正交投影,因而可以唯一;但对新协变量 xnew,若 xnewη0,不同解会给出不同预测。

Ridge 通过严格凸的 2 惩罚选出唯一解;Lasso 的系数解未必唯一,但在常见条件下拟合值和残差唯一。正则化是在额外结构假设下选择可用解,并没有从原数据中恢复本来不可识别的信息。

15.3 Gauss--Markov 定理不要求正态误差

在线性模型 Y=Xβ+ε 中,若 X 列满秩、E(εX)=0Var(εX)=σ2I,则 OLS 在所有线性无偏估计量中方差最小,即为 BLUE。这个结论本身不要求误差正态。

正态性主要用于有限样本下精确的 t、F 分布推断。若存在异方差,可使用异方差稳健标准误;若观测相关,则需要聚类稳健标准误、广义最小二乘或显式相关结构。

15.4 Lasso 的 KKT 条件与等角集

对目标函数

12YXβ22+λβ1,

最优解 β^ 满足

X(YXβ^)=λz,zj={sign(β^j),β^j0,[1,1],β^j=0.

因此活动变量必定与残差达到边界相关性 |Xjr|=λ;非活动变量满足 |Xjr|λ。达到最大允许相关性的变量构成等角集,它帮助解释路径算法以及系数解非唯一时仍保持拟合值稳定的原因。

15.5 预测、估计与变量选择是不同目标

在稀疏高维模型中,Lasso 可在适当设计条件下取得良好预测误差率;但恢复真实非零变量的符号与支持集需要更强的不可相关条件和最小信号条件。因而:

  • 预测准确不保证选择出的变量就是“真正原因”;
  • 系数稳定不保证因果可解释;
  • 交叉验证适合选择预测调参值,却不自动提供传统检验意义下的 p-value;
  • 若目标是变量选择后的推断,需要样本分割、去偏 Lasso 或选择性推断等专门方法。

建模前应先声明目标是预测、参数估计、变量筛选还是因果效应,因为这些目标所需的假设与评价标准并不相同。