Appearance
第 13 章:线性回归与 Lasso
本章从传统线性模型进入现代高维统计:先用最小二乘建立回归推断,再用正则化和 Lasso 处理变量选择与高维预测。
0. 本章定位
前面章节主要比较均值、方差、比例。
回归分析把问题改写为:
知识链条:
线性模型
-> 设计矩阵 X
-> 最小二乘估计
-> 投影与残差
-> OLS 分布与检验
-> 模型选择 / ANOVA / R²
-> 正则化
-> Lasso 稀疏估计
-> KKT / 路径算法 / 风险界本章信息量较大,可以分成两条并行主线:
- 经典低维回归:
,重点是最小二乘、投影几何、精确分布、置信区间、 检验、ANOVA、 。 - 高维稀疏回归:
可以很大,甚至 ,重点是正则化、Lasso、KKT、解路径、预测误差界、支持恢复。
两条主线的共同对象都是
区别在于:经典回归假设
0.1 内容结构导航
| 内容板块 | 本指导对应位置 | 要解决的问题 |
|---|---|---|
| Advertising data | 1.0、1.1 | 线性回归为什么自然出现? |
| Linear model / design matrix | 1.2-1.4 | 如何把回归写成线性代数形式? |
| Least squares | 2 | OLS 怎么推出来?几何意义是什么? |
| Orthogonality / Gauss-Markov | 2.4、3.4 | 为什么残差正交?OLS 为什么最优? |
| Statistical properties | 3-4 | |
| Variable selection / ANOVA / | 4 | 如何比较 full/reduced model? |
| Risk of least squares | 5 | 为什么高维时 OLS 有风险? |
| Regularization | 6 | |
| Lasso KKT / uniqueness / path | 7-8 | Lasso 为什么稀疏?路径如何变化? |
| Slow/fast rates | 9 | Lasso 预测误差为什么是这些量级? |
| Support recovery | 9.6 | Lasso 何时能选对变量? |
| Non-convex penalties | 9.8 | 为什么有人要改进 Lasso 的偏差? |
1. 线性回归模型
1.0 从 Advertising Data 理解回归
以 Advertising data 为例:
- 样本量:
; - 响应变量:Sales,记为
; - 三个解释变量:TV、Radio、Newspaper 广告预算,记为
; - 维度:
。
我们关心的问题不是简单比较两组均值,而是:
在 TV、Radio、Newspaper 投放不同的情况下,Sales 的平均水平如何变化?如果图上每个广告预算和销售额之间近似呈线性趋势,就可以尝试用线性模型描述:
这里每个系数都有直观解释:
:所有广告预算为 0 时的基准销售额; :TV 预算增加 1 个单位,其他预算固定时,平均销售额的线性变化; :Radio 的边际线性影响; :Newspaper 的边际线性影响。
“其他变量固定”是多元回归系数解释的关键,否则会把变量之间的相关性误当成某个单独变量的作用。
1.1 标量形式
对第
其中:
:响应变量; :第 个解释变量; :回归系数; :噪声。
通常假设:
若进一步假设正态噪声:
就可以做精确
1.1.1 响应变量、协变量和噪声
这里同时使用了几组术语:
| 角色 | 常见名称 |
|---|---|
| response、dependent variable、output | |
| covariate、independent variable、predictor、feature、input、regressor | |
| noise、error、随机扰动 |
线性回归并不是说真实世界没有非线性,而是说在当前建模尺度下,我们用一个线性平均结构解释主要趋势,把剩余部分放进
1.1.2 噪声假设分层
不同结论需要不同强度的假设:
| 假设 | 可推出的典型结论 |
|---|---|
| OLS 无偏 | |
| 同方差、互不相关 | Gauss-Markov:OLS 是 BLUE |
| 正态噪声 | |
| 独立同分布 | 便于似然、预测和渐近分析 |
所以不要把“最小二乘估计能算出来”和“
1.2 矩阵形式
令
设计矩阵:
参数:
模型:
1.3 抽象线性模型的空间表述
这里给出更抽象的线性模型定义。设
线性模型就是对均值向量
其中
如果
则可写成:
此时
这套语言有两个好处:
- 回归就是投影:估计
等于把 投影到由 张成的线性空间; - 模型检验就是比较子空间:full model 与 reduced model 是两个嵌套子空间。
1.4 维度与截距项
若模型包含截距和
在本章的符号里,有时
常见对应:
| 对象 | 维度 |
|---|---|
| 样本向量 | |
| 设计矩阵 | |
| 参数 | |
| fitted space | 维度 |
| residual space | 维度 |
2. 最小二乘估计
2.1 目标函数
最小化残差平方和:
若
2.1.1 正规方程推导
展开目标函数:
即
对
令导数为 0:
这称为正规方程。若
2.1.2 和最大似然的关系
若
则
对数似然中和
最大化似然等价于最小化残差平方和。因此在正态噪声下,OLS 也是 MLE。
2.2 拟合值与残差
拟合值:
残差:
残差平方和:
2.3 投影矩阵
帽子矩阵:
于是
残差:
关键几何性质:
即残差向量与
2.4 投影几何:为什么残差正交?
拟合值
最小二乘是在这个空间中找离
因为
这就是正规方程:
2.5 Hat matrix 的性质
它是投影矩阵,因此满足:
残差投影矩阵为:
也满足:
如果
这解释了为什么
3. OLS 的统计性质
3.1 正态噪声下的分布
若
则
并且
无偏方差估计:
3.2 单个系数的 检验
记
因此
检验变量是否有用:
对应的 p-value 可用于变量筛选,但不能机械等同于因果结论。
3.2.1 与 RSS 独立
在正态线性模型中:
是
是
这一步是
而
两者独立,合起来就是
3.2.2 同时检验所有系数
还可写出整体二次型:
它来自:
与
相互独立。
3.3 Gauss-Markov 定理
若噪声满足:
则最小二乘估计是 BLUE:
Best Linear Unbiased Estimator即在线性无偏估计量中方差最小。
3.4 Gauss-Markov 证明思路
本章的证明用矩阵半正定序来说明“OLS 方差最小”。
设某个线性估计量写成
要估计
所以
OLS 对应的矩阵是:
任意其他线性无偏估计可写成:
且
方差矩阵:
代入:
交叉项为 0,因为
这说明任意线性无偏估计的方差矩阵都不小于 OLS 的方差矩阵。
3.5 这一部分要形成的直觉
OLS = 投影
残差 = 正交补
正态 + 正交 = 独立
独立正态平方和 = χ²
正态 / sqrt(χ²/df) = t
两个χ²比 = F这条链贯穿了第 10 章、第 12 章和本章的回归推断。
4. 预测、模型缩减与 ANOVA
4.1 均值响应置信区间
给定新输入向量
置信区间:
严格说,这里是均值响应的置信区间。
若要预测一个新的随机观测值
则还要把新噪声方差
“prediction interval”一词有时更接近“mean response interval”的形式,学习时要区分:
| 目标 | 标准误 |
|---|---|
| 估计平均响应 | |
| 预测新观测 |
4.2 模型缩减检验
若想检验一组变量是否都无用:
通常比较 full model 与 reduced model 的残差平方和。
这里用投影空间语言表达:
核心统计量是 F 比:
若
4.2.1 full model 与 reduced model
设 full model 的拟合值为
由于 reduced model 是 full model 的子模型:
因此可以分解:
并且两部分正交。于是平方和分解:
也就是:
其中
衡量被删掉变量额外解释的变异。
4.2.2 本章中的 F 统计量
若 full model 相比 reduced model 多了
可写为:
这只是用投影距离表达同一件事。
4.2.3 常见整体显著性检验
最常见的是:
即除了截距以外所有变量都没有线性解释力。
reduced model 只包含截距,拟合值是:
若拒绝
4.2.4 Deviance / ANOVA 表
常用 deviance table 或 ANOVA table 描述平方和分解。在线性回归里可理解为:
| 来源 | 平方和 | 自由度 | 均方 | F 比 |
|---|---|---|---|---|
| 模型解释 | ||||
| 残差 | ||||
| 总变异 |
其中
ANOVA 表背后的几何事实仍然是:投影分量正交,所以平方和可以相加。
4.3 与 adjusted
加入变量通常不会降低
4.3.1 的含义
如果不用任何解释变量,最好的预测是
使用模型后,残差变异是:
所以
表示模型解释掉的总变异比例。
4.3.2 adjusted
这里给出的修正思想是用自由度惩罚变量数量:
其中
加入变量时:
一定不增; - 但自由度
减少; - 如果新增变量带来的
降幅不足, 会下降。
因此
5. 为什么需要正则化?
当
不可逆; - OLS 解不唯一;
- 预测方差大;
- 变量选择不稳定;
时传统 OLS 无法直接使用。
正则化的思想:
拟合数据
+ 控制模型复杂度
-> 更稳定的预测 / 更稀疏的变量选择5.1 最小二乘在高维下的风险
本章在进入 Lasso 前先讨论 Least Squares 的风险。
最小二乘问题:
若
则解唯一。
但当
此时可能有无穷多个
5.2 预测不稳定的原因
在训练样本上,两个解可能满足:
但对新样本
也就是说,训练集上等价的模型,在样本外可能预测不同。
这正是高维或共线性条件下需要正则化的原因:我们不仅要拟合训练数据,还要选择一个稳定、简单、可泛化的解。
5.3 正则化的两种等价视角
约束形式:
惩罚形式:
直观区别:
| 形式 | 含义 |
|---|---|
| 约束形式 | 只在“允许的复杂度集合”中找最优拟合 |
| 惩罚形式 | 拟合误差和复杂度惩罚之间做 trade-off |
在凸问题中,很多约束形式和惩罚形式可以通过调节参数互相对应。
6. 三类正则化:Subset、Ridge、Lasso
6.1 约束形式
Best subset:
Lasso:
Ridge:
6.2 惩罚形式
Best subset:
Lasso:
Ridge:
6.3 三者区别
| 方法 | 惩罚 | 是否稀疏 | 特点 |
|---|---|---|---|
| Best subset | 是 | 直接选变量,但计算困难 | |
| Lasso | 是 | 凸优化,可变量选择 | |
| Ridge | 否 | 稳定收缩,但不会置零 |
6.4 三种范数的几何差异
统计的是非零系数个数,最直接表达“稀疏”,但优化是组合问题。
是凸的,并且约束集合有尖角,最优解容易落在坐标轴上,因此产生稀疏。
约束集合圆滑,主要产生连续收缩,很少把系数精确压成 0。
6.5 正交设计下的三类解
若
则:
Best subset:
这是 hard-thresholding:小系数直接置零,大系数不收缩。
Lasso:
这是 soft-thresholding:小系数置零,大系数也向 0 收缩
Ridge:
所有系数按比例缩小,不会精确置零。
6.6 Oracle estimator
假设真实非零集合为
如果有“神谕”提前告诉我们
它的样本内预测风险量级为:
真实问题中
7. Lasso 的 KKT 条件
Lasso 解
其中
等价理解:
- 若变量进入模型,残差与该变量的相关达到阈值
; - 若变量没进入模型,残差与该变量的相关不超过
。
这解释了 Lasso 为什么会产生稀疏解。
7.1 KKT 条件的逐坐标解释
令残差
KKT 条件为:
因此:
若
若
这说明 Lasso 的变量选择规则是:只有当某个变量与当前残差的相关性足够大,达到阈值
7.2 Lasso 解的唯一性
需要注意:Lasso 的系数解
但 fitted value 通常是唯一的:
原因是平方损失关于
这带来两个后果:
- 残差
唯一; - 最优 subgradient
唯一。
7.3 等相关集(Equicorrelation Set)
定义等相关集:
等价地:
它表示与 Lasso 残差相关性达到最大阈值的变量集合。
主动集:
一定满足:
因为若
但反过来不一定成立:某些变量达到相关阈值,却未必在某个 Lasso 解中非零。
7.4 给定 active set 时的解形式
若主动集为
KKT 在 active set 上给出:
解得:
与 active set 上的 OLS 解
相比,Lasso 多了
这正是 Lasso 的 shrinkage bias 来源。
7.5 Lasso 的偏差
Lasso 通过
因此即使选对了变量,系数估计也通常有偏。
这就是 后续介绍非凸惩罚的动机:希望保留稀疏性,同时减少大信号的收缩偏差。
8. Lasso 路径与软阈值
8.1 正交设计下的直观解
若
Best subset 是 hard-thresholding:
Lasso 是 soft-thresholding:
Ridge 是连续缩小:
8.2 Lasso solution path
随着
很大时, ; - 变量逐渐进入模型;
- 系数路径是分段线性的;
- 路径算法通过 KKT 条件跟踪 knot。
这与 Least Angle Regression (LARS) 密切相关。
8.3 为什么路径是分段线性的?
Lasso 的 KKT 条件为:
在某一段路径上,如果 active set
这是
只有当发生下面两种事件之一时,路径才换到下一段:
- 某个 inactive variable 与残差相关达到阈值,进入等相关集;
- 某个 active coefficient 变成 0,离开 active set。
因此 Lasso solution path 是连续、分段线性的。
8.4 路径算法的起点
当
由 KKT:
所以零解成立当且仅当:
路径第一个 knot:
当
8.5 hitting time 与 crossing time
路径算法反复检查两类时间:
- hitting time:某个当前未选变量满足
,准备进入; - crossing time:某个当前已选变量的系数沿线性路径变成 0,准备退出。
算法每一步选更早发生的事件,更新 active set 和 signs,然后继续沿新的线性方向走。
这就是 LARS in lasso mode 的核心。
8.6 路径算法的直观流程
初始化:λ1 = ||X^T y||∞, β(λ)=0
重复:
1. 当前 active set A 和 signs sA 固定
2. 按 βA(λ)=(XA^T XA)^(-1)(XA^T y-λsA) 线性移动
3. 计算下一个 hitting time
4. 计算下一个 crossing time
5. 取较大的下一个 λ knot
6. 更新 A 和 sA
直到 λ=0 或达到所需模型复杂度高可读性的理解:Lasso 不是对每个
9. Lasso 的风险界:慢速率与快速率
9.1 慢速率
在线性模型
且
这是较一般条件下的慢速率。
9.2 快速率
若设计矩阵满足 compatibility condition 或 restricted eigenvalue condition,则可得到更强的 oracle 型界:
其中:
是真实非零变量个数; 是高维变量选择代价; - 该速率接近 best subset 的理想表现。
9.3 支持恢复
若还满足更强条件,例如:
- true support 上设计矩阵条件良好;
- irrelevant variables 与 relevant variables 相关不太强;
- 非零系数足够大;
则 Lasso 有可能恢复真实支持集:
9.4 慢速率推导的核心不等式
先考虑 bound form,取
因为
代入
再写成:
由于
得到:
若
所以:
这就是慢速率的来源。
9.4.1 penalized form 的慢速率
惩罚形式:
由最优性:
整理:
若选择
就得到与约束形式同量级的预测误差界。
9.5 快速率:compatibility condition
慢速率只需要列归一化,因此很一般,但速率包含
为了得到
这样的快速率,需要对设计矩阵加条件。
本章的 compatibility condition:
对真实支持集
的
直觉:如果一个向量主要集中在真实支持集附近,那么
也就是说,设计矩阵不能把真实方向上的信号“压扁”。
在该条件下,可得:
高概率至少为
9.5.1 cone condition 从哪里来?
快速率推导中会先证明:
因为
这说明误差向量
compatibility condition 正是只要求设计矩阵在这个 cone 上表现良好,而不是在整个
9.5.2 Restricted eigenvalue condition
另一个常用条件是 restricted eigenvalue:
对所有
的
它可以推出系数误差界:
直觉:虽然
9.6 支持恢复:Primal-Dual Witness
本章的支持恢复部分目标更强:
方法叫 primal-dual witness,流程:
- 假设真实支持集
就是 active set; - 在
上解 restricted Lasso; - 在
上构造 dual variable; - 验证
上符号正确; - 验证
上 strict dual feasibility:
如果这些条件成立,就证明 Lasso 选对了变量和符号。
9.6.1 支持恢复所需条件
可归纳为三类条件。
1. Mutual incoherence
对某个
含义:非真实变量不能被真实变量线性解释得太好。否则 Lasso 很难区分谁是真变量、谁是替代变量。
2. Minimum eigenvalue
含义:真实变量之间不能严重共线。
3. Minimum signal
含义:真实非零系数必须大到能从噪声和 Lasso 收缩中被识别出来。
9.6.2 支持恢复比预测难
预测误差小不代表变量一定选对。
若两个变量高度相关,选
因此:
慢速率:几乎不要求 X
快速率:要求 X 在稀疏方向上好
支持恢复:还要求非真变量与真变量低相关、真信号足够大9.7 Minimax bounds
最后给出稀疏线性模型的 minimax prediction error:
在适当条件下,上下界同阶:
这说明
9.8 非凸惩罚:为什么要超越 Lasso?
Lasso 的
改进思路:使用非凸惩罚,使小系数被压成 0,但大系数受到较小惩罚。
常见的还有两类:
它比
SCAD
SCAD 的思想是:
- 小系数附近像 Lasso 一样强惩罚;
- 中等系数逐渐降低惩罚;
- 大系数几乎不再惩罚,从而减少偏差。
非凸惩罚通常有更好的统计性质,但优化更难,可能存在局部最优。
10. 本章知识图谱
线性回归与 Lasso
|
┌────────────────────┼────────────────────┐
| | |
经典回归 模型推断 正则化
| | |
y=Xβ+ε β_hat 分布 subset / ridge / lasso
| | |
最小二乘 t 检验 / CI ℓ0 / ℓ2 / ℓ1
| | |
投影 H F 检验 / ANOVA KKT 条件
| | |
残差正交 R² / adjusted R² 稀疏性 / 路径算法
|
慢速率 / 快速率 / 支持恢复更完整地看,本章知识图谱可以展开为:
线性回归与 Lasso
|
|-- 经典线性模型
| |
| |-- 数据结构
| | y_i = β0 + β1x_i1 + ... + βp x_ip + ε_i
| | y = Xβ + ε
| |
| |-- 最小二乘
| | min ||y-Xβ||²
| | β_hat = (X'X)^(-1)X'y
| |
| |-- 几何
| | H = X(X'X)^(-1)X'
| | y_hat = Hy
| | residual = (I-H)y
| | X'residual = 0
| |
| |-- 分布
| | β_hat ~ N(β, σ²(X'X)^(-1))
| | RSS/σ² ~ χ²_{n-p-1}
| | β_hat ⟂ RSS
| |
| |-- 推断
| coefficient t-test
| model reduction F-test
| ANOVA / deviance table
| R² / adjusted R²
|
|-- 高维正则化
|
|-- OLS 风险
| rank(X)<p -> 解不唯一 / 不稳定
|
|-- penalty
| ℓ0 subset: sparse but hard
| ℓ1 lasso: sparse and convex
| ℓ2 ridge: stable but not sparse
|
|-- Lasso 优化
| min 1/2||y-Xβ||² + λ||β||1
| KKT: X'(y-Xβ_hat)=λs
| active set A ⊂ equicorrelation set E
|
|-- Lasso 路径
| λ1=||X'y||∞
| piecewise linear path
| hitting / crossing events
|
|-- 理论
slow rate: ||β0||1 sqrt(log p/n)
fast rate: s0 log p/n
support recovery: incoherence + signal strength
minimax: s0 log(p/s0)/n
nonconvex penalties reduce bias11. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 回归系数显著就是因果 | 显著性不等于因果,需要设计或识别假设 |
| 残差和响应变量正交 | 残差与设计矩阵列空间正交 |
| 加变量可机械提高 | |
| Ridge 能做变量选择 | Ridge 收缩但通常不置零 |
| Lasso 解总唯一 | 系数不一定唯一,但 fitted value 常唯一 |
| Lasso 无偏 | Lasso 有收缩偏差 |
| 通常不可逆,需要正则化 | |
| Lasso 选中变量就说明因果有效 | Lasso 是预测/选择工具,不自动给因果解释 |
| 快速率不需要设计条件 | 必须有 compatibility 或 restricted eigenvalue 等条件 |
| 预测好就一定支持恢复好 | 高相关变量下预测可好,但变量选择可能错 |
12. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 线性模型 | |
| OLS | |
| Hat matrix | |
| 残差 | |
| 残差正交 | |
| OLS 分布 | |
| 方差估计 | |
| 系数 t | |
| Lasso | |
| Lasso KKT | |
| 快速率 | |
| 等相关集 | $E={j: |
| active set 解 | |
| 第一个 knot | |
| 慢速率 | |
| compatibility | |
| minimax rate |
13. 学习建议
- 先把线性模型的几何图像想清楚:拟合是投影,残差与列空间正交。
- 经典推断围绕
的正态分布和 的卡方分布。 - 模型缩减检验本质上比较 full model 和 reduced model。
- 正则化要从“控制复杂度”理解,不只是为了计算。
- Lasso 的核心是
惩罚带来的稀疏性,KKT 条件是理解它的最好入口。 - 高维理论重点看速率:为什么出现
,以及它需要什么设计条件。 - 若时间有限,经典回归先掌握
OLS -> 投影 -> t/F 推断;Lasso 先掌握KKT -> 稀疏 -> 路径 -> 风险界。 - 对 Lasso 理论不要只背结论,要分清三种目标:预测误差小、系数估计准、支持集恢复正确。它们所需条件越来越强。
14. 本章复习清单
14.1 线性回归部分必须会
- 用 Advertising data 说清楚
分别是什么。 - 从最小二乘目标函数推导正规方程。
- 解释
为什么是投影矩阵。 - 证明或说明残差正交:
- 写出
的分布:
- 写出 RSS 的分布和自由度:
- 写出单个系数的
检验统计量。 - 写出模型缩减的 F 检验。
- 解释
为什么随变量数增加而不降。 - 解释 adjusted
如何惩罚变量数。
14.2 Lasso 算法部分必须会
- 说清楚 best subset、ridge、Lasso 的惩罚差异。
- 解释为什么
会导致稀疏。 - 正交设计下写出 hard-thresholding、soft-thresholding、ridge shrinkage。
- 写出 Lasso KKT:
- 用 KKT 说明:
- 定义等相关集
,并说明 。 - 说明 fitted value 唯一但系数不一定唯一。
- 解释 Lasso path 为什么分段线性。
- 写出第一个 knot:
- 说清 hitting time 与 crossing time 的含义。
14.3 Lasso 理论部分必须会
- 慢速率需要的假设:列归一化 + 高斯噪声。
- 慢速率形式:
- 快速率为什么需要 compatibility / restricted eigenvalue。
- 快速率形式:
- 支持恢复需要更强条件:mutual incoherence、minimum eigenvalue、minimum signal。
- 解释为什么支持恢复比预测更难。
- 知道 minimax rate:
- 知道非凸惩罚的目的:减少 Lasso 对大系数的偏差。
15. 综合深化:条件效应、可识别性与高维稳定性
15.1 边缘相关与条件相关
简单回归中的系数描述
例如广告数据中,报纸预算可能因与电视、广播预算相关而呈现边缘相关;进入多元模型后,其系数检验回答的是“控制其他媒体预算后,额外报纸预算是否仍有线性关联”。这不是边缘相关问题,也不能自动作因果解释。
15.2 秩亏时参数为什么不可识别
若
数据无法区分
Ridge 通过严格凸的
15.3 Gauss--Markov 定理不要求正态误差
在线性模型
正态性主要用于有限样本下精确的 t、F 分布推断。若存在异方差,可使用异方差稳健标准误;若观测相关,则需要聚类稳健标准误、广义最小二乘或显式相关结构。
15.4 Lasso 的 KKT 条件与等角集
对目标函数
最优解
因此活动变量必定与残差达到边界相关性
15.5 预测、估计与变量选择是不同目标
在稀疏高维模型中,Lasso 可在适当设计条件下取得良好预测误差率;但恢复真实非零变量的符号与支持集需要更强的不可相关条件和最小信号条件。因而:
- 预测准确不保证选择出的变量就是“真正原因”;
- 系数稳定不保证因果可解释;
- 交叉验证适合选择预测调参值,却不自动提供传统检验意义下的 p-value;
- 若目标是变量选择后的推断,需要样本分割、去偏 Lasso 或选择性推断等专门方法。
建模前应先声明目标是预测、参数估计、变量筛选还是因果效应,因为这些目标所需的假设与评价标准并不相同。