Skip to content

第 3 章 估计与单样本检验(Estimation & 1-Sample Test)

对应课件 3 Estimation & 1-Sample Test.pdf,覆盖 Rosner 第 6、7 章。 本章是统计推断的开端:先讲点估计 + 区间估计(确定参数的"位置"和"不确定性"),再讲假设检验(判断参数是否等于某个特定值)。


1. 估计(Estimation, Ch.6)

1.1 估计 vs 假设检验

估计(Estimation)假设检验(Testing)
目的给出参数的具体取值或区间判断参数是否等于某特定值
输出μ^=x¯,σ^=s,ρ^=r;CI"拒绝 / 不拒绝 H0",p 值

一句话区别:估计回答"是多少",检验回答"是不是"


1.2 随机抽样(Random Sampling)

为什么强调"随机"?只有随机样本才能用概率论的工具推断总体。

:从 1000 名精神分裂患者中抽 100 人参加研究,应该用计算机生成随机序号。

RCT(随机对照试验)关键点:

  • 受试者随机分配到不同治疗组("arms")
  • 块随机化(Block Randomization):每 10 个受试者一块,5 人 A 组、5 人 B 组,保证试验过程中两组人数始终接近平衡
  • 随机化使两组的人口学特征/基线指标接近 → 能把"治疗效果"和"群体差异"分开

1.3 样本均值的性质

X1,,Xn 来自总体(均值 μ、方差 σ2):

X¯=1nXi=μ^
  • 无偏性E(X¯)=μ
  • 方差Var(X¯)=σ2n
  • 均值的标准误(SEM)
SEM=σn估计为sn

直觉:样本量增加 4 倍,SEM 减半,估计精度翻倍。


1.4 中心极限定理(CLT)

情形 1:若 XN(μ,σ2),则

X¯N(μ,σ2n)(精确)

情形 2:若 X 不一定正态但有限均值方差,则当 n 足够大:

X¯˙N(μ,σ2n)

关键直觉:单次掷骰子是均匀分布;但许多次掷骰子的"平均点数"分布呈现钟形 → 这就是 CLT 的可视化。

:1 岁以下儿童身高 μ=20 英寸、σ=4 英寸,抽 n=64

P(20<X¯<21)=P(0<Z<14/64)=P(0<Z<2)0.4772

1.5 正态均值的置信区间(已知 σ

由 CLT:

P(μ1.96σn<X¯<μ+1.96σn)0.95

变形为对 μ 的区间:

X¯±Z1α/2σn

这是 100(1α)% 置信区间。

CI 的正确解释:在多次重复抽样下,约有 (1α) 比例的 CI 会覆盖真实的 μ;它不等于"μ 落在这个区间的概率为 95%"(μ 是固定常数,不是随机变量)。


1.6 σ 未知时的 t 区间

σ 未知 → 用 s 代替 → 多了一份"估计的不确定性" → 分布从正态变 t:

t=X¯μs/ntn1

置信区间

X¯±tn1,1α/2sn

t 分布性质

  • 比标准正态尾巴更厚(不确定性更大)
  • 自由度 d=n1d 时趋近 N(0,1)
  • 例:t20,0.975=2.086z0.975=1.96

例:CI 计算

16 名癌症患者实验治疗,存活时间 X¯=14.5 月,s=5 月。求 90% CI:

  • α=0.10α/2=0.05
  • 自由度 df=15t15,0.95=1.753
  • SE = s/n=5/4=1.25
  • CI = 14.5±1.753×1.25=(12.31,16.69)

1.7 方差的点估计与区间估计

点估计(无偏):

S2=1n1(xix¯)2,E(S2)=σ2

χ2 分布

  • d 个独立标准正态平方和定义
  • 总是非负,右偏
  • 自由度越大越对称,d 时近似正态
  • 不对称,所以上、下分位数没有简单关系,要分别查表

关键关系(要求总体正态!):

(n1)S2σ2χn12

σ2(1α) 置信区间

((n1)S2χn1,1α/22,(n1)S2χn1,α/22)

注意分母大小关系χ1α/22 大 → 上界变小左;χα/22 小 → 下界变大右。即大分位数对应区间下界


例:测量仪器方差

3 个数据 {4.1,5.2,10.2},仪器声称 σ=2(即 σ2=4)。求 90% CI:

  • S2=10.57n=3df=2
  • χ2,0.952=5.99χ2,0.052=0.103
  • CI = (210.575.99,210.570.103)=(3.53,206.1)
  • 4 在区间内 → 仪器声称合理

区间宽到天上去了,因为 n=3 极小!


1.8 二项参数 p 的估计

Bernoulli 试验Xi=1(概率 p)或 0(概率 q=1p)。

X=XiBinomial(n,p)样本比例

p^=Xn,E(p^)=p,Var(p^)=pqn,SE(p^)=pqnp^q^n

正态近似 CI(条件 np^q^5):

p^±z1α/2p^q^n

样本量小或 p 极端时,要用精确二项区间(计算机求解)。


1.9 泊松参数 λ 的估计

例(Woburn 白血病案例):1970 年代某镇 12,000 儿童,10 年内 12 例白血病。

t=12000×10=120,000 人年(人时),X=12Poisson(μ)

μ^=X=12,λ^=X/t=0.0001 /人年

正态近似 CIμ 大时):

μ^±z1α/2X

对发病率 λ

λ^±z1α/2Xt

1.10 单侧置信区间(One-sided CI)

例:标准癌症治疗 5 年生存率 30%,新疗法 100 人有 40 人存活。问新疗法是否显著优于 30%?

构造上单侧 95% CI(只关心下界):

p>p^z1αp^q^/n=0.41.6450.24/100=0.319

p>0.319,由于 0.30 不在 (0.319,1),拒绝 H0,认为新疗法更好。

历史提醒:FDA 早期不接受单侧检验/CI。原因:单侧"偏向"自己想要的结论,可能掩盖反方向的风险。


2. 假设检验:单样本(1-Sample Test, Ch.7)

2.1 引例

新血清是否预防感冒?10 人接种,8 人冬季无感冒;已知未接种时无感冒概率为 0.5。

类比法庭

  • H0(零假设)= "无罪推定" = 血清无效
  • H1(备择假设)= 血清有效
  • 实验者像公诉方,用证据(样本)尝试否定 H0
  • 注意:我们只能"拒绝"或"不拒绝" H0,不能"接受" H0(缺乏证据 ≠ 证据缺乏)

2.2 检验统计量与拒绝域

设检验统计量 k = 10 人中无感冒人数,取值 {0,1,,10},分成两区:

  • 拒绝域(Rejection Region):如 k{8,9,10},落入则拒绝 H0
  • 接受域:其余值,不拒绝 H0

2.3 两类错误

H0H0
拒绝 H0第一类错误(α):误判有效正确(功效 1β
不拒绝 H0正确第二类错误(β):漏判

定义:

  • α=P(拒绝 H0H0 真):显著性水平(一般 0.05、0.01、0.10)
  • β=P(不拒绝 H0H0 假)
  • 功效(Power) =1β=P(拒绝 H0H0 假)

关键关系(样本量固定时):

  • αβ 此消彼长:缩小拒绝域 → α ↓ 但 β
  • 想同时降低两类错误 → 必须增大 n

2.4 单样本 z 检验(已知方差)

XiN(μ,σ02)

单侧检验H0:μμ0 vs H1:μ<μ0

检验统计量

z=x¯μ0σ0/n

三种等价做法

  1. CI 法μ0 是否落在 (1α) CI 内?不在 → 拒绝
  2. 临界值法:若 z<zα(左尾),拒绝
  3. p 值法p<α → 拒绝

p 值规模建议

p含义
p>0.05不显著
0.01p<0.05显著
0.001p<0.01高度显著
p<0.001极显著

例:低 SES 母亲新生儿出生体重

  • n=100,X¯=115,s=24(oz)
  • 全国均值 μ0=120,已知 σ0=25
  • H0:μ120 vs H1:μ<120α=0.05

方法 1(CI):单侧上界 X¯+z1ασ0/n=115+1.6452.5=119.11,故 95% 单侧 CI = (,119.11),120 不在 → 拒绝

方法 2(z 统计量)

z=11512025/100=2.00<1.645拒绝

方法 3(p 值)p=P(Z<2)=0.0228<0.05 → 拒绝

结论:低 SES 母亲新生儿体重显著低于全国均值。


2.5 统计显著 vs 临床显著

  • 统计显著:p 值低,可能仅因样本量大("鸡毛蒜皮"被检测出来)
  • 临床显著:差异是否在医学/实践中有意义

一项 n=106 的研究可能显示新药把血压降低 0.1 mmHg,p < 0.001,但这点差异临床上毫无意义


2.6 双侧检验

H0:μ=μ0 vs H1:μμ0

  • 拒绝域分布在两尾,每尾面积 α/2
  • 临界值 ±z1α/2
  • 双侧 p 值 = 2min[P(Zz),P(Zz)]

双侧 vs 单侧

  • 通常用双侧(不预设方向)
  • 单侧检验在已知方向时功效更高,但用前要慎重

2.7 单样本 t 检验(方差未知)

把 z 检验里的 σ 换成 s

t=x¯μ0s/ntn1

例:花生酱罐重

  • 厂家声称 12 oz,n=36X¯=11.92s=0.3
  • H0:μ12 vs H1:μ<12α=0.01
  • tobs=(11.9212)/(0.3/36)=1.6
  • 临界值 t35,0.01=2.4377
  • p 值 = 0.0593 > 0.01

结论tobs>tcritical不拒绝 H0。即不能在 1% 显著水平下断定罐重不足 12 oz。


2.8 功效(Power)的计算

XiN(μ,σ2)H0:μ=μ0 vs H1:μ<μ0(已知 σ)。

Power=P(reject H0μ=μ1)=Φ(zα+μ0μ1σn)

影响功效的四要素

因素变化Power
显著水平 αα
效应量 $\mu_1-\mu_0$
标准差 σ
样本量 n

直觉总结:信号越强、噪声越小、样本越大、容忍度越高(α 越大),越容易拒绝 H0


2.9 样本量计算

由 Power = 1β 反解 n

单侧检验

n=(z1α+z1β)2σ2(μ0μ1)2

双侧检验:把 z1α 换成 z1α/2


例:体重研究样本量

  • μ0=120,μ1=115,σ2=625(σ=25),α=0.05,1β=0.8
  • z0.95=1.645,z0.8=0.84
n=(1.645+0.84)262552=6.17562525154.4n=155

2.10 单样本 χ2 检验(方差检验)

前提:总体必须近似正态!(比均值检验对正态性更敏感)

:医疗器械寿命方差,厂家称 σ02=0.8,16 件样本方差 s2=1,问是否超过 0.8?

H0:σ20.8vsH1:σ2>0.8

检验统计量:

χ2=(n1)s2σ02χn12

χobs2=151/0.8=18.75,比较 χ15,0.952;若 obs > critical 则拒绝。

重要警告:当总体非正态时,方差检验的 p 值、临界值、CI 全都不可靠


2.11 单样本二项比例检验

:母亲患乳腺癌的女性中,乳腺癌患病率 p^=400/10000=4%;全国均值 p0=2%。问差异显著否?

  • 条件:np0q0=100000.020.98=1965 ✓ 可用正态近似

正态近似检验

z=p^p0p0q0/n=0.040.020.020.98/10000=14.29

z 极大 → p 值近乎 0,强烈拒绝 H0

95% 近似 CI0.04±1.960.040.96/10000=(0.0362,0.0438),不含 0.02,与上面结论一致。

精确二项检验(计算机算):P(k400p=0.02)0


3. 核心公式速查表

场景检验统计量分布CI
均值,σ 已知z=X¯μ0σ/nN(0,1)X¯±z1α/2σ/n
均值,σ 未知t=X¯μ0s/ntn1X¯±tn1,1α/2s/n
方差(正态总体)χ2=(n1)s2σ02χn12((n1)s2χn1,1α/22,(n1)s2χn1,α/22)
比例(大样本)z=p^p0p0q0/nN(0,1)p^±z1α/2p^q^/n
泊松均值(大样本)z=Xμ0μ0N(0,1)X±z1α/2X

4. 自测要点(Checklist)

估计

  • [ ] 点估计 vs 区间估计 vs 假设检验三者关系
  • [ ] CLT:精确情形 vs 近似情形
  • [ ] SEM 公式与 n 法则
  • [ ] CI 的正确解释(不要说成 "μ 落在区间的概率为 95%")
  • [ ] 何时用 z 区间,何时用 t 区间
  • [ ] χ2 分布的非对称性
  • [ ] 二项 p 的正态近似条件 np^q^5
  • [ ] 泊松 λ 的人时计算

假设检验

  • [ ] H0H1 怎样设置("无罪推定"原则)
  • [ ] 第一类错误 α vs 第二类错误 β
  • [ ] 功效 1β 的四个影响因素
  • [ ] 为什么 αβ "此消彼长"
  • [ ] 三种等价做法:CI / 临界值 / p 值
  • [ ] 单侧 vs 双侧检验的功效与适用场景
  • [ ] 统计显著 ≠ 临床显著
  • [ ] 样本量公式的导出(从 Power 公式反解)
  • [ ] 方差检验对正态性的强敏感性

思考题

  1. 一篇论文报告 p=0.04,能否直接说"实验组优于对照组的概率是 96%"?为什么不能?
  2. 同样的均值差,n=20 vs n=200 哪个 p 值更小?哪个临床意义更大?
  3. 想用单侧检验,但担心方向错。怎么办?(提示:考虑预设 + 双侧)
  4. n=10、要做方差检验,但样本明显偏态,能直接套 χ2 公式吗?