Appearance
第 3 章 估计与单样本检验(Estimation & 1-Sample Test)
对应课件
3 Estimation & 1-Sample Test.pdf,覆盖 Rosner 第 6、7 章。 本章是统计推断的开端:先讲点估计 + 区间估计(确定参数的"位置"和"不确定性"),再讲假设检验(判断参数是否等于某个特定值)。
1. 估计(Estimation, Ch.6)
1.1 估计 vs 假设检验
| 估计(Estimation) | 假设检验(Testing) | |
|---|---|---|
| 目的 | 给出参数的具体取值或区间 | 判断参数是否等于某特定值 |
| 输出 | "拒绝 / 不拒绝 |
一句话区别:估计回答"是多少",检验回答"是不是"。
1.2 随机抽样(Random Sampling)
为什么强调"随机"?只有随机样本才能用概率论的工具推断总体。
例:从 1000 名精神分裂患者中抽 100 人参加研究,应该用计算机生成随机序号。
RCT(随机对照试验)关键点:
- 受试者随机分配到不同治疗组("arms")
- 块随机化(Block Randomization):每 10 个受试者一块,5 人 A 组、5 人 B 组,保证试验过程中两组人数始终接近平衡
- 随机化使两组的人口学特征/基线指标接近 → 能把"治疗效果"和"群体差异"分开
1.3 样本均值的性质
设
- 无偏性:
- 方差:
- 均值的标准误(SEM):
直觉:样本量增加 4 倍,SEM 减半,估计精度翻倍。
1.4 中心极限定理(CLT)
情形 1:若
情形 2:若
关键直觉:单次掷骰子是均匀分布;但许多次掷骰子的"平均点数"分布呈现钟形 → 这就是 CLT 的可视化。
例:1 岁以下儿童身高
1.5 正态均值的置信区间(已知 )
由 CLT:
变形为对
这是
CI 的正确解释:在多次重复抽样下,约有
比例的 CI 会覆盖真实的 ;它不等于" 落在这个区间的概率为 95%"( 是固定常数,不是随机变量)。
1.6 未知时的 t 区间
置信区间:
t 分布性质:
- 比标准正态尾巴更厚(不确定性更大)
- 自由度
, 时趋近 - 例:
,
例:CI 计算
16 名癌症患者实验治疗,存活时间
, - 自由度
, - SE =
- CI =
1.7 方差的点估计与区间估计
点估计(无偏):
- 由
个独立标准正态平方和定义 - 总是非负,右偏
- 自由度越大越对称,
时近似正态 - 不对称,所以上、下分位数没有简单关系,要分别查表
关键关系(要求总体正态!):
注意分母大小关系:
大 → 上界变小左; 小 → 下界变大右。即大分位数对应区间下界!
例:测量仪器方差
3 个数据
, , , - CI =
- 4 在区间内 → 仪器声称合理
区间宽到天上去了,因为
极小!
1.8 二项参数 的估计
Bernoulli 试验:
正态近似 CI(条件
样本量小或
1.9 泊松参数 的估计
例(Woburn 白血病案例):1970 年代某镇 12,000 儿童,10 年内 12 例白血病。
正态近似 CI(
对发病率
1.10 单侧置信区间(One-sided CI)
例:标准癌症治疗 5 年生存率 30%,新疗法 100 人有 40 人存活。问新疗法是否显著优于 30%?
构造上单侧 95% CI(只关心下界):
→
历史提醒:FDA 早期不接受单侧检验/CI。原因:单侧"偏向"自己想要的结论,可能掩盖反方向的风险。
2. 假设检验:单样本(1-Sample Test, Ch.7)
2.1 引例
新血清是否预防感冒?10 人接种,8 人冬季无感冒;已知未接种时无感冒概率为 0.5。
类比法庭:
(零假设)= "无罪推定" = 血清无效 (备择假设)= 血清有效 - 实验者像公诉方,用证据(样本)尝试否定
- 注意:我们只能"拒绝"或"不拒绝"
,不能"接受" (缺乏证据 ≠ 证据缺乏)
2.2 检验统计量与拒绝域
设检验统计量
- 拒绝域(Rejection Region):如
,落入则拒绝 - 接受域:其余值,不拒绝
2.3 两类错误
| 拒绝 | 第一类错误(α):误判有效 | 正确(功效 |
| 不拒绝 | 正确 | 第二类错误(β):漏判 |
定义:
:显著性水平(一般 0.05、0.01、0.10) - 功效(Power)
关键关系(样本量固定时):
与 此消彼长:缩小拒绝域 → ↓ 但 ↑ - 想同时降低两类错误 → 必须增大
2.4 单样本 z 检验(已知方差)
设
单侧检验:
检验统计量:
三种等价做法:
- CI 法:
是否落在 CI 内?不在 → 拒绝 - 临界值法:若
(左尾),拒绝 - p 值法:
→ 拒绝
p 值规模建议:
| p | 含义 |
|---|---|
| 不显著 | |
| 显著 | |
| 高度显著 | |
| 极显著 |
例:低 SES 母亲新生儿出生体重
(oz) - 全国均值
,已知 vs ,
方法 1(CI):单侧上界
方法 2(z 统计量):
方法 3(p 值):
结论:低 SES 母亲新生儿体重显著低于全国均值。
2.5 统计显著 vs 临床显著
- 统计显著:p 值低,可能仅因样本量大("鸡毛蒜皮"被检测出来)
- 临床显著:差异是否在医学/实践中有意义
一项
的研究可能显示新药把血压降低 0.1 mmHg,p < 0.001,但这点差异临床上毫无意义。
2.6 双侧检验
- 拒绝域分布在两尾,每尾面积
- 临界值
- 双侧 p 值 =
双侧 vs 单侧:
- 通常用双侧(不预设方向)
- 单侧检验在已知方向时功效更高,但用前要慎重
2.7 单样本 t 检验(方差未知)
把 z 检验里的
例:花生酱罐重
- 厂家声称 12 oz,
, , vs , - 临界值
- p 值 = 0.0593 > 0.01
结论:
2.8 功效(Power)的计算
设
影响功效的四要素:
| 因素 | 变化 | Power |
|---|---|---|
| 显著水平 | ↓ | |
| 效应量 $ | \mu_1-\mu_0 | $ |
| 标准差 | ↑ | ↓ |
| 样本量 | ↑ | ↑ |
直觉总结:信号越强、噪声越小、样本越大、容忍度越高(α 越大),越容易拒绝
。
2.9 样本量计算
由 Power =
单侧检验:
双侧检验:把
例:体重研究样本量
2.10 单样本 检验(方差检验)
前提:总体必须近似正态!(比均值检验对正态性更敏感)
例:医疗器械寿命方差,厂家称
检验统计量:
重要警告:当总体非正态时,方差检验的 p 值、临界值、CI 全都不可靠。
2.11 单样本二项比例检验
例:母亲患乳腺癌的女性中,乳腺癌患病率
- 条件:
✓ 可用正态近似
正态近似检验:
95% 近似 CI:
精确二项检验(计算机算):
3. 核心公式速查表
| 场景 | 检验统计量 | 分布 | CI |
|---|---|---|---|
| 均值, | |||
| 均值, | |||
| 方差(正态总体) | |||
| 比例(大样本) | |||
| 泊松均值(大样本) |
4. 自测要点(Checklist)
估计
- [ ] 点估计 vs 区间估计 vs 假设检验三者关系
- [ ] CLT:精确情形 vs 近似情形
- [ ] SEM 公式与
法则 - [ ] CI 的正确解释(不要说成 "μ 落在区间的概率为 95%")
- [ ] 何时用 z 区间,何时用 t 区间
- [ ]
分布的非对称性 - [ ] 二项
的正态近似条件 - [ ] 泊松
的人时计算
假设检验
- [ ]
与 怎样设置("无罪推定"原则) - [ ] 第一类错误
vs 第二类错误 - [ ] 功效
的四个影响因素 - [ ] 为什么
与 "此消彼长" - [ ] 三种等价做法:CI / 临界值 / p 值
- [ ] 单侧 vs 双侧检验的功效与适用场景
- [ ] 统计显著 ≠ 临床显著
- [ ] 样本量公式的导出(从 Power 公式反解)
- [ ] 方差检验对正态性的强敏感性
思考题
- 一篇论文报告
,能否直接说"实验组优于对照组的概率是 96%"?为什么不能? - 同样的均值差,
vs 哪个 p 值更小?哪个临床意义更大? - 想用单侧检验,但担心方向错。怎么办?(提示:考虑预设 + 双侧)
、要做方差检验,但样本明显偏态,能直接套 公式吗?