Appearance
第 11 章:数据类型概览(Types of Data)
这一章不是推公式,而是教你“拿到一组数据时应该用哪类统计方法”。它是从概率推断走向实际数据分析的分流图。
0. 本章定位
很多统计错误不是公式算错,而是一开始选错了模型。
本章用四个问题给数据分类:
- 观测是定量还是定性?
- 单位是相似还是不相似?
- 有几个 factor levels?
- 观测之间独立还是相关?
由此决定使用:
- 两样本 / 多样本比较;
- 配对检验;
- 随机区组设计;
- 回归分析;
- 分类数据分析。
1. 基本概念
1.1 因子与因子水平
因子(factor):施加到研究对象上的处理,或研究对象自身的某个特征。
例:
- 吸烟程度;
- 药物剂量;
- 性别;
- 实验处理方法。
因子水平(factor levels):同一个因子的不同取值或类别。
例如吸烟程度有四个水平:
不吸烟 / 轻度吸烟 / 中度吸烟 / 重度吸烟1.2 独立与相关观测
若两个观测没有共享结构,称为独立。
若两个观测来自同一个人、同一组、同一区块、同一匹配对,则通常相关。
例:
- 男生组与女生组随机抽样:独立;
- 同一个人治疗前后测量:相关;
- 同一实验对象接受多个处理:相关;
- 同一 block 内不同处理结果:相关。
1.3 相似单位与不相似单位
相似单位:观测值单位相同,通常用于比较不同处理或群体。
例:不同吸烟组的心率。
不相似单位:变量单位不同,通常研究关系。
例:广告预算与销售额。
这类问题通常进入回归分析。
1.4 定量与定性
定量变量:数值型,可计算均值、方差。
定性变量:类别型,例如正常/异常、早期/晚期、支持/反对。
分类数据往往用列联表和卡方检验。
2. 数据类型判断流程
一组数据
|
┌──────────────┴──────────────┐
| |
定量数据 定性数据
| |
┌─────────┴─────────┐ 分类数据
| | |
单位相似 单位不相似 列联表
| | |
比较均值/方差 回归分析 独立性检验
|
看 factor levels 与依赖结构
|
2水平独立 -> 两样本
2水平相关 -> 配对数据
k水平独立 -> k-sample / ANOVA
k水平相关 -> 随机区组3. k-sample 数据
3.1 使用场景
k-sample 数据用于比较
第
其中:
; ; 是第 组样本量。
3.2 目标
通常检验:
备择是至少一个均值不同。
当
4. 配对数据
4.1 使用场景
配对数据有两个因子水平,但观测成对相关。
常见例子:
- 同一对象治疗前后;
- 左右手比较;
- 两种方法测量同一批对象;
- 按年龄、性别等匹配后的两组。
4.2 分析方法
把每一对转化为差值:
然后对差值做单样本分析:
所以配对
4.3 为什么不能当独立两样本?
因为同一对内部共享个体特征或环境因素。
忽略相关性会浪费信息,甚至导致标准误错误。
5. 随机区组数据
5.1 与配对数据的关系
随机区组数据是配对数据的多水平版本:
- 配对数据:每个 block 内有 2 个处理水平;
- 随机区组:每个 block 内有 3 个或更多处理水平。
5.2 模型直觉
观测可写为:
其中:
是第 个处理水平的平均效果; 是第 个 block 的影响; 是随机误差。
区组设计的目的:把 block 差异单独拿出来,减少误差,提高比较处理效果的能力。
6. 回归数据
6.1 使用场景
当观测变量单位不相似,且目标是研究变量间关系时,进入回归。
典型数据形式:
其中:
是解释变量/自变量/特征; 是响应变量/因变量。
6.2 简单线性回归
6.3 多元线性回归
第 13 章会系统展开回归与 Lasso。
7. 分类数据
7.1 使用场景
若两个变量都是定性变量,就得到分类数据。
例如:
- 感染时间:早期/晚期;
- 结果:正常/异常。
7.2 列联表
若一个变量有
核心问题通常是:
备择:
后续通常使用卡方独立性检验。
8. 本章知识图谱
数据类型
|
┌────────────────────┼────────────────────┐
| | |
变量性质 单位结构 依赖结构
| | |
定量 / 定性 相似 / 不相似 独立 / 相关
| | |
定量+相似 不相似 -> 回归 相关 -> 配对/区组
|
看 factor levels
|
2水平独立 -> 两样本推断
k水平独立 -> k-sample / ANOVA
2水平相关 -> paired data
k水平相关 -> randomized block
定性变量 -> categorical data / contingency table9. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 只要有两组就用独立两样本检验 | 若观测成对相关,应使用配对分析 |
| 所有数字都是定量变量 | 编码后的类别仍是定性变量 |
| 单位不同也直接比较均值 | 单位不同通常研究关系,用回归 |
| k-sample 只用于 | |
| 随机区组和独立多样本一样 | 区组内观测相关,要建模 block 效应 |
| 分类数据用均值比较 | 分类数据通常用比例、列联表、卡方检验 |
10. 快速判断表
| 数据特征 | 常用方法 |
|---|---|
| 定量、相似单位、两组独立 | 两样本 |
| 定量、相似单位、两组相关 | 配对 |
| 定量、相似单位、多组独立 | k-sample / ANOVA |
| 定量、相似单位、多组相关 | 随机区组设计 |
| 定量、不相似单位 | 回归分析 |
| 两个定性变量 | 列联表 / 独立性检验 |
| 一个定性响应、一个或多个解释变量 | 分类模型,如 logistic 回归 |
11. 学习建议
- 拿到数据先不要套公式,先问四个分类问题。
- 区分“比较组均值”和“研究变量关系”。
- 看到同一个对象重复测量,优先考虑相关结构。
- 看到类别变量,优先考虑列联表和比例。
- 本章可以当作后续方法选择的路线图,建议和第 12、13 章一起看。
12. 专题深化:从数据结构选择统计方法
本章的核心不是公式,而是建模前的判断。本章的作用像一张路线图:先看数据是什么,再决定该用哪类推断方法。
12.1 四个第一问题
拿到一个数据集,先问:
- 响应变量是定量还是定性?
- 解释变量是定量还是定性?
- 观测之间是否独立?
- 研究目标是比较、关联、预测还是解释?
这四个问题通常比“该用哪个公式”更先发生。
12.2 定量变量与定性变量
定量变量可以进行数值加减,差值和比例有实际意义。例子:
| 变量 | 类型 |
|---|---|
| 身高 | 定量 |
| 收入 | 定量 |
| 反应时间 | 定量 |
| 血压 | 定量 |
定性变量表示类别。即使它用数字编码,也不代表它是定量变量。
| 变量 | 类型 |
|---|---|
| 性别编码 0/1 | 定性 |
| 疾病类型 1/2/3 | 定性 |
| 专业类别 | 定性 |
| 是否购买 | 定性 |
判断标准不是“看起来是不是数字”,而是“数字之间的加减是否有意义”。
12.3 因子、水平与实验单位
在实验设计语言中:
| 术语 | 含义 |
|---|---|
| factor | 研究者操控或比较的分类变量 |
| level | factor 的具体取值 |
| experimental unit | 接受处理的基本对象 |
| response | 最终测量结果 |
例如比较三种肥料对产量的影响:
- factor 是肥料类型;
- levels 是 A、B、C 三种肥料;
- experimental unit 是地块;
- response 是产量。
如果实验单位判断错了,独立性和样本量都会被误判。
13. 专题深化:比较均值的设计类型
13.1 两独立样本
问题形式:
模型可写为
如果两组观测来自不同个体,且组间组内独立,使用两样本 t 推断。
例子:
| 研究问题 | 响应 | 分组 |
|---|---|---|
| 新旧药物疗效比较 | 血压下降值 | 药物类型 |
| 两种教学方法比较 | 考试分数 | 教学方法 |
13.2 配对样本
若每个对象提供两个相关观测,应该转成差值:
然后对
做单样本 t 推断。
例子:
| 场景 | 为什么配对 |
|---|---|
| 治疗前后血压 | 同一个人重复测量 |
| 左右眼指标 | 同一个受试者两只眼 |
| 双胞胎对照 | 天然匹配 |
配对设计的优势是去除个体差异;错误地当作独立样本会浪费信息,甚至得到错误标准误。
13.3 k 个独立样本
当组数
常用模型:
其中
检验目标通常是
这会引出 ANOVA。
13.4 随机区组设计
随机区组设计用于处理已知的异质性来源。模型形式可写为
其中:
是处理效应; 是区组效应; - 同一区组内的观测更可比。
例子:多个农田区块中比较肥料。每个区块都施用所有肥料,区块本身肥力差异通过
14. 专题深化:关系建模与分类数据
14.1 回归问题
当解释变量是定量变量,或研究目标是变量关系时,通常进入回归。
简单线性回归:
研究问题:
| 问题 | 对应参数 |
|---|---|
| 预测给定 | |
| 控制多个变量后的边际效应 | 多元回归系数 |
这部分在第 13 章展开。
14.2 分类响应变量
如果响应变量是类别,不能直接套普通均值模型。
二分类响应:
常用比例、风险差、odds ratio 或 logistic 回归。
多分类响应可用列联表、multinomial 模型等。
14.3 列联表
两个定性变量的关系常用列联表表示。
例如:
| 患病 | 未患病 | |
|---|---|---|
| 暴露 | ||
| 未暴露 |
常见问题:
- 两个变量是否独立?
- 不同组的比例是否相同?
- 暴露是否改变患病风险?
后续会连接卡方独立性检验和两比例检验。
14.4 方法选择流程图
| 响应变量 | 解释变量/设计 | 常见方法 |
|---|---|---|
| 定量 | 一个总体 | 单样本 t |
| 定量 | 两独立组 | 两样本 t / Welch |
| 定量 | 配对观测 | 配对 t |
| 定量 | 多独立组 | ANOVA |
| 定量 | 区组结构 | 随机区组 / repeated measures |
| 定量 | 定量解释变量 | 回归 |
| 定性 | 一个比例 | 单比例推断 |
| 定性 | 两组比例 | 两比例推断 |
| 定性 | 两个分类变量 | 列联表 / 卡方检验 |
15. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| 定量/定性变量 | 能判断数字编码是否只是类别 |
| factor/level/unit | 能区分处理因素、水平和实验单位 |
| 独立两样本 | 知道用两样本 t 或 Welch |
| 配对样本 | 会转化为差值做单样本推断 |
| k-sample | 知道会引向 ANOVA |
| 随机区组 | 能解释 block effect 的作用 |
| 回归 | 知道用于定量关系和预测 |
| 分类响应 | 知道不能直接套普通均值模型 |
| 列联表 | 会组织两个定性变量的数据 |
| 方法选择 | 能根据数据结构选后续章节方法 |
16. 综合深化:从研究问题识别数据结构
16.1 数字编码不等于定量变量
变量类型取决于数值所承载的关系,而不是存储格式:
- 名义变量只有相同或不同,如血型、地区;编码为 1、2、3 后仍不能计算有意义的均值。
- 有序变量存在次序,如疾病轻、中、重,但相邻等级之间的距离未必相等。
- 定量变量的差值具有可解释的单位;若零点也有实际含义,还可比较倍数。
响应变量为有序类别时,可考虑累积 logit 等有序分类模型;无序多类别响应则适合多项 logit。把类别编号后直接做线性回归,会人为强加等距结构。
16.2 独立样本、配对样本与重复测量
判断关键不是“有两列数据”,而是观测单位是否共享:
- 两组由不同个体构成且抽样相互独立,是独立两样本。
- 同一对象处理前后各测一次,或对象按关键特征一一匹配,是配对数据。
- 同一对象在三个以上条件或时间点反复测量,是重复测量或随机区组结构。
配对分析对差值
16.3 观察性研究中的混杂
比较吸烟者与不吸烟者的心率时,年龄、运动水平、药物使用等变量可能同时影响吸烟状态与心率,形成混杂。匹配、分层和回归调整可改善可比性;倾向评分与工具变量用于更复杂的观察性设计。但这些方法都依赖额外的可识别假设,不能把条件相关自动升级为因果效应。
随机分配的价值在于使处理与潜在混杂因素在设计上独立。无法随机化时,应明确处理分配机制、时间顺序、遗漏变量风险和目标因果量。
16.4 方法选择的逐层判断
可按以下顺序识别分析结构:
- 明确响应变量是定量、二分类、有序还是无序多分类。
- 明确观测单位及同一单位是否被重复测量。
- 明确处理或分组因子有几个水平。
- 判断目标是单总体参数、组间比较、变量关联、预测还是因果效应。
- 再检查分布、方差齐性、独立性与缺失机制等假设。
由此可对应到单样本推断、独立两样本、配对检验、ANOVA、随机区组、回归或列联表分析。方法名称应由研究设计和目标决定,而不是只由数据表的列数决定。
16.5 因子、水平与实验单位
“因子”是研究中被操纵或比较的变量,“水平”是因子的具体取值,“实验单位”是被独立分配处理的最小单位。显著性检验的有效样本量由独立实验单位决定,而不是由技术重复次数决定;把同一单位的多次测量当作独立样本会造成伪重复并低估标准误。