Skip to content

第 11 章:数据类型概览(Types of Data)

这一章不是推公式,而是教你“拿到一组数据时应该用哪类统计方法”。它是从概率推断走向实际数据分析的分流图。


0. 本章定位

很多统计错误不是公式算错,而是一开始选错了模型。
本章用四个问题给数据分类:

  1. 观测是定量还是定性?
  2. 单位是相似还是不相似?
  3. 有几个 factor levels?
  4. 观测之间独立还是相关?

由此决定使用:

  • 两样本 / 多样本比较;
  • 配对检验;
  • 随机区组设计;
  • 回归分析;
  • 分类数据分析。

1. 基本概念

1.1 因子与因子水平

因子(factor):施加到研究对象上的处理,或研究对象自身的某个特征。

例:

  • 吸烟程度;
  • 药物剂量;
  • 性别;
  • 实验处理方法。

因子水平(factor levels):同一个因子的不同取值或类别。

例如吸烟程度有四个水平:

不吸烟 / 轻度吸烟 / 中度吸烟 / 重度吸烟

1.2 独立与相关观测

若两个观测没有共享结构,称为独立。

若两个观测来自同一个人、同一组、同一区块、同一匹配对,则通常相关。

例:

  • 男生组与女生组随机抽样:独立;
  • 同一个人治疗前后测量:相关;
  • 同一实验对象接受多个处理:相关;
  • 同一 block 内不同处理结果:相关。

1.3 相似单位与不相似单位

相似单位:观测值单位相同,通常用于比较不同处理或群体。

例:不同吸烟组的心率。

不相似单位:变量单位不同,通常研究关系。

例:广告预算与销售额。
这类问题通常进入回归分析。

1.4 定量与定性

定量变量:数值型,可计算均值、方差。

定性变量:类别型,例如正常/异常、早期/晚期、支持/反对。

分类数据往往用列联表和卡方检验。


2. 数据类型判断流程

                         一组数据
                            |
             ┌──────────────┴──────────────┐
             |                             |
          定量数据                       定性数据
             |                             |
   ┌─────────┴─────────┐               分类数据
   |                   |                  |
单位相似             单位不相似          列联表
   |                   |                  |
比较均值/方差          回归分析         独立性检验
   |
看 factor levels 与依赖结构
   |
 2水平独立 -> 两样本
 2水平相关 -> 配对数据
 k水平独立 -> k-sample / ANOVA
 k水平相关 -> 随机区组

3. k-sample 数据

3.1 使用场景

k-sample 数据用于比较 k 个因子水平下的定量响应。

j 个因子水平中第 i 个观测记为:

Yij

其中:

  • j=1,,k
  • i=1,,nj
  • nj 是第 j 组样本量。

3.2 目标

通常检验:

H0:μ1=μ2==μk

备择是至少一个均值不同。

k=2 且两组独立时,就是两样本问题;当 k>2 时进入 ANOVA。


4. 配对数据

4.1 使用场景

配对数据有两个因子水平,但观测成对相关。

常见例子:

  • 同一对象治疗前后;
  • 左右手比较;
  • 两种方法测量同一批对象;
  • 按年龄、性别等匹配后的两组。

4.2 分析方法

把每一对转化为差值:

Di=XiYi

然后对差值做单样本分析:

H0:E(D)=0

所以配对 t 检验本质上是对差值的单样本 t 检验。

4.3 为什么不能当独立两样本?

因为同一对内部共享个体特征或环境因素。
忽略相关性会浪费信息,甚至导致标准误错误。


5. 随机区组数据

5.1 与配对数据的关系

随机区组数据是配对数据的多水平版本:

  • 配对数据:每个 block 内有 2 个处理水平;
  • 随机区组:每个 block 内有 3 个或更多处理水平。

5.2 模型直觉

观测可写为:

Yij=μj+Bi+εij

其中:

  • μj 是第 j 个处理水平的平均效果;
  • Bi 是第 i 个 block 的影响;
  • εij 是随机误差。

区组设计的目的:把 block 差异单独拿出来,减少误差,提高比较处理效果的能力。


6. 回归数据

6.1 使用场景

当观测变量单位不相似,且目标是研究变量间关系时,进入回归。

典型数据形式:

(xi,Yi),i=1,,n

其中:

  • xi 是解释变量/自变量/特征;
  • Yi 是响应变量/因变量。

6.2 简单线性回归

Yi=β0+β1xi+εi

6.3 多元线性回归

Yi=β0+β1xi1++βpxip+εi

第 13 章会系统展开回归与 Lasso。


7. 分类数据

7.1 使用场景

若两个变量都是定性变量,就得到分类数据。

例如:

  • 感染时间:早期/晚期;
  • 结果:正常/异常。

7.2 列联表

若一个变量有 R 类,另一个有 C 类,则数据可放入 R×C 列联表。

核心问题通常是:

H0:X 与 Y 独立

备择:

H1:X 与 Y 相关

后续通常使用卡方独立性检验。


8. 本章知识图谱

                         数据类型
                            |
       ┌────────────────────┼────────────────────┐
       |                    |                    |
    变量性质              单位结构              依赖结构
       |                    |                    |
 定量 / 定性            相似 / 不相似          独立 / 相关
       |                    |                    |
 定量+相似              不相似 -> 回归         相关 -> 配对/区组
       |
 看 factor levels
       |
 2水平独立 -> 两样本推断
 k水平独立 -> k-sample / ANOVA
 2水平相关 -> paired data
 k水平相关 -> randomized block
 定性变量 -> categorical data / contingency table

9. 易错点与考点

误区正确认识
只要有两组就用独立两样本检验若观测成对相关,应使用配对分析
所有数字都是定量变量编码后的类别仍是定性变量
单位不同也直接比较均值单位不同通常研究关系,用回归
k-sample 只用于 k=2k 可以大于 2,常引出 ANOVA
随机区组和独立多样本一样区组内观测相关,要建模 block 效应
分类数据用均值比较分类数据通常用比例、列联表、卡方检验

10. 快速判断表

数据特征常用方法
定量、相似单位、两组独立两样本 t 检验
定量、相似单位、两组相关配对 t 检验
定量、相似单位、多组独立k-sample / ANOVA
定量、相似单位、多组相关随机区组设计
定量、不相似单位回归分析
两个定性变量列联表 / 独立性检验
一个定性响应、一个或多个解释变量分类模型,如 logistic 回归

11. 学习建议

  1. 拿到数据先不要套公式,先问四个分类问题。
  2. 区分“比较组均值”和“研究变量关系”。
  3. 看到同一个对象重复测量,优先考虑相关结构。
  4. 看到类别变量,优先考虑列联表和比例。
  5. 本章可以当作后续方法选择的路线图,建议和第 12、13 章一起看。

12. 专题深化:从数据结构选择统计方法

本章的核心不是公式,而是建模前的判断。本章的作用像一张路线图:先看数据是什么,再决定该用哪类推断方法。

12.1 四个第一问题

拿到一个数据集,先问:

  1. 响应变量是定量还是定性?
  2. 解释变量是定量还是定性?
  3. 观测之间是否独立?
  4. 研究目标是比较、关联、预测还是解释?

这四个问题通常比“该用哪个公式”更先发生。

12.2 定量变量与定性变量

定量变量可以进行数值加减,差值和比例有实际意义。例子:

变量类型
身高定量
收入定量
反应时间定量
血压定量

定性变量表示类别。即使它用数字编码,也不代表它是定量变量。

变量类型
性别编码 0/1定性
疾病类型 1/2/3定性
专业类别定性
是否购买定性

判断标准不是“看起来是不是数字”,而是“数字之间的加减是否有意义”。

12.3 因子、水平与实验单位

在实验设计语言中:

术语含义
factor研究者操控或比较的分类变量
levelfactor 的具体取值
experimental unit接受处理的基本对象
response最终测量结果

例如比较三种肥料对产量的影响:

  1. factor 是肥料类型;
  2. levels 是 A、B、C 三种肥料;
  3. experimental unit 是地块;
  4. response 是产量。

如果实验单位判断错了,独立性和样本量都会被误判。


13. 专题深化:比较均值的设计类型

13.1 两独立样本

问题形式:

组 A 均值是否不同于组 B 均值?

模型可写为

Yij=μi+εij,i=1,2.

如果两组观测来自不同个体,且组间组内独立,使用两样本 t 推断。

例子:

研究问题响应分组
新旧药物疗效比较血压下降值药物类型
两种教学方法比较考试分数教学方法

13.2 配对样本

若每个对象提供两个相关观测,应该转成差值:

Di=XiYi.

然后对

μD

做单样本 t 推断。

例子:

场景为什么配对
治疗前后血压同一个人重复测量
左右眼指标同一个受试者两只眼
双胞胎对照天然匹配

配对设计的优势是去除个体差异;错误地当作独立样本会浪费信息,甚至得到错误标准误。

13.3 k 个独立样本

当组数 k>2 时,不能简单做大量两两 t 检验,因为 Type I error 会累积。

常用模型:

Yij=μ+τi+εij,i=1,,k.

其中 τi 是第 i 组处理效应。

检验目标通常是

H0:μ1=μ2==μk.

这会引出 ANOVA。

13.4 随机区组设计

随机区组设计用于处理已知的异质性来源。模型形式可写为

Yij=μ+τi+βj+εij,

其中:

  1. τi 是处理效应;
  2. βj 是区组效应;
  3. 同一区组内的观测更可比。

例子:多个农田区块中比较肥料。每个区块都施用所有肥料,区块本身肥力差异通过 βj 控制。


14. 专题深化:关系建模与分类数据

14.1 回归问题

当解释变量是定量变量,或研究目标是变量关系时,通常进入回归。

简单线性回归:

Yi=β0+β1xi+εi.

研究问题:

问题对应参数
x 增加时 Y 是否线性变化β1
预测给定 x 下的平均响应β0+β1x
控制多个变量后的边际效应多元回归系数

这部分在第 13 章展开。

14.2 分类响应变量

如果响应变量是类别,不能直接套普通均值模型。

二分类响应:

Y{0,1}

常用比例、风险差、odds ratio 或 logistic 回归。

多分类响应可用列联表、multinomial 模型等。

14.3 列联表

两个定性变量的关系常用列联表表示。

例如:

患病未患病
暴露n11n12
未暴露n21n22

常见问题:

  1. 两个变量是否独立?
  2. 不同组的比例是否相同?
  3. 暴露是否改变患病风险?

后续会连接卡方独立性检验和两比例检验。

14.4 方法选择流程图

响应变量解释变量/设计常见方法
定量一个总体单样本 t
定量两独立组两样本 t / Welch
定量配对观测配对 t
定量多独立组ANOVA
定量区组结构随机区组 / repeated measures
定量定量解释变量回归
定性一个比例单比例推断
定性两组比例两比例推断
定性两个分类变量列联表 / 卡方检验

15. 本章复习清单

核心内容复习时要能做到
定量/定性变量能判断数字编码是否只是类别
factor/level/unit能区分处理因素、水平和实验单位
独立两样本知道用两样本 t 或 Welch
配对样本会转化为差值做单样本推断
k-sample知道会引向 ANOVA
随机区组能解释 block effect 的作用
回归知道用于定量关系和预测
分类响应知道不能直接套普通均值模型
列联表会组织两个定性变量的数据
方法选择能根据数据结构选后续章节方法

16. 综合深化:从研究问题识别数据结构

16.1 数字编码不等于定量变量

变量类型取决于数值所承载的关系,而不是存储格式:

  • 名义变量只有相同或不同,如血型、地区;编码为 1、2、3 后仍不能计算有意义的均值。
  • 有序变量存在次序,如疾病轻、中、重,但相邻等级之间的距离未必相等。
  • 定量变量的差值具有可解释的单位;若零点也有实际含义,还可比较倍数。

响应变量为有序类别时,可考虑累积 logit 等有序分类模型;无序多类别响应则适合多项 logit。把类别编号后直接做线性回归,会人为强加等距结构。

16.2 独立样本、配对样本与重复测量

判断关键不是“有两列数据”,而是观测单位是否共享:

  • 两组由不同个体构成且抽样相互独立,是独立两样本。
  • 同一对象处理前后各测一次,或对象按关键特征一一匹配,是配对数据。
  • 同一对象在三个以上条件或时间点反复测量,是重复测量或随机区组结构。

配对分析对差值 Di=XiYi 建模,可消去共同的个体效应。若忽略配对关系,会把个体间变异混入误差,通常损失功效;反之,把不相关个体硬配对也不会凭空产生信息。

16.3 观察性研究中的混杂

比较吸烟者与不吸烟者的心率时,年龄、运动水平、药物使用等变量可能同时影响吸烟状态与心率,形成混杂。匹配、分层和回归调整可改善可比性;倾向评分与工具变量用于更复杂的观察性设计。但这些方法都依赖额外的可识别假设,不能把条件相关自动升级为因果效应。

随机分配的价值在于使处理与潜在混杂因素在设计上独立。无法随机化时,应明确处理分配机制、时间顺序、遗漏变量风险和目标因果量。

16.4 方法选择的逐层判断

可按以下顺序识别分析结构:

  1. 明确响应变量是定量、二分类、有序还是无序多分类。
  2. 明确观测单位及同一单位是否被重复测量。
  3. 明确处理或分组因子有几个水平。
  4. 判断目标是单总体参数、组间比较、变量关联、预测还是因果效应。
  5. 再检查分布、方差齐性、独立性与缺失机制等假设。

由此可对应到单样本推断、独立两样本、配对检验、ANOVA、随机区组、回归或列联表分析。方法名称应由研究设计和目标决定,而不是只由数据表的列数决定。

16.5 因子、水平与实验单位

“因子”是研究中被操纵或比较的变量,“水平”是因子的具体取值,“实验单位”是被独立分配处理的最小单位。显著性检验的有效样本量由独立实验单位决定,而不是由技术重复次数决定;把同一单位的多次测量当作独立样本会造成伪重复并低估标准误。