# 数据类型与抽样

> IB 数学 AA 高水平（HL） · IB AA HL
> 来源: https://www.owlsprep.com/zh/study/ib-math-aa-hl-u4-data-types-and-sampling/

本模块介绍统计数据的核心分类方法和主要抽样方法，教你识别偏差并选择有效的数据收集方法，这是IB AA HL所有统计主题的基础技能。

**先修:** 基本了解通用统计研究设计

## 学习目标

- 区分定性数据、离散定量数据和连续定量数据类型
- 描述并比较常见抽样方法
- 识别抽样偏差的来源，并区分偏差和抽样误差
- 为给定研究场景选择合适的抽样方法

## 数据类型分类

**数据分类** — 数据按其性质分类，分类结果决定了可以对其应用哪些类型的统计分析。

*例:* 你无法对眼睛颜色这类分类数据计算平均值。

数据首要分为**定性（分类）**数据（非数值属性）和**定量**数据（数值测量或计数）。定量数据又进一步分为离散变量和连续变量。

**离散变量与连续变量** — 离散变量只能取不同的独立值（几乎都是计数）。连续变量可以在区间内取任意值，是测量得到的结果。

*例:* 拥有的汽车数量是离散变量；汽车的重量是连续变量。

**例题:** 将每个变量分类为定性、离散定量或连续定量：(a) 学生汽车的颜色，(b) 学生通勤上学的距离，(c) 学生拥有的汽车数量。

1. (a)：汽车颜色是非数值属性，因此属于定性数据。
2. (b)：通勤距离是可以在两个数之间取任意值的测量结果，因此属于连续定量数据。
3. (c)：汽车数量只能是整数（独立值），因此属于离散定量数据。

**考试命令词**

- **Classify** — 说明变量或抽样方法的正确类别，如需则提供简要理由 *(始终解释你选择该分类的原因)*

> **考试提示:** 即使变量被四舍五入为整数，如果它本质上是测量得到的，它仍然是连续变量（例如按整年计的年龄仍然是连续变量）。

## 常见抽样方法

收集数据时，你可以进行**普查**（收集总体中每个成员的数据）或抽取**样本**（从子集收集数据）。IB AA HL要求你掌握四种核心抽样方法：

- **简单随机抽样**：所有相同规模的样本被选中的概率相等，通常用随机数生成。
- **系统抽样**：从有序列表中，从随机起始位置开始，每$k$个成员选取一个。
- **分层抽样**：将总体划分为相关子组（层），然后按层的规模比例从每个层中抽取随机样本。
- **方便抽样**：选择最容易接触到的个体，不进行随机化。

**例题:** 一所大学有12000名本科生：4500名大一，3500名大二，2500名大三，1500名大四。研究人员想要按年级抽取240名学生的分层样本，应该抽取多少名大四学生？

1. 计算大四学生占总体的比例：
2. $$\text{Proportion} = \frac{1500}{12000} = 0.125$$
3. 将比例乘以总样本规模，得到应抽取的大四学生数量：
4. $$0.125 \times 240 = 30$$
5. 研究人员应该抽取30名大四学生。

> **考试提示:** 对于分层抽样，除非另有明确说明，否则始终按层的规模比例抽样，而非平均抽样。

## 抽样偏差与抽样误差

有效的样本必须代表目标总体。**抽样偏差**是一种系统性误差：总体中部分成员被选中的概率高于或低于其他成员，导致结果偏斜。

> **warning**
>
> 方便抽样几乎总是存在显著偏差，因此绝不能用它得出关于总体的一般性结论。

**抽样误差** — 样本统计量与真实总体参数之间的自然随机差异，由抽样选择的随机变异导致。抽样误差随样本规模增大而减小。

*例:* 100名学生的随机样本得到的平均身高抽样误差小于10名学生的随机样本。

**例题:** 研究人员想要估计IB学生每周午餐的平均花费。他们站在学校昂贵的自助餐厅外，询问前15名离开的学生。最可能出现什么偏差，它会对结果产生什么影响？

1. 在昂贵自助餐厅就餐的学生，午餐花费比普通学生更高。
2. 这是选择偏差，样本系统性地过度代表了午餐花费更高的学生。
3. 研究人员的结果会高估该校所有IB学生的真实平均午餐花费。

## 常见错误

- **错误做法:** 因为年龄通常按整年报告，就将其分类为离散变量。
  - 原因: 年龄是可以取任意值的连续测量结果，例如17.5岁。
  - 正确做法: 除非特定研究明确将其按整年计数，否则将年龄分类为连续变量。
- **错误做法:** 将随机抽样误差与抽样偏差混淆。
  - 原因: 随机误差是随样本规模增大而减小的自然变异，而偏差是不会随样本增大而消失的系统性误差。
  - 正确做法: 只有对群体的系统性过度/不足代表才是偏差，随机变异不是偏差。
- **错误做法:** 分层抽样中，无论层的规模多大，都从每个层抽取相同规模的样本。
  - 原因: 这会导致小层被过度代表，大层被不足代表，引入不必要的偏差。
  - 正确做法: 始终按各层在总体中的规模比例抽样。
- **错误做法:** 假设普查不存在任何误差。
  - 原因: 普查仍然可能存在来自无回应、测量错误或数据缺失的非抽样误差。
  - 正确做法: 要知道即使测量了整个总体，仍然可能存在误差。
- **错误做法:** 将分层抽样与简单随机抽样混淆。
  - 原因: 分层抽样先将总体划分为组再抽样，而简单随机抽样直接从整个总体抽样。
  - 正确做法: 记住：分层=先划分为层，再从每个组抽样。

## 速查表

| 类别 | 类型 | 核心特征/偏差风险 |
| --- | --- | --- |
| 数据类型 | 定性（分类） | 非数值属性，例如眼睛颜色 |
| 数据类型 | 离散定量 | 不同数值（计数），例如学生人数 |
| 数据类型 | 连续定量 | 区间内可取任意值（测量），例如身高 |
| 抽样 | 简单随机 | 所有样本概率相等，偏差风险低 |
| 抽样 | 系统 | 每$k$个成员选取一个，偏差风险低 |
| 抽样 | 分层 | 按比例从各层抽样，偏差风险最低 |
| 抽样 | 方便 | 仅选容易接触的成员，偏差风险极高 |

## 下一步

数据类型与抽样是IB AA HL所有统计工作的基础。正确的数据分类决定了你可以进行哪些分析，合适的抽样确保你的结论有效且可推广。收集并分类数据后，下一步就是用描述统计汇总数据，然后可视化数据来识别模式和关系。这些基础技能是课程后续所有推断统计主题（包括假设检验和回归）都需要的。

- [数据呈现与汇总统计](https://www.owlsprep.com/zh/study/ib-math-aa-hl-u4-data-presentation-and-summary-statistics/)
- [概率基本概念与法则](https://www.owlsprep.com/zh/study/ib-math-aa-hl-u4-basic-probability-concepts-and-rules/)
- [条件概率与贝叶斯定理](https://www.owlsprep.com/zh/study/ib-math-aa-hl-u4-conditional-probability-and-bayes-theorem/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-aa-hl-u4-data-types-and-sampling/
