# 数据类型、抽样与偏差

> IB 数学：分析与方法 SL · IB AA SL
> 来源: https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-data-types-sampling-and-bias/

本子主题涵盖统计分析的基础概念：如何对不同类型的数据进行分类、从总体中选择样本的常用方法，以及如何识别会导致统计结果无效的偏差。

**先修:** 基础数值素养

## 学习目标

- 将数据分类为定性数据、离散定量数据或连续定量数据
- 区分常见的随机与非随机抽样方法
- 识别统计研究中不同类型的抽样偏差
- 针对给定研究问题评估抽样方法的有效性

## 数据类型分类

**数据分类** — 数据根据其性质和测量尺度进行分类，分类结果决定了哪些统计分析和图表对该数据集有效。

*例:* 眼睛颜色是定性数据，成年人的身高是定量数据。

所有数据首先可以分为两大类：定性（分类）数据和定量（数值）数据。定性数据描述非数值的性质或属性，而定量数据代表数值测量结果。

- 离散定量数据：只能取特定分离值的计数值（例如：教室中的学生人数）
- 连续定量数据：可以在区间内取任意值的测量值（例如：猫的体重）

**例题:** 将下列每项分类为定性、离散定量或连续定量：(a) 苹果的质量，(b) 笔记本电脑的品牌，(c) 咖啡馆每天的顾客人数。

1. 对于(a)：质量是可以在一定区间内取任意值的数值测量，即使记录时进行了四舍五入。
2. 结论：(a) 是连续定量数据。
3. 对于(b)：品牌是没有固有数值排序的非数值类别。
4. 结论：(b) 是定性数据。
5. 对于(c)：顾客人数是只能为非负整数的计数值。
6. 结论：(c) 是离散定量数据。

## 常用抽样方法

**总体与样本** — 总体是统计研究中所有感兴趣研究对象的完整集合。样本是从总体中选出用于分析的较小子集。

*记法:* $N$ = population size, $n$ = sample size

*例:* 如果研究所有IB SL学生的考试成绩，总体是全球所有IB SL学生，样本是从10所学校中选出的100名学生。

随机抽样方法让总体中每个成员都有已知的非零选中概率，这有助于获得具有代表性的样本。IB考试中最常考查的常用方法有：

- 简单随机抽样：所有容量为$n$的样本被选中的概率相等，通常通过随机数生成
- 系统抽样：在随机起点之后，每隔$k$个成员选取一个
- 分层抽样：将总体分为层（共享某一特征的组），然后从每层按比例抽样
- 整群抽样：将总体分为自然存在的群，随机选择群，然后对选中群中的所有成员进行抽样

**例题:** 某大学有800名一年级学生、600名二年级、400名三年级、200名四年级。计算容量为100的分层抽样中，每个年级需要抽取的学生人数。

1. 首先计算总总体大小：
2. $$N = 800 + 600 + 400 + 200 = 2000$$
3. 计算抽样比例，即需要抽取的总体占比：
4. $$\frac{n}{N} = \frac{100}{2000} = 0.05$$
5. 用每个年级的人数乘以抽样比例：一年级：$800 \times 0.05 = 40$，二年级：$600 \times 0.05 = 30$，三年级：$400 \times 0.05 = 20$，四年级：$200 \times 0.05 = 10$
6. 最终答案：每个年级分别抽取40、30、20、10名学生。

## 抽样偏差

**抽样偏差** — 当总体中某些成员被选入样本的概率系统性地偏高或偏低时就会产生偏差，这会导致结果不具代表性，无法推广到整个总体。

你需要识别的常见偏差类型包括：选择偏差（抽样框排除了部分总体）、自选择偏差（参与者自愿参与）和幸存者偏差（只包含现存的研究对象）。

> **tip**
>
> 大样本量无法解决系统性偏差。一个非常大的有偏样本仍然是有偏的，它只会给出更精确的错误结果。

**例题:** 一名研究者想要找出高中生每周平均花在锻炼上的时间。他们在一家健身房的社交媒体页面发布问卷，收集了200份回复。解释为什么这个样本存在偏差。

1. 确定感兴趣的总体：所有高中生。确定被系统性排除的对象：不关注该健身房社交媒体的学生，以及不去健身房的学生。
2. 该样本会过度代表锻炼量高于平均水平的学生，因此计算出的平均值会高于所有高中生的真实平均值。
3. 这是选择偏差，因为抽样框（健身房关注者）不能代表整个感兴趣的总体。

> **考试提示:** 当IB要求你"评论"抽样方法的"有效性"时，你始终需要讨论该方法是否会产生偏差结果。

## 常见错误

- **错误做法:** 将四舍五入的连续数据称为离散数据（例如将按整年计的年龄称为离散数据）
  - 原因: 数据分类基于底层测量性质，而非记录方式。即使四舍五入，年龄本质上仍是连续测量值。
  - 正确做法: 始终根据测量的性质对数据分类，而非报告方式。
- **错误做法:** 混淆分层抽样和整群抽样
  - 原因: 两种方法都将总体分组，但抽样过程截然不同。
  - 正确做法: 分层：从每个组按比例抽样。整群：随机选择完整组，对选中组内所有个体抽样。
- **错误做法:** 声称大样本量可以消除偏差
  - 原因: 大样本量减少随机抽样误差，但无法修正系统性偏差。
  - 正确做法: 无论样本量大小，首先检查是否存在总体群体被系统性排除的情况。
- **错误做法:** 将所有定性数据视为同一类型
  - 原因: 虽然IB SL不要求你区分有序和名义数据，但你仍需要认识到定性数据永远不是定量数据。
  - 正确做法: 即使类别用数字标记（例如球衣号码），如果数字不代表测量结果，它仍然是定性数据。

## 速查表

| 类别 | 类型 | 核心总结 |
| --- | --- | --- |
| 数据分类 | 定性 | 非数值分类属性 |
| 数据分类 | 离散定量 | 计数，仅取不同值 |
| 数据分类 | 连续定量 | 测量，区间内任意值 |
| 抽样 | 简单随机 | 所有$n$-sized samples equally likely |
| 抽样 | 系统 | 随机起点后每隔$k$个选一个 |
| 抽样 | 分层 | 从每层按比例抽样 |
| 抽样 | 整群 | 对随机选中的整群全部抽样 |
| 偏差 | 核心规则 | 大样本量无法消除偏差 |

## 下一步

现在你已经理解了数据收集、分类和抽样偏差的基础概念，你可以继续学习数据的整理、汇总和可视化。数据分类直接决定了哪些汇总指标和图表适用于数据集。理解偏差之所以重要，是因为不具代表性的样本会导致对总体的错误结论。请注意：将这一思想形式化的置信区间和假设检验属于Math AI，而非AA，不属于AA SL的范围。

- [数据表示：直方图、箱线图、累积频率](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-data-representation-histograms-box-plots/)
- [集中趋势与离散程度度量](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-measures-of-central-tendency-and/)
- [累积分布函数与百分位数](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-cumulative-distributions-and-percentiles/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-data-types-sampling-and-bias/
