# 随机抽样

> AP 统计学 · AP 统计学 2024-2026
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u10-random-sampling/

我们拆解核心随机抽样方法，将其与有缺陷的非随机方法区分开，识别常见的抽样偏差，并选择正确的技术以在AP考试自由作答题中获得满分。

**先修:** [总体与样本的定义](https://www.owlsprep.com/zh/study/ap-statistics-u10-intro-to-data-collection/); [基础研究设计原则概述](https://www.owlsprep.com/zh/study/ap-statistics-u10-intro-to-studies/)

## 学习目标

- 区分简单随机、分层、整群和系统随机抽样方法
- 识别设计不当的非随机抽样技术引入的偏差来源
- 为给定的研究场景选择合适的随机抽样方法
- 论证为什么随机抽样允许将结果推广到更大的目标总体

## 核心随机抽样方法定义

所有有效的随机抽样技术都使用已知的非零概率来选择目标总体中的每一个个体，消除会扭曲结果的系统性偏好。没有任何一种随机抽样方法能保证得到完全有代表性的样本，但它可以从选择过程中消除可预测的偏差。

**简单随机样本（SRS）** — 一种抽样方法，其中总体中任意n个个体组成的组都有相等的被选中概率。

*例:* 给学校里的每个学生分配一个唯一的编号，然后从帽子中抽出50个编号来选择调查参与者。

- 分层随机抽样：将总体划分为具有共同关键特征的同质子组（层），然后从每个层中抽取简单随机样本。
- 整群抽样：将总体划分为自然存在的异质子组（群），然后随机选择完整的群纳入你的样本。
- 系统随机抽样：从完整的抽样框中每隔k个个体选择一个，从随机生成的初始位置开始。

**例题:** 一名研究人员想要调查一个拥有10000名居民的城镇中的200名居民。描述如何为该研究执行系统随机抽样。

1. 首先用总体总规模除以期望样本量计算抽样间隔k：
2. $$k = 10000 / 200 = 50$$
3. 随机生成一个1到50之间的起始整数，例如17。
4. 选择城镇居民列表中的第17位居民，然后每隔50位选择一位：17、67、117……直到选满200名居民。

**概念自测**

测试你对基础抽样定义的理解

1. 哪种抽样方法在抽样前将总体划分为具有相似特征的组？

   - A) SRS
   - B) 分层抽样
   - C) 整群抽样
   - D) 系统抽样

   *解析:* 分层抽样将总体分类为同质层，以减少关键子组的抽样变异性。

## 常见的抽样偏差来源

当目标总体中的某些成员被选中的概率系统性地低于其他成员时，就会发生抽样偏差，即使你原本打算执行随机抽样，结果也不具有代表性。

- 覆盖不足偏差：你的抽样框未能包含目标总体的关键子集，例如使用固定电话列表调查所有选民，这排除了仅使用手机的人群。
- 自愿响应偏差：你邀请参与者自愿加入你的调查，这会过度代表对该主题有强烈正面或负面意见的人。
- 便利抽样：你选择容易接触到的参与者，例如在购物中心外调查路人来估计整个城市的平均家庭收入。

**例题:** 一所高中的校长想要调查学生对新课后项目的意见，并在学校的Instagram页面上发布了一个调查链接让学生自愿填写。识别这种方法中的偏差，并解释它如何扭曲结果。

1. 首先识别所使用的抽样方法：这是一个自愿响应样本，不是随机样本。
2. 引入的偏差是自愿响应偏差。
3. 结果会过度代表对课后项目有非常强烈正面或负面感受的学生，而低估不查看学校Instagram页面或持中立意见的学生。
4. 校长无法将调查结果推广到全体学生群体。

> **考试提示:** 如果你只说出偏差的名称但未能解释它如何影响题目给定特定场景下的结果，AP评分员会扣分。

## 根据场景选择正确的抽样方法

**方法对比**

使用这个框架为考试中任何给定的研究场景选择正确的抽样方法。

- **简单随机样本** — 最适合没有明显感兴趣子组的小型、定义明确的总体。
  - 优点: 易于解释，不需要额外的分组步骤。
  - 缺点: 可能会低估小型关键子组的代表性，统计效率低于分层抽样。

- **分层随机样本** — 最适合你希望保证总体中小型、独特子组代表性的场景。
  - 优点: 降低整体抽样变异性，允许对每个层进行单独分析。
  - 缺点: 需要关于每个个体层成员身份的预先存在数据，后勤上可能更复杂。

- **整群样本** — 最适合你无法轻松接触到每个个体的地理分散总体。
  - 优点: 大幅减少差旅和数据收集成本。
  - 缺点: 如果群不能代表整个总体，抽样变异性会更高。

**例题:** 一个拥有12所不同小学的学区想要调查全学区的300名四年级学生。解释为什么在这种场景下整群抽样比简单随机抽样更实用。

1. 首先识别自然群：每所独立小学都是四年级学生预先存在的异质群。
2. 如果使用简单随机抽样，你需要前往所有12所学校找到随机选中的学生，后勤成本很高。
3. 如果使用整群抽样，你可以随机选择6所完整的小学，然后在每所选中的学校调查50名四年级学生。
4. 这种方法在大幅减少差旅时间和数据收集成本的同时，仍然可以生成具有代表性的样本。

## AP考试抽样自由作答题最佳实践

**考试命令词**

AP考试题使用特定的指令术语，明确定义了你需要包含哪些内容才能获得满分。

- **Identify** — 说出抽样方法或偏差的名称，无需额外解释。 *("识别所描述抽样方法中的偏差类型。")*

- **Describe** — 逐步完整地演示在给定场景下执行该抽样方法的全过程。 *("描述你将如何为该研究实施分层随机抽样。")*

- **Explain** — 将抽样选择与其对研究结果或偏差水平的影响联系起来。 *("解释为什么所描述的抽样方法会产生有偏差的结果。")*

> **简易记忆口诀**
>
> 使用助记符SSC-S来记住四种核心随机抽样方法：Simple（简单）、Stratified（分层）、Cluster（整群）、Systematic（系统）。

## 常见错误

- **错误做法:** 混淆分层抽样和整群抽样，声称你选择完整的层组
  - 原因: 层是同质的，所以你永远不会选择整个层，你是从层中抽样
  - 正确做法: 记住：分层=从每个组中抽样，整群=随机选择完整的组
- **错误做法:** 将便利样本称为简单随机样本
  - 原因: 便利抽样没有随机选择步骤，因此它根本不是随机抽样方法
  - 正确做法: 只有当总体中的每个个体都有已知的非零被选中概率时，才能将该方法标记为随机
- **错误做法:** 声称随机抽样消除了所有抽样变异性
  - 原因: 随机抽样减少偏差但无法消除不同样本之间的自然变异
  - 正确做法: 明确说明随机抽样消除的是系统性偏差，而不是随机抽样误差
- **错误做法:** 在自由作答题答案中忘记将偏差与特定场景联系起来
  - 原因: AP评分员不会为不引用给定场景的通用偏差定义给出满分
  - 正确做法: 始终添加一句话，准确解释给定研究中哪个群体被过度代表或代表不足
- **错误做法:** 互换使用总体和样本这两个术语
  - 原因: 总体是你想要推广到的完整群体，样本只是你从中收集数据的子集
  - 正确做法: 每次在回答中引用这两个术语时，都要明确区分它们

## 速查表

| 抽样方法 | 关键特征 | 最佳适用场景 |
| --- | --- | --- |
| 简单随机样本 | 所有大小为n的组被选中的概率相等 | 小型、定义明确的总体 |
| 分层随机样本 | 从每个同质子组中抽样 | 保证小型关键组的代表性 |
| 整群样本 | 随机选择完整的异质子组 | 地理分散的总体 |
| 系统样本 | 每隔k个个体选择一个 | 大型有序抽样框 |

## 下一步

掌握随机抽样是理解实验设计、统计推断以及将样本结果推广到整个总体的基础。这项技能几乎在每一次AP统计学考试的自由作答部分都会被考察，通常与偏差和研究类型的问题配对出现。接下来，你将学习如何区分随机抽样和随机分配，这是决定你能否从研究结果中得出因果结论的关键区别。你还将练习区分观察性研究和对照实验，并为学习抽样分布打下基础。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u10-random-sampling/
