# 抽样与估计

> 数学 · CIE A-Level 9709
> 来源: https://www.owlsprep.com/zh/study/cie-9709-u4-sampling-and-estimation/

本模块涵盖核心抽样术语、标准抽样方法、总体参数无偏估计和入门级抽样分布，所有内容均匹配CIE 9709考试评分标准。

**先修:** [未分组数据的基础均值与方差计算](https://www.owlsprep.com/zh/study/cie-9709-u4-descriptive-statistics/); [基础概率规则](https://www.owlsprep.com/zh/study/cie-9709-u4-probability-fundamentals/)

## 学习目标

- 在考试场景中区分总体、样本、参数和统计量
- 针对给定场景选择并证明合适的抽样方法
- 正确计算总体均值和方差的无偏估计
- 应用基础抽样分布规则求解标准考试题

## 真题考频

据 OwlsPrep 对官方 CIE 9709 S2 真题的聚合（2016–2025）: **抽样与估计** 近 10 年出现 **122 次**——占 S2 全部真题的 **28.5%**（428 题中 122 题）.

最常考形式: I/II 类错误 (63), 总体均值的假设检验 (57), 总体均值与方差的无偏估计 (34), 泊松均值假设检验 (26).

## 核心抽样术语

CIE所有抽样相关考题都从识别总体参数和样本统计量的区别开始。参数描述完整总体的固定、通常未知的特征，而统计量是从样本数据计算得到的、用于估计该参数的值。

**无偏估计量** — 对于总体参数$\theta$，若估计量$\hat{\theta}$的期望值等于该参数的真实值，则称其为无偏估计量。

*记法:* $E[\hat{\theta}] = \theta$

*例:* 样本均值$\bar{x}$始终是总体均值$\mu$的无偏估计量。

**考试命令词**

CIE在该主题使用特定的指令术语：

- **State** — 无需说明理由，回答正确术语得1分

- **Explain** — 占2分，必须将属性与总体代表性关联起来

**例题:** 一名研究人员计算50名随机选取的12年级学生的平均身高，以估计全国所有12年级学生的平均身高。请指出该场景中的参数和统计量。

1. 步骤1：定位全部感兴趣的群体
2. 总体是全国所有12年级学生，因此参数是该完整总体的真实平均身高。
3. 步骤2：定位从子集计算得到的值
4. 样本是被选中的50名学生，因此统计量是从这50名学生计算得到的平均身高。

## 常见抽样方法

CIE考试经常要求你比较4种核心抽样方法：简单随机抽样、分层抽样、系统抽样和配额抽样。你需要能够描述每种方法，说出一个优点和一个缺点，并为给定场景选择最合适的方法。

**方法对比**

所需抽样方法的并列对比：

- **简单随机抽样** — 每个大小为n的可能样本都有相等的被选中概率
  - 优点: 无偏，统计上易于证明合理性
  - 缺点: 需要完整抽样框，可能过度代表小的子群体

- **分层抽样** — 总体被划分为不同的子群体（层），从每个层中按层大小的比例随机抽取样本
  - 优点: 减少抽样误差，代表所有子群体
  - 缺点: 需要预先知道所有总体成员的层归属信息

- **系统抽样** — 从抽样框中每隔k个成员选取一个，起始点为1到k之间的随机整数
  - 优点: 在实地工作中快速且易于执行
  - 缺点: 如果总体存在与间隔k匹配的周期性模式则会产生偏差

- **配额抽样** — 访谈者选取非随机的参与者以满足预先设定的子群体配额
  - 优点: 成本低，不需要抽样框
  - 缺点: 选择偏差风险高，不具备统计随机性

> **tip**
>
> 在分层抽样的说明中明确提到「与简单随机抽样相比减少了抽样变异」，CIE评分标准会给予满分。

**例题:** 一所学校共有1200名学生（12年级450人，13年级750人），想要抽取40名学生的分层样本用于调查。计算每个年级组需要选取的学生人数。

1. 步骤1：计算整个总体的抽样比例
2. $$\text{Proportion} = \frac{\text{Total sample size}}{\text{Total population}} = \frac{40}{1200} = \frac{1}{30}$$
3. 步骤2：将比例应用到每个层
4. $$\text{Year 12 sample size} = 450 \times \frac{1}{30} = 15$$
5. $$\text{Year 13 sample size} = 750 \times \frac{1}{30} = 25$$
6. 最终答案：15名12年级学生，25名13年级学生

## 均值和方差的无偏估计

这是本主题中权重最高的子概念，几乎出现在每一份统计学6卷和7卷试卷中。样本均值始终是总体均值的无偏估计，但原始样本方差（除以n）是有偏的，因此你必须使用n-1校正因子。

**推导:** 推导无偏样本方差公式

*起点:* 有偏样本方差 $\hat{\sigma}^2 = \frac{1}{n}\sum(x_i - \bar{x})^2$

1. 展开平方差项：$\sum(x_i - \bar{x})^2 = \sum x_i^2 - n\bar{x}^2$
2. 取期望值：$E[\sum(x_i - \bar{x})^2] = (n-1)\sigma^2$
3. 为使估计量无偏，除以n-1而非n

*结论:* 无偏样本方差：$s^2 = \frac{1}{n-1}\left(\sum x^2 - \frac{(\sum x)^2}{n}\right)$

**例题:** 针对样本数据12、15、17、21、25，计算总体均值和方差的无偏估计。

1. 步骤1：计算x的和与x平方的和
2. $$\sum x = 12 + 15 + 17 + 21 + 25 = 90$$
3. $$\sum x^2 = 144 + 225 + 289 + 441 + 625 = 1724$$
4. 步骤2：无偏均值估计
5. $$\bar{x} = \frac{90}{5} = 18$$
6. 步骤3：无偏方差估计，使用n-1=4
7. $$s^2 = \frac{1}{4}\left(1724 - \frac{90^2}{5}\right) = \frac{1}{4}(1724 - 1620) = 26$$

**概念自测**

在继续学习前测试你的理解：

1. 以下哪个分母可以得到总体方差的无偏估计？

   - n
   - n-1
   - n+1
   - n/2

   *解析:* n-1贝塞尔校正消除了样本方差的偏差。

## 抽样分布入门

统计量的抽样分布是从同一总体中抽取的相同大小样本计算得到的该统计量所有可能值的概率分布。对于大样本n，中心极限定理告诉我们样本均值的抽样分布将近似服从正态分布。

$$\text{If } X \sim N(\mu, \sigma^2) \text{ then } \bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$$

> **warning**
>
> CIE考官经常扣分的点是学生在计算样本均值的概率时忘记将总体方差除以样本大小。

**例题:** 一个总体的均值为42，方差为18。对于大小为9的样本，求样本均值抽样分布的方差。

1. 步骤1：应用抽样分布方差规则
2. $$\text{Var}(\bar{X}) = \frac{\sigma^2}{n} = \frac{18}{9} = 2$$
3. 最终答案：样本均值的方差为2

## 常见错误

- **错误做法:** 样本方差使用n作为分母而非n-1
  - 原因: 即使所有其他步骤都正确，CIE评分标准也会为此错误扣除2-3分
  - 正确做法: 在方差计算中明确写出n-1项，确认你使用的是无偏估计量
- **错误做法:** 混淆总体参数和样本统计量
  - 原因: 识别类1分题对于混淆这两个术语的情况不给任何部分分
  - 正确做法: 所有总体值用希腊字母标记，所有样本值用拉丁字母标记，以区分二者
- **错误做法:** 在答案中将配额抽样称为「随机抽样」
  - 原因: 配额抽样使用非随机选择，CIE评分标准明确不接受该描述
  - 正确做法: 准确写出要求的抽样方法名称，只有当总体的每个成员都有相等的被选中概率时，才能将该方法标记为随机
- **错误做法:** 计算样本均值概率时忘记将总体方差除以n
  - 原因: 这会得到完全错误的正态分布，导致整个概率计算得0分
  - 正确做法: 在每道题的开头写出完整的抽样分布符号，避免遗漏方差缩放步骤
- **错误做法:** 在求和之前就对分层样本大小取整
  - 原因: 这可能导致总样本大小与要求的值不匹配
  - 正确做法: 先计算所有层的样本大小，然后调整最大的小数值，使总样本大小完全符合要求

## 速查表

| 量 | 公式 | CIE考试要求 |
| --- | --- | --- |
| 总体均值无偏估计 | $\bar{x} = \frac{\sum x}{n}$ | 与原始样本均值完全相同 |
| 总体方差无偏估计 | $s^2 = \frac{1}{n-1}\left(\sum x^2 - \frac{(\sum x)^2}{n}\right)$ | 分母必须为n-1 |
| 系统抽样间隔 | $k = \lfloor \frac{N}{n} \rfloor$ | k必须为正整数 |
| 分层层样本大小 | $n_h = n \times \frac{N_h}{N}$ | 四舍五入到最近整数 |
| 样本均值的抽样分布 | $\bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$ | 方差除以样本大小n |

## 下一步

掌握抽样与估计是CIE 9709所有后续推断统计学主题的关键基础，这些内容合计占统计学试卷总分的约30%。你在本课程中学到的无偏方差公式将直接在后续每一道置信区间和假设检验题目中复用。为巩固掌握程度，请先练习识别有偏和无偏估计量的针对性题目，再做结合抽样方法选择和方差计算的完整历年真题。下方链接的模块将直接基于本知识拓展你的统计推断技能。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/cie-9709-u4-sampling-and-estimation/
