# 样本比例之差的抽样分布

> AP 统计学 · AP 统计学 2024-2026
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u12-sampling-distributions-for-the-difference/

本模块涵盖两个独立样本比例之差的抽样分布性质，包括所需条件、参数计算以及用于概率估计的正态近似方法。

**先修:** [单样本比例抽样分布](https://www.owlsprep.com/zh/study/ap-statistics-u12-single-sample-proportion-sampling-distributions/); [正态分布概率计算](https://www.owlsprep.com/zh/study/ap-statistics-unit-5-normal-probability/)

## 学习目标

- 定义两个独立总体下$\hat{p}_1 - \hat{p}_2$的抽样分布
- 验证差值分布正态性所需的三个前提条件
- 计算样本比例之差的精确均值与标准差
- 使用正态近似估计$\hat{p}_1 - \hat{p}_2$对应取值的概率

## 核心定义与关键参数

当你从两个独立总体中抽取随机样本时，重复抽样得到的样本比例差值会发生变化。所有可能的差值构成一个独特的抽样分布，其参数固定且可预测。

**$\hat{p}_1 - \hat{p}_2$的抽样分布** — 从两个独立组中抽取所有样本量为$n_1$和$n_2$的随机样本，计算得到的全部样本比例差值的集合

*记法:* $\hat{p}_1 - \hat{p}_2$

*例:* 对比支持某一政策的18-24岁选民比例与支持同一政策的25-40岁选民比例

$$\mu_{\hat{p}_1 - \hat{p}_2} = p_1 - p_2$$

差值分布的均值完全等于两个总体比例的差值，无需任何近似。标准差利用独立变量方差可加的性质，即使是差值运算也适用。

$$\sigma_{\hat{p}_1 - \hat{p}_2} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}$$

**例题:** 总体1的真实比例$p_1=0.6$，样本量$n_1=100$。总体2的真实比例$p_2=0.45$，样本量$n_2=80$。计算$\hat{p}_1 - \hat{p}_2$抽样分布的均值和标准差。

1. 步骤1：直接使用总体比例计算分布的均值
2. $$\mu_{\hat{p}_1 - \hat{p}_2} = 0.6 - 0.45 = 0.15$$
3. 步骤2：先分别计算每个样本比例的方差
4. $$\text{Var}(\hat{p}_1) = \frac{0.6(0.4)}{100} = 0.0024, \quad \text{Var}(\hat{p}_2) = \frac{0.45(0.55)}{80} = 0.00309$$
5. 步骤3：将方差求和后开平方，得到合并后的标准差
6. $$\sigma_{\hat{p}_1 - \hat{p}_2} = \sqrt{0.0024 + 0.00309} \approx 0.074$$

## 正态近似的适用条件

要将$\hat{p}_1 - \hat{p}_2$的抽样分布视为近似正态分布，你必须验证三个AP考试拿满分要求的硬性条件。

- **随机性**：两个样本均通过简单随机抽样从各自总体中独立选取
- **独立性（10%条件）**：不放回抽样时，每个样本量不超过其所属总体的10%
- **正态性（大计数条件）**：两组的期望成功数和失败数均至少为10

> **满分要求**
>
> 只要任意一个条件不满足，正态近似就无效，你不能使用z分数计算差值分布的概率。

**例题:** 已知$n_1=50$，$p_1=0.2$，$n_2=40$，$p_2=0.3$，检验$\hat{p}_1 - \hat{p}_2$的抽样分布是否近似正态。

1. 步骤1：确认题目背景说明两个样本均为独立随机样本
2. 步骤2：验证10%条件：两个总体分别至少有500人和400人，这在实际调查场景中是常规情况
3. 步骤3：检查全部四个大计数乘积
4. $$n_1p_1 = 10, n_1(1-p_1) = 40, n_2p_2 =12, n_2(1-p_2)=28$$
5. 所有数值均≥10，因此正态近似完全有效。

**考试命令词**

AP考试自由问答题对该考点使用非常特定的表述，如果你跳过必要步骤将会失分：

- **Show that the sampling distribution is approximately normal** — 你必须明确陈述并验证全部三个条件，跳过任意一项检查都不能得到部分分数 *(你不能只写“正态”而不证明大计数条件已满足)*

## $\hat{p}_1 - \hat{p}_2$的概率计算

确认分布近似正态后，你可以使用标准z分数计算方法，得到观测到的差值大于等于给定极值的概率。

$$z = \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)}{\sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}}$$

> **考试记忆小技巧**
>
> RIN：随机（Random）、独立（Independent）、正态（Normal）。做每一道双比例题目之前默念一遍，确保你不会漏掉任何条件检查。

**例题:** 使用之前均值为0.15、标准差为0.074的分布，计算$\hat{p}_1 - \hat{p}_2 > 0.2$的概率。

1. 步骤1：将观测差值、均值和标准差代入z分数公式
2. $$z = \frac{0.2 - 0.15}{0.074} \approx 0.676$$
3. 步骤2：使用标准正态分布表或计算器找到z=0.676右侧的面积
4. 步骤3：最终概率≈0.249，意味着所有可能的样本差值中约有25%会超过0.2

## 常见错误

- **错误做法:** 直接将标准差相加，而不是先加方差再开平方
  - 原因: 独立变量的方差可加，但标准差不可加，这种错误会高估合并后的标准差
  - 正确做法: 分别计算每个样本比例的方差，将两个方差求和后开平方，得到合并后的标准差
- **错误做法:** 使用合并比例计算抽样分布的标准差
  - 原因: 合并比例仅在双比例假设检验中需要，描述理论抽样分布时不需要使用
  - 正确做法: 抽样分布标准差计算中，直接使用已知的独立总体比例$p_1$和$p_2$
- **错误做法:** 仅检查合并总样本的大计数条件，而不对每个组单独检查
  - 原因: 正态性要求两个单比例抽样分布各自都近似正态，而不只是合并后的差值分布
  - 正确做法: 验证全部四个乘积项$n_1p_1$、$n_1(1-p_1)$、$n_2p_2$、$n_2(1-p_2)$均≥10
- **错误做法:** 不放回抽样时忘记确认10%独立性条件
  - 原因: 如果样本量超过所属总体的10%，观测值就不独立，标准差公式会出现偏差
  - 正确做法: 考试作答时明确说明两个样本均小于各自总体的10%，以获得满分
- **错误做法:** 在标准差的分母中使用合并总样本量$n_1 + n_2$
  - 原因: 两个样本完全独立，方差计算时不能将样本量合并
  - 正确做法: 组1的方差仅使用$n_1$，组2的方差仅使用$n_2$

## 速查表

| 参数 | 公式 | 适用条件 |
| --- | --- | --- |
| $\hat{p}_1 - \hat{p}_2$的均值 | $p_1 - p_2$ | 独立随机样本 |
| $\hat{p}_1 - \hat{p}_2$的标准差 | $\sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}$ | 两个样本均满足10%条件 |
| 概率计算的Z分数 | $z = \frac{(\hat{p}_1 - \hat{p}_2) - (p_1 - p_2)}{\sigma_{\hat{p}_1 - \hat{p}_2}}$ | 两个样本均满足大计数条件 |

## 下一步

掌握样本比例之差的抽样分布是学习双比例正式推断的关键基础步骤。你将直接应用这些性质构造双总体比例差值的置信区间，以指定置信水平估计两个群体之间的真实差距。你还会使用相同的核心框架执行双比例z假设检验，判断是否存在统计显著的证据证明两个总体比例存在差异。该考点在AP统计学考试中占比很高，近年考试中约占全部自由问答题分值的15%，熟练掌握条件检验和参数计算将直接提升你在多步推断题中的得分。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u12-sampling-distributions-for-the-difference/
