# 样本比例的抽样分布

> AP 统计学 · AP 2024-2026 统计学课程大纲
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u12-sampling-distributions-for-sample-proportions/

我们将定义样本比例的抽样分布，验证所需的正态性条件，计算其核心参数，并应用正态近似求解符合考试要求的分类推断概率问题。

**先修:** [基础统计学术语：总体、样本、参数与统计量的区别](https://www.owlsprep.com/zh/study/ap-statistics-u1-intro-to-stats-terminology/); [正态分布概率与z分数计算](https://www.owlsprep.com/zh/study/ap-statistics-u2-normal-distributions/)

## 学习目标

- 定义样本比例 $\hat{p}$ 的抽样分布，并将其与总体分布和单样本分布区分开
- 验证 $\hat{p}$ 抽样分布满足正态性的全部三个必要条件
- 计算 $\hat{p}$ 抽样分布的精确均值和标准差
- 应用正态近似计算样本比例结果对应的概率

## 定义 $\hat{p}$ 的抽样分布

对于分类数据，必须明确区分三种不同的分布类型：总体分布（全部总体中所有个体的结果）、样本分布（单次采集的单个样本中的结果），以及 $\hat{p}$ 的抽样分布——它汇总了所有相同固定大小的随机样本对应的样本比例统计量。

**样本比例 $\hat{p}$ 的抽样分布** — 从同一指定总体中抽取所有大小为n的简单随机样本，计算得到的全部样本比例值的完整概率分布。

*记法:* $\hat{p} = \frac{\text{样本中的成功数}}{n}$

*例:* 对于共2000名大学生的总体，其中55%的学生住校，所有大小为100的简单随机样本得到的 $\hat{p}$ 值就构成该抽样分布。

**例题:** 某小镇共有1500名登记选民，其中62%支持一项地方公投提案。你反复抽取大小为75的简单随机样本。请说明 $\hat{p}$（大小为75的样本中支持该提案的选民比例）的抽样分布代表什么含义。

1. 首先确定总体：小镇全部1500名登记选民，真实总体比例p=0.62。
2. 该抽样分布描述了从这1500人的总体中抽取所有可能的大小为75的简单随机样本时，你能得到的每一个唯一的 $\hat{p}$ 值。
3. 它同时量化了所有这些样本中每一个可能的 $\hat{p}$ 值出现的相对频率（概率）。

**概念自测**

确认你可以区分三种不同的分布类型

1. 以下哪种分布描述了完整总体中每一个个体对应的分类变量的取值？

   - $\hat{p}$ 的抽样分布
   - 总体分布
   - 单样本分布

   *解析:* 总体分布包含原始的个体结果，而非聚合得到的样本统计量。

## 抽样分布的均值与标准差

当样本是随机选取时，$\hat{p}$ 的抽样分布有两个固定且易于计算的参数。该分布的均值完全等于真实总体比例p，这意味着 $\hat{p}$ 是无偏估计量，不存在系统性高估或低估p的倾向。

$$\mu_{\hat{p}} = p$$

$$\sigma_{\hat{p}} = \sqrt{\frac{p(1-p)}{n}}$$

> **info**
>
> 抽样分布的离散程度会随着样本量n的增大而缩小，因此更大的样本得到的 $\hat{p}$ 值会更紧密地聚集在真实总体p附近。

**推导:** 证明 $\hat{p}$ 是p的无偏估计量

*起点:* X是二项随机变量，统计n次独立试验中的成功次数，满足E[X] = np

1. 定义样本比例为 $\hat{p} = \frac{X}{n}$
2. 应用期望的线性性质：$E[\hat{p}] = E\left[\frac{X}{n}\right] = \frac{1}{n}E[X]$
3. 代入已知的二项分布期望：$\frac{1}{n}(np) = p$

*结论:* $\hat{p}$ 的期望值完全等于总体比例p，证明不存在估计偏差。

**例题:** 某工厂生产灯泡，其中3%为次品。如果你抽取大小为400的简单随机样本，计算 $\hat{p}$（样本中次品的比例）抽样分布的均值和标准差。

1. 确定已知值：总体比例p=0.03，样本量n=400
2. 计算均值：$\mu_{\hat{p}} = p = 0.03$
3. 计算标准差：$\sigma_{\hat{p}} = \sqrt{\frac{0.03(0.97)}{400}} \approx 0.0085$

## 正态近似的适用条件

要使用正态分布近似 $\hat{p}$ 抽样分布的形态，你必须验证三个不可忽略的条件，所有这些条件在AP考试的自由作答题中都会被明确评分。

**大样本计数条件** — 要求样本中的期望成功数和期望失败数均不小于10，以此保证离散的二项分布可以被连续正态曲线很好地近似。

*记法:* $np \geq 10$ 且 $n(1-p) \geq 10$

**考试命令词**

AP阅卷官会为完整的条件验证给出1分满分，如果你遗漏任何步骤都会扣分

- **Random** — 样本必须是经过正确随机化的简单随机样本或实验组，以消除选择偏差 *(验证表述：'题目说明我们抽取了80名顾客的简单随机样本，因此该条件满足。')*

- **10% Condition** — 无放回抽样时，样本量n不得超过有限总体总量的10% *(验证表述：'n=80，总体规模为1000，80 < 0.1*1000 = 100，因此该条件满足。')*

- **Large Counts** — 期望成功数和失败数均≥10，以此作为正态性的适用依据 *(验证表述：np=80*0.25=20 ≥10，n(1-p)=60 ≥10，因此大样本计数条件成立。)*

**例题:** 对于从p=0.3的总体中抽取大小为25的样本，判断 $\hat{p}$ 的抽样分布是否近似服从正态分布。

1. 检验随机性：假设样本是题目指定的有效简单随机样本
2. 检验10%条件：假设总体规模至少为250，因此n=25小于总体的10%
3. 检验大样本计数条件：np = 25*0.3 = 7.5 < 10，n(1-p) = 17.5 ≥ 10
4. 结论：大样本计数条件不满足，因此该抽样分布不近似服从正态分布。

## 样本比例的概率计算

所有三个条件验证完成后，你可以将 $\hat{p}$ 的抽样分布视为完全正态分布，使用标准正态累积分布函数计算任意 $\hat{p}$ 取值区间对应的概率。

$$z = \frac{\hat{p} - \mu_{\hat{p}}}{\sigma_{\hat{p}}}$$

> **R-L-N 考试记忆口诀**
>
> R-L-N：按顺序记住三个条件：随机（Random）、10%上限（10% Limit）、大样本计数（Large Counts，即正态性），这样你就不会在AP自由作答题中丢失评分点。

**例题:** 公共卫生数据显示18%的美国成年人吸烟。我们抽取大小为300的成年人简单随机样本，求样本中吸烟者比例小于14%的概率。

1. 验证条件：随机（简单随机样本）、10%条件（300小于全部美国成年人的10%）、大样本计数条件：np=54 ≥10，n(1-p)=246 ≥10。所有条件均满足。
2. 计算参数：$\mu_{\hat{p}} = 0.18$，$\sigma_{\hat{p}} = \sqrt{\frac{0.18*0.82}{300}} \approx 0.0222$
3. 计算z分数：$z = \frac{0.14 - 0.18}{0.0222} \approx -1.80$
4. 求P(Z < -1.80) = 0.0359。观测到样本比例低于14%的概率约为3.6%。

## 常见错误

- **错误做法:** 使用样本 $\hat{p}$ 而非真实总体p来计算 $\sigma_{\hat{p}}$
  - 原因: 抽样分布的理论标准差是用已知的总体比例定义的，而非单个样本得到的估计值。
  - 正确做法: 计算抽样分布的精确离散程度时，始终使用题目给出的总体p值。
- **错误做法:** 应用正态近似前跳过条件检验
  - 原因: 在比例推断类题目中，如果你没有明确验证全部三个条件，AP阅卷官会直接扣除1-2分。
  - 正确做法: 对于所有使用 $\hat{p}$ 正态近似的题目，都要逐一说明并验证随机、10%、大样本计数三个条件。
- **错误做法:** 在 $\sigma_{\hat{p}}$ 的分母中直接使用n而非 $\sqrt{n}$
  - 原因: 这样得到的是二项计数X的标准差，而非样本比例 $\hat{p}$ 的标准差，会得到严重错误的离散程度结果。
  - 正确做法: 使用公式 $\sqrt{p(1-p)/n}$ 得到比例分布的正确标准差。
- **错误做法:** 有放回抽样时仍然检验10%条件
  - 原因: 有放回抽样时所有观测值完全独立，因此10%规则完全不必要且无关。
  - 正确做法: 仅当从有限总体进行无放回抽样时，才需要验证10%条件。
- **错误做法:** 要求观测到的样本成功数和失败数≥10，而非期望的np和n(1-p)
  - 原因: 大样本计数条件使用的是由总体p计算得到的期望值，而非你特定样本中的观测计数。
  - 正确做法: 使用题目给出的总体比例p计算np和n(1-p)，不要使用你的样本 $\hat{p}$。

## 速查表

| 参数 | 公式 | 必要条件 |
| --- | --- | --- |
| $\hat{p}$ 的均值 | $\mu_{\hat{p}} = p$ | 样本经过随机选取 |
| $\hat{p}$ 的标准差 | $\sigma_{\hat{p}} = \sqrt{\frac{p(1-p)}{n}}$ | n ≤ 总体总量的10% |
| 正态近似 | $\hat{p} \sim N(\mu_{\hat{p}}, \sigma_{\hat{p}})$ | $np \geq 10$，$n(1-p) \geq 10$ |
| $\hat{p}$ 的z分数 | $z = \frac{\hat{p} - p}{\sqrt{p(1-p)/n}}$ | 全部3个条件均已验证 |

## 下一步

掌握样本比例的抽样分布是后续所有分类推断内容的核心基础，这部分内容约占AP统计学考试总分的15%。你将复用这里学到的条件和参数公式，构造用于估计未知总体比例的置信区间，以及对总体比例的相关假设进行正式的假设检验。本知识点也直接关联到样本均值的抽样分布，后续课程中你会将其应用于定量数据的推断。明确的条件验证是AP自由作答题中最常失分的点之一，因此你要优先练习每道题的这一步骤。继续学习后续知识点，搭建完整的比例推断知识体系。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u12-sampling-distributions-for-sample-proportions/
