学习指南

样本比例的抽样分布

AP 统计学· 单元6:分类数据的推断:比例,知识点6.2· 12 分钟阅读

1. 定义 $\hat{p}$ 的抽样分布★★☆☆☆⏱ 10 min

对于分类数据,必须明确区分三种不同的分布类型:总体分布(全部总体中所有个体的结果)、样本分布(单次采集的单个样本中的结果),以及 的抽样分布——它汇总了所有相同固定大小的随机样本对应的样本比例统计量。

📘 定义

样本比例 $\hat{p}$ 的抽样分布

从同一指定总体中抽取所有大小为n的简单随机样本,计算得到的全部样本比例值的完整概率分布。

例:

对于共2000名大学生的总体,其中55%的学生住校,所有大小为100的简单随机样本得到的 值就构成该抽样分布。

📐 例题

某小镇共有1500名登记选民,其中62%支持一项地方公投提案。你反复抽取大小为75的简单随机样本。请说明 (大小为75的样本中支持该提案的选民比例)的抽样分布代表什么含义。

  1. 1

    首先确定总体:小镇全部1500名登记选民,真实总体比例p=0.62。

  2. 2

    该抽样分布描述了从这1500人的总体中抽取所有可能的大小为75的简单随机样本时,你能得到的每一个唯一的 值。

  3. 3

    它同时量化了所有这些样本中每一个可能的 值出现的相对频率(概率)。

✓ 快速检测

确认你可以区分三种不同的分布类型

  1. 以下哪种分布描述了完整总体中每一个个体对应的分类变量的取值?

    • 的抽样分布

    • 总体分布

    • 单样本分布

    显示答案
    总体分布

    总体分布包含原始的个体结果,而非聚合得到的样本统计量。

2. 抽样分布的均值与标准差★★★☆☆⏱ 12 min

当样本是随机选取时, 的抽样分布有两个固定且易于计算的参数。该分布的均值完全等于真实总体比例p,这意味着 是无偏估计量,不存在系统性高估或低估p的倾向。

μp^=p\mu_{\hat{p}} = p
σp^=p(1p)n\sigma_{\hat{p}} = \sqrt{\frac{p(1-p)}{n}}
🔬 推导
目标:

证明 是p的无偏估计量

起点:

X是二项随机变量,统计n次独立试验中的成功次数,满足E[X] = np

  1. 1

    定义样本比例为

  2. 2

    应用期望的线性性质:

  3. 3

    代入已知的二项分布期望:

结果:

的期望值完全等于总体比例p,证明不存在估计偏差。

📐 例题

某工厂生产灯泡,其中3%为次品。如果你抽取大小为400的简单随机样本,计算 (样本中次品的比例)抽样分布的均值和标准差。

  1. 1

    确定已知值:总体比例p=0.03,样本量n=400

  2. 2

    计算均值:

  3. 3

    计算标准差:

3. 正态近似的适用条件★★★☆☆⏱ 10 min

要使用正态分布近似 抽样分布的形态,你必须验证三个不可忽略的条件,所有这些条件在AP考试的自由作答题中都会被明确评分。

📘 定义

大样本计数条件

要求样本中的期望成功数和期望失败数均不小于10,以此保证离散的二项分布可以被连续正态曲线很好地近似。

📐 例题

对于从p=0.3的总体中抽取大小为25的样本,判断 的抽样分布是否近似服从正态分布。

  1. 1

    检验随机性:假设样本是题目指定的有效简单随机样本

  2. 2

    检验10%条件:假设总体规模至少为250,因此n=25小于总体的10%

  3. 3

    检验大样本计数条件:np = 25*0.3 = 7.5 < 10,n(1-p) = 17.5 ≥ 10

  4. 4

    结论:大样本计数条件不满足,因此该抽样分布不近似服从正态分布。

4. 样本比例的概率计算★★★★☆⏱ 12 min

所有三个条件验证完成后,你可以将 的抽样分布视为完全正态分布,使用标准正态累积分布函数计算任意 取值区间对应的概率。

z=p^μp^σp^z = \frac{\hat{p} - \mu_{\hat{p}}}{\sigma_{\hat{p}}}
📐 例题

公共卫生数据显示18%的美国成年人吸烟。我们抽取大小为300的成年人简单随机样本,求样本中吸烟者比例小于14%的概率。

  1. 1

    验证条件:随机(简单随机样本)、10%条件(300小于全部美国成年人的10%)、大样本计数条件:np=54 ≥10,n(1-p)=246 ≥10。所有条件均满足。

  2. 2

    计算参数:

  3. 3

    计算z分数:

  4. 4

    求P(Z < -1.80) = 0.0359。观测到样本比例低于14%的概率约为3.6%。

5. 常见陷阱

错误做法:

使用样本 而非真实总体p来计算

原因:

抽样分布的理论标准差是用已知的总体比例定义的,而非单个样本得到的估计值。

正确做法:

计算抽样分布的精确离散程度时,始终使用题目给出的总体p值。

错误做法:

应用正态近似前跳过条件检验

原因:

在比例推断类题目中,如果你没有明确验证全部三个条件,AP阅卷官会直接扣除1-2分。

正确做法:

对于所有使用 正态近似的题目,都要逐一说明并验证随机、10%、大样本计数三个条件。

错误做法:

的分母中直接使用n而非

原因:

这样得到的是二项计数X的标准差,而非样本比例 的标准差,会得到严重错误的离散程度结果。

正确做法:

使用公式 得到比例分布的正确标准差。

错误做法:

有放回抽样时仍然检验10%条件

原因:

有放回抽样时所有观测值完全独立,因此10%规则完全不必要且无关。

正确做法:

仅当从有限总体进行无放回抽样时,才需要验证10%条件。

错误做法:

要求观测到的样本成功数和失败数≥10,而非期望的np和n(1-p)

原因:

大样本计数条件使用的是由总体p计算得到的期望值,而非你特定样本中的观测计数。

正确做法:

使用题目给出的总体比例p计算np和n(1-p),不要使用你的样本

6. 速查表

参数

公式

必要条件

的均值

样本经过随机选取

的标准差

n ≤ 总体总量的10%

正态近似

的z分数

全部3个条件均已验证

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2023 · Paper 1

    正态性条件检验相关选择题

  • 2022 · Paper 2

    样本比例概率计算的自由作答题

  • 2021 · Paper 1

    的标准差计算

下一步

掌握样本比例的抽样分布是后续所有分类推断内容的核心基础,这部分内容约占AP统计学考试总分的15%。你将复用这里学到的条件和参数公式,构造用于估计未知总体比例的置信区间,以及对总体比例的相关假设进行正式的假设检验。本知识点也直接关联到样本均值的抽样分布,后续课程中你会将其应用于定量数据的推断。明确的条件验证是AP自由作答题中最常失分的点之一,因此你要优先练习每道题的这一步骤。继续学习后续知识点,搭建完整的比例推断知识体系。