AP Statistics 抽样分布 — 完整学习指南
适用对象:备考 AP Statistics 的中国学生。
本章覆盖:样本均值与样本比例的抽样分布、中心极限定理、推断三条件(Random / 10% / Normal 或 Large Counts)— AP Statistics Unit 5 全部考点。
前置知识:概率与随机变量(Unit 4)、正态分布(Unit 1)。
关于练习题的说明:下文练习题均为我们按 AP Statistics 风格原创的教学题,不是 College Board 真题的复制或仿造。
1. 为什么抽样分布重要
Unit 5 是从概率(Unit 3-4)通向统计推断(Unit 6-9)的桥梁。Unit 6 起的每个置信区间和假设检验都基于该统计量的抽样分布。Unit 5 直接占 AP 分数 7-12%,但概念支撑后面 30%+ 内容。
核心理念:从随机样本中算出的统计量本身就是一个随机变量,它有自己的概率分布,称为抽样分布。知道这分布的形状/中心/分散度,就能说「样本均值偏离总体均值 X 以上的概率很小」。
2. 样本比例 的抽样分布
从总体真实比例 中抽取大小 的样本, 服从:
- 均值:(无偏)。
- 标准差(标准误):。
- 形状:当 Large Counts 条件成立时近似正态: 且 。
使用条件:
- Random:随机抽样。
- 10% 条件:(独立性近似成立)。
- Large Counts:如上。
3. 样本均值 的抽样分布
从均值 、SD 的总体抽 个样本:
- 均值:。
- 标准差:(按 减小)。
- 形状:总体本身正态 或 时(中心极限定理)近似正态。
使用条件:
- Random:随机抽样。
- 10% 条件:。
- Normal 或大 :见上。
4. 中心极限定理(CLT)
任何具有有限均值 和标准差 的总体(不论形状),抽 个样本:
的抽样分布在 时趋于 Normal(, )。
经验法则: 对大多数总体已足够。极偏总体可能需要更大 。
CLT 不说:
- 总体本身变正态。
- 单个数据点正态。
- 很小时 也正态(除非总体本身正态)。
5. 偏倚与变异性
无偏统计量:均值等于参数()。 和 都无偏。
变异性 = 抽样分布的离散度,由 控制( 大 → 变异小)。要让标准误减半, 需要增至 4 倍。
好的估计量两者都好:无偏且变异低。又精确又系统偏差(永远偏 5%)和无偏但变异大(平均对但单次估计天差地别)都不好。
6. 差与组合
两独立样本的 :
两独立样本的 :
方差相加(独立时);标准差不直接相加。这是双样本推断的基石。
7. 例题精讲
某厂家声称其零件 92% 通过检测。消费者协会随机抽样 个,发现 175 个通过()。如果真实率是 92%,得到样本比例 0.875 或更低的概率是多少?
解答。
条件检查:
- Random ✓。
- 10% 条件:,假设厂商生产 ≥ 2000 件,合理。
- Large Counts: ✓; ✓。
抽样分布:近似正态,、。
Z 值:。
概率:。
解读:如果声称为真,看到这么低的样本比例的概率仅约 1% — 强证据反对 92% 的声明,真实率很可能低于 92%。
8. 易错点
- 混淆 与 :总体 SD 是一个,样本均值的 SD 是 ,更小。AP 评分常抓这个错。
- 忘记列条件:FRQ 中每次都要列出 Random、10%、Normal/Large Counts 三个条件并检查,缺一扣分。
- CLT 误解:CLT 描述抽样分布,不是总体。总体形状不变。
- 样本量混淆: 大 → 标准误小,不是总体 SD 小。
9. 练习题(CED 风格)
- 某总体均值 、SD 。 时,求 与 。说明使用正态近似的理由。
- 民调采访 1000 选民,真实支持率为 0.55。求样本比例落在 0.52–0.58 之间的概率。
- 两独立工厂生产电路板:A 厂 100 块平均 5 缺陷(),B 厂 100 块平均 3 缺陷()。求 的标准误及差异 > 4 个百分点的概率。
10. 速查表
- :、, 且 时近似正态。
- :、,总体正态或 时近似正态。
- 三条件:Random、10%、Normal/Large Counts。每次都要列。
- CLT:任意总体形状下, 在 时趋于正态。
- 两差:方差相加,。
- SE 减半: 加 4 倍。
11. 下一步
抽样分布是 Unit 6(比例推断) 与 Unit 7(均值推断) 的基础 — 置信区间与假设检验直接应用。条件检查要练到自动化。具体 FRQ 场景可问小欧。