抽样的潜在问题
AP 统计学· 第3单元:数据收集,主题3.2· 12 分钟阅读
1. 抽样偏差的核心定义★★☆☆☆⏱ 3 min
renderer not yet implemented · content will appear once shipped]抽样偏差
由抽样设计缺陷导致的系统性、重复性的抽样结果偏移,并非来自样本之间的随机偶然波动。
一名教师询问前10名到达教室的学生他们当前的课程成绩,计算得到平均分为92%。这个结果存在偏差吗?
- 1
步骤1:确定目标总体:班级中的所有学生。
- 2
步骤2:注意到早到教室的学生通常比晚到的学生成绩更高。
- 3
步骤3:确认该样本系统性地过度代表了成绩优异的学生,因此计算得到的平均分比班级真实平均分偏高,存在偏差。
测试你对抽样偏差的基础理解:
以下哪一项是抽样偏差的特征?
它由随机偶然波动导致
它持续将结果向单一方向偏移
任何抽样方法都无法避免它
它只会影响样本量小于100的样本
显示答案
它持续将结果向单一方向偏移 —偏差是系统性偏移,而非随机波动,通过合理的抽样设计可以避免。
2. 四类关键的非抽样偏差★★★☆☆⏱ 4 min
renderer not yet implemented · content will appear once shipped]覆盖不足:总体中的整组人群被排除在抽样框之外
无回应偏差:被选中的参与者没有返回调查问卷,且他们的观点与回应者存在差异
自愿回应偏差:参与者自行选择参与调查,过度代表持有强烈意见的人群
回应偏差:调查问题或访谈者的行为引导参与者给出虚假答案
当地一家电视台在其Facebook主页发布了一项民意调查,询问观众是否支持新增公共交通税,共收到12000份回复,其中78%的回复表示反对。这属于哪种偏差?
- 1
步骤1:注意到观众是自行选择参与民意调查,而非被随机选中。
- 2
步骤2:认识到强烈反对该税收的人比持中立态度的人更有可能花时间参与回复。
- 3
步骤3:将其归类为自愿回应偏差,这使得78%的反对结果远高于社区的真实意见。
3. 抽样误差与非抽样误差★★★☆☆⏱ 2 min
很多学生会混淆抽样误差和偏差,但这两个概念是完全不同的:
抽样误差
同一总体的不同随机样本得到的结果之间存在的自然随机波动。它会随着样本量的增加而减小,不属于设计缺陷。
+ 优点: 可预期、可预测,且可以通过置信区间进行度量
非抽样误差(偏差)
由调查设计、抽样框或回应过程中的缺陷导致的系统性偏移。它不会随着样本量的增加而减小。
− 缺点: 无法仅通过样本数据进行度量,会导致结果无法推广
从同一所高中抽取两个各50名学生的随机样本,得到的平均GPA分别为3.2和3.3。这一差异是由抽样误差还是偏差导致的?
- 1
步骤1:确认两个样本都是从全体学生总体中随机抽取的。
- 2
步骤2:注意到随机样本之间的微小差异是可预期的,不属于设计存在缺陷的迹象。
- 3
步骤3:得出结论,该差异是正常的抽样误差,而非偏差。
4. AP自由问答题中的抽样缺陷评估★★★★☆⏱ 3 min
偏差类型 | 获得满分所需的解释内容 |
|---|---|
覆盖不足 | 说出被排除的群体,并解释他们的意见与被抽样群体的意见有何不同 |
无回应偏差 | 说明未回应者的答案与返回调查问卷的人的答案存在差异 |
自愿回应偏差 | 解释持有极端意见的人比持中立态度的人更有可能参与回复 |
回应偏差 | 说明问题的措辞或访谈者会引导参与者在回答时说谎 |
一家餐厅在每张餐桌上放置顾客满意度调查问卷,只有8%的用餐者填写了问卷。请写出符合AP考试标准的完整抽样缺陷说明。
- 1
步骤1:说出偏差名称:这是无回应偏差。
- 2
步骤2:关联场景:92%没有填写问卷的用餐者,其用餐体验为中立的概率远高于极少数体验极好或极差的用餐者。
- 3
步骤3:说明偏移方向:这意味着调查结果会过度代表极端的正面和负面评价,无法反映普通用餐者的体验。
Exam tip:
要在AP偏差类自由问答题中获得满分,你必须说出偏差名称,将其与特定场景关联,并解释偏移的方向,不能仅笼统说“样本有问题”。
5. 常见陷阱
错误做法:
将任何不理想的调查结果都称为“偏差”,不说明具体类型
原因:
AP评分标准要求明确识别偏差类别才能获得满分
正确做法:
说出准确的偏差类型(例如覆盖不足),并解释它如何系统性地偏移结果
错误做法:
将抽样变异性与偏差混淆
原因:
样本之间的自然波动不属于缺陷,是随机抽样中可预期的现象
正确做法:
说明抽样误差描述的是可预期的波动,而偏差是系统性的、重复性的偏移
错误做法:
声称大样本量可以修正所有抽样偏差
原因:
存在偏差的超大样本仍然会产生系统性错误的结果
正确做法:
说明大样本只能减少随机抽样误差,无法修正抽样框缺陷导致的既有偏差
错误做法:
混淆回应偏差和无回应偏差
原因:
无回应偏差发生在被选中的参与者拒绝回答时,而回应偏差发生在参与者说谎或给出错误答案时
正确做法:
通过判断缺陷来自缺失数据还是不准确的报告数据来区分这两类偏差
错误做法:
声称方便样本“容易收集所以无偏差”
原因:
方便样本几乎总会排除目标总体的大部分群体,产生覆盖不足偏差
正确做法:
明确说明方便样本得到的结果无法推广到全体总体
6. 速查表
偏差类型 | 定义 | 常见考试场景 |
|---|---|---|
覆盖不足 | 总体中的部分成员被排除在抽样框之外 | 在商场开展的调查排除了从不逛商场的人 |
无回应偏差 | 被选中的参与者没有完成调查,与回应者存在系统性差异 | 邮寄的税收政策调查问卷的回复率仅为1% |
自愿回应偏差 | 参与者自行选择参与回复,过度代表持有强烈意见的人群 | 关于当地公共交通的电台听众来电民意调查 |
回应偏差 | 调查问题引导参与者给出不准确的答案 | 在父母面前询问青少年的药物使用情况 |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2023 · Paper 1
抽样偏差识别自由问答题
- 2021 · Paper 2
偏差的证明与解释
- 2019 · Paper 1
抽样缺陷分析场景题
下一步
掌握抽样缺陷是在AP统计学数据收集类自由问答题中获得满分的关键前提,这类题目几乎在每一次AP考试中都会出现。这项技能直接帮助你评判实验设计、识别混淆变量,以及证明研究结果是否可以推广到更大的总体,或者是否可以用于证明因果关系。接下来你将在这个基础上学习如何设计完全随机实验、控制潜在变量,以及区分观察性研究和对照实验,这一主题在约30%的AP统计学自由问答题部分会和抽样问题一同考察。请将你新掌握的偏差识别技能应用到关联的练习题集中,在考试当天牢牢拿到这部分分数。
