抽样方法与偏差
IB 数学:应用与解释 SL· Unit 4: 统计与概率, Topic 4.1· 14 分钟阅读
1. 总体、样本与数据类型★☆☆☆☆⏱ 4 min
总体与样本
总体 (population) 是你想要得出结论的整个群体。样本 (sample) 是你实际收集数据的那个总体子集,因为测量整个总体通常太昂贵或不切实际。
例:
要求某校全部 1200 名学生(总体)的平均身高,你可能只测量其中 60 名(样本)。
我们收集样本,是因为研究整个总体往往不可能。关键要求是样本应具有代表性:它应能反映整个总体,这样我们由样本得出的结论才可信。即使之后的算术全都正确,一个选取不当的样本仍会误导我们。
离散数据与连续数据
离散 (discrete) 数据只能取分离的、可数的数值(通常是整数)。连续 (continuous) 数据可以取某一范围内的任意数值,来自在标度上进行的测量。
例:
兄弟姐妹的数目(0、1、2……)是离散的;跑步者完成一场比赛所用的时间(12.47 秒)是连续的。
分清数据是离散还是连续,在后面很重要:它影响你如何对数据分组以及哪些图表合适。例如,质量或时间这类连续数据通常分入组距区间,而离散计数则可以逐个数值列出。
Exam tip:
快速判断离散还是连续:如果在两个数值之间取一个“中间”值是有意义的(比如 1.5 分钟),数据就是连续的;如果只能取分离的数值(比如 1.5 个孩子毫无意义),它就是离散的。
2. 五种抽样方法★★☆☆☆⏱ 6 min
IB AI SL 要求你掌握五种有名称的抽样技术。对每一种,你都应能描述它的原理并评论其优缺点。只有简单随机抽样在严格意义上才是真正随机的;其余方法都以牺牲一定的公平性来换取便利或更好的代表性。
简单随机抽样
总体中每个成员被选中的机会均等且相互独立,例如给每个成员编号,再用随机数生成器选取。
例:
给 1200 名学生分别编号 1–1200,然后用计算器的随机数生成器选出 60 个不同的编号。
方便抽样
样本由最容易接触到的成员组成。它快速又便宜,但往往不具代表性,且极易产生偏差。
例:
只调查午餐时间恰好在图书馆里的学生。
系统抽样
把总体排成一份名单,选一个随机起点,然后每隔 k 个成员取一个,其中 k = 总体大小除以期望的样本大小。
例:
从 1200 名学生的名单中,要取 60 人就每隔 20 人取一个(因为 1200 / 60 = 20),从前 20 个里的随机位置开始。
配额抽样
把总体分成若干组,研究者非随机地选取成员,直到每组既定的配额被填满。
例:
访问员被要求调查 20 名青少年和 20 名成年人,只是不断上前接触人,直到每个配额达到。
分层抽样
把总体分成互不相同的子群(层),并从每一层中按其在总体中所占大小的比例随机抽取一定数量。
例:
如果某校 60% 是女生、40% 是男生,一个大小为 60 的分层样本会包含 36 名女生和 24 名男生,各自在其组内随机选取。
某校有 1200 名学生:低年级 500 人,高年级 700 人。要抽取一个大小为 60 的分层样本。每组应各选多少人?
- 1
求抽样比例:样本大小除以总体大小。
- 2
- 3
把这个比例应用到每一层,以保持样本按比例:
- 4
- 5
检验各部分之和等于总样本:25 + 35 = 60。所以选取 25 名低年级和 35 名高年级学生,各自在其组内随机选取。
Exam tip:
被要求根据描述说出抽样方法时,找触发短语:“每第 10 个”意味着系统抽样,“与组的大小成比例”意味着分层抽样,“直到每种类型都够了”意味着配额抽样,“就近的人”意味着方便抽样。
3. 可靠性、抽样偏差与离群值★★☆☆☆⏱ 4 min
抽样偏差
当选取样本的方式使总体中某些成员比其他成员更可能被纳入时,就产生抽样偏差 (sampling bias),于是样本不能代表总体。有偏样本会导致误导性的结论。
例:
只问健身房会员人们是否经常锻炼,会高估整个城镇的锻炼水平。
与偏差密切相关的是数据来源的可靠性。在判断数据是否可信时,要问:是谁收集的,他们会不会有偏?样本有多大?样本是如何选取的?来自中立来源的大型、选取良好的样本,远比来自利益相关方的小型、自选样本更可靠。
离群值
离群值 (outlier) 是在数据集中与其他数值相距异常远的一个数据值。离群值可能来自真实的极端情形,也可能来自测量与记录错误。
例:
在某班学生的年龄 12、13、12、14、13、65 中,数值 65 是一个离群值,很可能是记录错误。
当你发现一个离群值时,不要自动删除它。先考虑其成因:如果它明显是错误(打字错、仪器故障),删除或更正它可能是合理的;但如果它是一个真实的观测值,就应该保留,因为它可能携带重要信息。始终说明你的理由,而不要悄悄地删除数值。
Exam tip:
如果一道题要求你“评论”一项调查,就提到抽样方法、样本大小是否足够,以及来源可能有偏的任何理由。每一点写一句清晰的话通常就能得分。
4. 常见陷阱
错误做法:
把系统抽样与简单随机抽样混为一谈
原因:
两者都用到随机成分,所以学生以为它们相同,但系统抽样只随机化起点,而非每一次选取
正确做法:
说明系统抽样是从有序名单中每隔 k 个取一个成员,只有起点是随机选取的
错误做法:
对各层数量四舍五入,使各部分不再加起来等于总样本大小
原因:
对每一层独立地随意取整,会使总数与所要求的样本大小不符
正确做法:
一致地使用抽样比例,并检查所有层的数量加起来等于所要求的总数
错误做法:
以为大样本就自动消除偏差
原因:
大小与偏差是两回事:一个庞大但自选的样本仍然有偏
正确做法:
凭样本如何选取来判断偏差,而不仅凭它有多大
错误做法:
自动删除任何离群值
原因:
真实的极端值携带真实信息,不应无缘无故被舍弃
正确做法:
先调查成因;只有当离群值明显是错误时才删除或更正它,并说明你的理由
5. 速查表
抽样方法 | 原理 | 主要优点 | 主要缺点 |
|---|---|---|---|
简单随机 | 每个成员机会均等(随机数) | 无偏、公平 | 需要一份完整的总体名单 |
方便 | 选取最容易接触到的人 | 快速便宜 | 极易产生偏差 |
系统 | 从有序名单中每隔 k 个取一个成员 | 简单快捷 | 若名单有重复模式则会有偏 |
配额 | 非随机地填满固定的组配额 | 确保每组都出现 | 组内的选取并非随机 |
分层 | 从每组按比例随机抽样 | 对每个子群都有代表性 | 需要已知各组大小 |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2025 · Paper 1
识别所用的抽样方法并指出一个偏差来源
- 2024 · Paper 1
在分层抽样中计算从每一层抽取的数量
- 2023 · Paper 2
评论一项调查的可靠性并识别一个离群值
深入阅读
下一步
抽样是任何统计研究的第一步,所以这个子主题是 Unit 4 其余全部内容的基础。一旦你能收集到有代表性的样本,下一阶段就是用集中趋势与离散程度的度量以及标准的数据表示法来概括和展示这些数据,之后再通过相关与回归来分析变量之间的关系。理解数据来自何处,也有助于你判断能在多大程度上信任任何统计结论。
