数据类型与抽样
IB 数学 AA 高水平(HL)· 第4单元:统计与概率,主题1:数据类型与抽样· 15 分钟阅读
1. 数据类型分类★☆☆☆☆⏱ 5 min
数据分类
数据按其性质分类,分类结果决定了可以对其应用哪些类型的统计分析。
例:
你无法对眼睛颜色这类分类数据计算平均值。
数据首要分为定性(分类)数据(非数值属性)和定量数据(数值测量或计数)。定量数据又进一步分为离散变量和连续变量。
离散变量与连续变量
离散变量只能取不同的独立值(几乎都是计数)。连续变量可以在区间内取任意值,是测量得到的结果。
例:
拥有的汽车数量是离散变量;汽车的重量是连续变量。
将每个变量分类为定性、离散定量或连续定量:(a) 学生汽车的颜色,(b) 学生通勤上学的距离,(c) 学生拥有的汽车数量。
- 1
(a):汽车颜色是非数值属性,因此属于定性数据。
- 2
(b):通勤距离是可以在两个数之间取任意值的测量结果,因此属于连续定量数据。
- 3
(c):汽车数量只能是整数(独立值),因此属于离散定量数据。
Exam tip:
即使变量被四舍五入为整数,如果它本质上是测量得到的,它仍然是连续变量(例如按整年计的年龄仍然是连续变量)。
2. 常见抽样方法★★☆☆☆⏱ 6 min
收集数据时,你可以进行普查(收集总体中每个成员的数据)或抽取样本(从子集收集数据)。IB AA HL要求你掌握四种核心抽样方法:
简单随机抽样:所有相同规模的样本被选中的概率相等,通常用随机数生成。
系统抽样:从有序列表中,从随机起始位置开始,每个成员选取一个。
分层抽样:将总体划分为相关子组(层),然后按层的规模比例从每个层中抽取随机样本。
方便抽样:选择最容易接触到的个体,不进行随机化。
一所大学有12000名本科生:4500名大一,3500名大二,2500名大三,1500名大四。研究人员想要按年级抽取240名学生的分层样本,应该抽取多少名大四学生?
- 1
计算大四学生占总体的比例:
- 2
- 3
将比例乘以总样本规模,得到应抽取的大四学生数量:
- 4
- 5
研究人员应该抽取30名大四学生。
Exam tip:
对于分层抽样,除非另有明确说明,否则始终按层的规模比例抽样,而非平均抽样。
3. 抽样偏差与抽样误差★★☆☆☆⏱ 4 min
有效的样本必须代表目标总体。抽样偏差是一种系统性误差:总体中部分成员被选中的概率高于或低于其他成员,导致结果偏斜。
抽样误差
样本统计量与真实总体参数之间的自然随机差异,由抽样选择的随机变异导致。抽样误差随样本规模增大而减小。
例:
100名学生的随机样本得到的平均身高抽样误差小于10名学生的随机样本。
研究人员想要估计IB学生每周午餐的平均花费。他们站在学校昂贵的自助餐厅外,询问前15名离开的学生。最可能出现什么偏差,它会对结果产生什么影响?
- 1
在昂贵自助餐厅就餐的学生,午餐花费比普通学生更高。
- 2
这是选择偏差,样本系统性地过度代表了午餐花费更高的学生。
- 3
研究人员的结果会高估该校所有IB学生的真实平均午餐花费。
4. 常见陷阱
错误做法:
因为年龄通常按整年报告,就将其分类为离散变量。
原因:
年龄是可以取任意值的连续测量结果,例如17.5岁。
正确做法:
除非特定研究明确将其按整年计数,否则将年龄分类为连续变量。
错误做法:
将随机抽样误差与抽样偏差混淆。
原因:
随机误差是随样本规模增大而减小的自然变异,而偏差是不会随样本增大而消失的系统性误差。
正确做法:
只有对群体的系统性过度/不足代表才是偏差,随机变异不是偏差。
错误做法:
分层抽样中,无论层的规模多大,都从每个层抽取相同规模的样本。
原因:
这会导致小层被过度代表,大层被不足代表,引入不必要的偏差。
正确做法:
始终按各层在总体中的规模比例抽样。
错误做法:
假设普查不存在任何误差。
原因:
普查仍然可能存在来自无回应、测量错误或数据缺失的非抽样误差。
正确做法:
要知道即使测量了整个总体,仍然可能存在误差。
错误做法:
将分层抽样与简单随机抽样混淆。
原因:
分层抽样先将总体划分为组再抽样,而简单随机抽样直接从整个总体抽样。
正确做法:
记住:分层=先划分为层,再从每个组抽样。
5. 速查表
类别 | 类型 | 核心特征/偏差风险 |
|---|---|---|
数据类型 | 定性(分类) | 非数值属性,例如眼睛颜色 |
数据类型 | 离散定量 | 不同数值(计数),例如学生人数 |
数据类型 | 连续定量 | 区间内可取任意值(测量),例如身高 |
抽样 | 简单随机 | 所有样本概率相等,偏差风险低 |
抽样 | 系统 | 每个成员选取一个,偏差风险低 |
抽样 | 分层 | 按比例从各层抽样,偏差风险最低 |
抽样 | 方便 | 仅选容易接触的成员,偏差风险极高 |
6. 常见问题
普查一定比样本好吗?
不是。普查耗时、成本高,而且通常无法完成(例如破坏性测试)。选择得当的随机样本可以用低得多的成本和工作量得到准确结果。
连续数据可以被当作离散数据处理吗?
可以,当测量精度有限时可以。例如,四舍五入到最近厘米的身高在分析中会被当作离散数据,但它本质上仍然是连续变量。
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2025 · 2
识别所用抽样方法的类型
- 2024 · 1
按数据类型对给定变量分类
- 2023 · 2
评论研究中偏差的来源
下一步
数据类型与抽样是IB AA HL所有统计工作的基础。正确的数据分类决定了你可以进行哪些分析,合适的抽样确保你的结论有效且可推广。收集并分类数据后,下一步就是用描述统计汇总数据,然后可视化数据来识别模式和关系。这些基础技能是课程后续所有推断统计主题(包括假设检验和回归)都需要的。
