数据类型、抽样、偏差
IB 数学:应用与解释 HL· 30 分钟阅读
1. 数据类型分类★☆☆☆☆⏱ 10 min
数据分类
所有统计数据都按类型分类,数据类型决定了可以进行何种分析。数据首先分为定性(分类)和定量(数值)两类,定量数据又进一步分为离散(可计数)和连续(可测量)两类。
例:
眼睛颜色 = 定性,拥有汽车数量 = 离散,行驶距离 = 连续
将下列数据分别分类为定性、离散定量或连续定量:(a) 一批货物中橙子的重量,(b) 20题测验中答对的题目数量,(c) 学生拥有的手机品牌,(d) 一杯咖啡的温度。
- 1
回顾定义:定性 = 分类非数值,离散 = 不同可计数值,连续 = 区间内任意值。
- 2
(a) 重量是数值测量,可以在某个范围内取任意值(例如 120.5g、120.54g)。
- 3
分类:(a) = 连续定量。
- 4
(b) 答对题目数量是数值,只能取 0 到 20 之间的整数。
- 5
分类:(b) = 离散定量。
- 6
(c) 手机品牌是非数值分类。
- 7
分类:(c) = 定性。
- 8
(d) 温度可以在范围内取任意值,因此是连续测量值。
- 9
分类:(d) = 连续定量。
测试你的理解
一个足球赛季中打进的进球数属于什么数据类型?
定性
离散定量
连续定量
显示答案
离散定量 —进球数按整数计数,因此即使它是数值型,也属于离散数据。
2. 常用抽样方法★★☆☆☆⏱ 15 min
总体 vs 样本
总体是研究中你想要得出结论的全部个体/研究对象的完整集合。当研究全部总体不现实时,样本是选出用于收集数据的较小子集。
抽样方法 | 描述 | 典型适用场景 |
|---|---|---|
简单随机抽样 | 总体中每个成员被选中的概率相等 | 规模小、可接触的总体 |
系统抽样 | 从有序的总体列表中选择每 个成员 | 有预先列表的大规模总体 |
分层抽样 | 将总体按关键特征分为层(strata),从每个层中抽样 | 确保重要子群的比例代表性 |
整群抽样 | 将总体分为地理相似的群,随机选中整个群进行抽样 | 地理上分散的大规模总体 |
便利抽样 | 选择容易接触到的成员 | 试点研究或初步研究 |
研究者想要研究学生对校园餐饮的满意度,需要确保本科生、研究生和国际学生群体都有代表性。哪种抽样方法最适合?他们要如何实施?
- 1
研究需要预先定义的子群体都有代表性,因此分层随机抽样是最适合的方法。
- 2
步骤 1:将全部学生总体分为 3 层:本科生、研究生、国际学生。
- 3
步骤 2:计算每个层占总体的比例,得到每个组对应比例的样本量。
- 4
步骤 3:使用简单随机抽样从每个层中选出所需数量的学生,然后发放满意度问卷。
3. 识别抽样偏差★★☆☆☆⏱ 15 min
抽样偏差
偏差是抽样中的系统误差,会导致样本无法代表目标总体。常见类型包括选择偏差、自愿应答偏差、无应答偏差和应答偏差。
研究者在健身房外拦住进入健身房的人,请他们完成关于每周运动习惯的调查。这个调查存在哪种偏差?会对结果产生什么影响?
- 1
样本仅从进入健身房的人中选取,这系统地排除了不去这家健身房的人。
- 2
这属于选择偏差:去健身房的人平均来说比普通人群运动更规律。
- 3
结果会系统性高估普通人群每周的平均运动量。
4. 常见陷阱
错误做法:
混淆分层抽样和整群抽样
原因:
两种方法都将总体分为组,因此经常被混淆
正确做法:
记住:分层抽样按共同特征分组,你从每个组都抽样。整群抽样按地点分组,你随机抽取整个组进行研究。
错误做法:
将鞋码或智商归为连续数据
原因:
它们都是数值测量,因此常被错误分类为连续数据
正确做法:
任何仅取不同分离值的变量(整/半鞋码、整数智商分数)都是离散定量数据。
错误做法:
认为大样本可以消除偏差
原因:
偏差由抽样方法导致,和样本量无关
正确做法:
大的有偏样本仍然是系统不具代表性的。无论样本量多大,都要先检查抽样方法是否存在偏差。
错误做法:
将编码分类数据归为定量数据
原因:
编码定性数据以数字存储,因此导致错误分类
正确做法:
根据数据测量的内容分类,不是根据存储方式分类。仅仅用来标记分类的数字(例如 1 = 纽约,2 = 伦敦)仍然是定性数据。
5. 速查表
概念 | 快速参考 |
|---|---|
数据类型 | 定性 = 分类;离散 = 可计数值;连续 = 任意可测量值 |
抽样方法 | 简单随机 = 机会均等;系统 = 每隔n个;分层 = 每个子群都抽样;整群 = 抽取整个群;便利 = 方便获取 |
常见偏差类型 | 选择 = 群体被排除;自愿 = 自我选择应答者;无应答 = 参与者缺失;应答 = 答案不准确 |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2025 · 1
数据分类选择题
- 2024 · 1
识别抽样方法中的偏差
- 2023 · 2
证明抽样方法选择的合理性
下一步
本基础子主题是IB AI HL所有统计内容的基础。正确的数据分类和偏差识别是从描述统计到假设检验所有主题的要求,IB考试卷1和卷2都会定期考察这些基础概念。
在掌握数据类型、抽样和偏差之后,你接下来会学习整理和可视化数据,然后学习用中心和离散程度度量概括数据,之后再学习概率和推断统计。
