数据类型、抽样、偏差
IB 数学:应用与解释 HL· 30 分钟阅读
1. 数据类型分类★☆☆☆☆⏱ 10 min
数据分类
所有统计数据都按类型分类,数据类型决定了可以进行何种分析。数据首先分为定性(分类)和定量(数值)两类,定量数据又进一步分为离散(可计数)和连续(可测量)两类。
例:
眼睛颜色 = 定性,拥有汽车数量 = 离散,行驶距离 = 连续
将下列数据分别分类为定性、离散定量或连续定量:(a) 一批货物中橙子的重量,(b) 20题测验中答对的题目数量,(c) 学生拥有的手机品牌,(d) 一杯咖啡的温度。
- 1
回顾定义:定性 = 分类非数值,离散 = 不同可计数值,连续 = 区间内任意值。
- 2
(a) 重量是数值测量,可以在某个范围内取任意值(例如 120.5g、120.54g)。
- 3
分类:(a) = 连续定量。
- 4
(b) 答对题目数量是数值,只能取 0 到 20 之间的整数。
- 5
分类:(b) = 离散定量。
- 6
(c) 手机品牌是非数值分类。
- 7
分类:(c) = 定性。
- 8
(d) 温度可以在范围内取任意值,因此是连续测量值。
- 9
分类:(d) = 连续定量。
测试你的理解
一个足球赛季中打进的进球数属于什么数据类型?
定性
离散定量
连续定量
显示答案
离散定量 —进球数按整数计数,因此即使它是数值型,也属于离散数据。
2. 常用抽样方法★★☆☆☆⏱ 15 min
总体 vs 样本
总体是研究中你想要得出结论的全部个体/研究对象的完整集合。当研究全部总体不现实时,样本是选出用于收集数据的较小子集。
抽样方法 | 描述 | 典型适用场景 |
|---|---|---|
简单随机抽样 | 总体中每个成员被选中的概率相等 | 规模小、可接触的总体 |
系统抽样 | 从有序的总体列表中选择每 个成员 | 有预先列表的大规模总体 |
分层抽样 | 将总体按关键特征分为层(strata),从每个层中抽样 | 确保重要子群的比例代表性 |
整群抽样 | 将总体分为地理相似的群,随机选中整个群进行抽样 | 地理上分散的大规模总体 |
便利抽样 | 选择容易接触到的成员 | 试点研究或初步研究 |
研究者想要研究学生对校园餐饮的满意度,需要确保本科生、研究生和国际学生群体都有代表性。哪种抽样方法最适合?他们要如何实施?
- 1
研究需要预先定义的子群体都有代表性,因此分层随机抽样是最适合的方法。
- 2
步骤 1:将全部学生总体分为 3 层:本科生、研究生、国际学生。
- 3
步骤 2:计算每个层占总体的比例,得到每个组对应比例的样本量。
- 4
步骤 3:使用简单随机抽样从每个层中选出所需数量的学生,然后发放满意度问卷。
3. 识别抽样偏差★★☆☆☆⏱ 15 min
抽样偏差
偏差是抽样中的系统误差,会导致样本无法代表目标总体。常见类型包括选择偏差、自愿应答偏差、无应答偏差和应答偏差。
研究者在健身房外拦住进入健身房的人,请他们完成关于每周运动习惯的调查。这个调查存在哪种偏差?会对结果产生什么影响?
- 1
样本仅从进入健身房的人中选取,这系统地排除了不去这家健身房的人。
- 2
这属于选择偏差:去健身房的人平均来说比普通人群运动更规律。
- 3
结果会系统性高估普通人群每周的平均运动量。
4. 数据的信度与效度(AHL)★★★☆☆⏱ 15 min
除了避免偏差,HL 研究还必须产出既可靠(重复时一致)又有效(真正测量所声称内容)的数据。二者是不同的:一个测量可以信度很高却无效——例如一个总是读数偏高 2 kg 的失准秤,给出的值一致却错误。
信度 vs 效度
信度关注重复测量的一致性;效度关注方法是否测量了意图测量的特征。方法必须可靠才能有效,但仅有信度不能保证效度。
例:
一个停摆的钟信度极高(总显示相同时间)却无效(它不测量实际时间)。
检验方法 | 类型 | 如何运作 |
|---|---|---|
重测法(test-retest) | 信度 | 在两个时间点将同一测验施于同一组人并比较;高度一致表示信度高。 |
复本法(parallel forms) | 信度 | 将测验的两个等价版本施于同一组人并比较;分数一致表示信度高且不受记忆效应影响。 |
内容效度(content validity) | 效度 | 由专家判断题目是否充分覆盖了所测量的主题或构念。 |
效标关联效度(criterion-related validity) | 效度 | 将结果与已确立的外部基准(效标)比较,例如将新的能力测验与日后工作表现作相关。 |
一所学校设计了一份新的 20 题问卷来测量学生的幸福感。描述学校可采用的一种信度检验和一种效度检验。
- 1
信度(重测法):相隔两周将同一份问卷施于同一组学生,然后检查每名学生两次的分数是否接近。高度一致表明该问卷是可靠的。
- 2
效度(内容效度):请幸福感领域的专家审阅这 20 道题,确认它们覆盖了幸福感的所有相关方面(情绪、社交、身体),而不是只测量了学业压力。
一个卡方拟合优度检验用于判断每分钟通话数是否服从泊松分布。合并尾部各组后共有 6 组,且泊松均值是从样本中估计的。求自由度。
- 1
先取(组数)减 1:
- 2
- 3
有一个参数(泊松均值)是从数据估计的,因此再减去 1:
- 4
5. 常见陷阱
错误做法:
混淆分层抽样和整群抽样
原因:
两种方法都将总体分为组,因此经常被混淆
正确做法:
记住:分层抽样按共同特征分组,你从每个组都抽样。整群抽样按地点分组,你随机抽取整个组进行研究。
错误做法:
将鞋码或智商归为连续数据
原因:
它们都是数值测量,因此常被错误分类为连续数据
正确做法:
任何仅取不同分离值的变量(整/半鞋码、整数智商分数)都是离散定量数据。
错误做法:
认为大样本可以消除偏差
原因:
偏差由抽样方法导致,和样本量无关
正确做法:
大的有偏样本仍然是系统不具代表性的。无论样本量多大,都要先检查抽样方法是否存在偏差。
错误做法:
将编码分类数据归为定量数据
原因:
编码定性数据以数字存储,因此导致错误分类
正确做法:
根据数据测量的内容分类,不是根据存储方式分类。仅仅用来标记分类的数字(例如 1 = 纽约,2 = 伦敦)仍然是定性数据。
6. 速查表
概念 | 快速参考 |
|---|---|
数据类型 | 定性 = 分类;离散 = 可计数值;连续 = 任意可测量值 |
抽样方法 | 简单随机 = 机会均等;系统 = 每隔n个;分层 = 每个子群都抽样;整群 = 抽取整个群;便利 = 方便获取 |
常见偏差类型 | 选择 = 群体被排除;自愿 = 自我选择应答者;无应答 = 参与者缺失;应答 = 答案不准确 |
下一步
本基础子主题是IB AI HL所有统计内容的基础。正确的数据分类和偏差识别是从描述统计到假设检验所有主题的要求,IB考试卷1和卷2都会定期考察这些基础概念。
在掌握数据类型、抽样和偏差之后,你接下来会学习整理和可视化数据,然后学习用中心和离散程度度量概括数据,之后再学习概率和推断统计。
