学习指南

数据类型与抽样

IB 数学 AA 高水平(HL)· 第4单元:统计与概率,主题1:数据类型与抽样· 15 分钟阅读

1. 数据类型分类★☆☆☆☆⏱ 5 min

📘 定义

数据分类

数据按其性质分类,分类结果决定了可以对其应用哪些类型的统计分析。

例:

你无法对眼睛颜色这类分类数据计算平均值。

数据首要分为定性(分类)数据(非数值属性)和定量数据(数值测量或计数)。定量数据又进一步分为离散变量和连续变量。

📘 定义

离散变量与连续变量

离散变量只能取不同的独立值(几乎都是计数)。连续变量可以在区间内取任意值,是测量得到的结果。

例:

拥有的汽车数量是离散变量;汽车的重量是连续变量。

📐 例题

将每个变量分类为定性、离散定量或连续定量:(a) 学生汽车的颜色,(b) 学生通勤上学的距离,(c) 学生拥有的汽车数量。

  1. 1

    (a):汽车颜色是非数值属性,因此属于定性数据。

  2. 2

    (b):通勤距离是可以在两个数之间取任意值的测量结果,因此属于连续定量数据。

  3. 3

    (c):汽车数量只能是整数(独立值),因此属于离散定量数据。

Exam tip:

即使变量被四舍五入为整数,如果它本质上是测量得到的,它仍然是连续变量(例如按整年计的年龄仍然是连续变量)。

2. 常见抽样方法★★☆☆☆⏱ 6 min

收集数据时,你可以进行普查(收集总体中每个成员的数据)或抽取样本(从子集收集数据)。IB AA HL要求你掌握四种核心抽样方法:

  • 简单随机抽样:所有相同规模的样本被选中的概率相等,通常用随机数生成。

  • 系统抽样:从有序列表中,从随机起始位置开始,每个成员选取一个。

  • 分层抽样:将总体划分为相关子组(层),然后按层的规模比例从每个层中抽取随机样本。

  • 方便抽样:选择最容易接触到的个体,不进行随机化。

📐 例题

一所大学有12000名本科生:4500名大一,3500名大二,2500名大三,1500名大四。研究人员想要按年级抽取240名学生的分层样本,应该抽取多少名大四学生?

  1. 1

    计算大四学生占总体的比例:

  2. 2
    Proportion=150012000=0.125\text{Proportion} = \frac{1500}{12000} = 0.125
  3. 3

    将比例乘以总样本规模,得到应抽取的大四学生数量:

  4. 4
    0.125×240=300.125 \times 240 = 30
  5. 5

    研究人员应该抽取30名大四学生。

Exam tip:

对于分层抽样,除非另有明确说明,否则始终按层的规模比例抽样,而非平均抽样。

3. 抽样偏差与抽样误差★★☆☆☆⏱ 4 min

有效的样本必须代表目标总体。抽样偏差是一种系统性误差:总体中部分成员被选中的概率高于或低于其他成员,导致结果偏斜。

📘 定义

抽样误差

样本统计量与真实总体参数之间的自然随机差异,由抽样选择的随机变异导致。抽样误差随样本规模增大而减小。

例:

100名学生的随机样本得到的平均身高抽样误差小于10名学生的随机样本。

📐 例题

研究人员想要估计IB学生每周午餐的平均花费。他们站在学校昂贵的自助餐厅外,询问前15名离开的学生。最可能出现什么偏差,它会对结果产生什么影响?

  1. 1

    在昂贵自助餐厅就餐的学生,午餐花费比普通学生更高。

  2. 2

    这是选择偏差,样本系统性地过度代表了午餐花费更高的学生。

  3. 3

    研究人员的结果会高估该校所有IB学生的真实平均午餐花费。

4. 常见陷阱

错误做法:

因为年龄通常按整年报告,就将其分类为离散变量。

原因:

年龄是可以取任意值的连续测量结果,例如17.5岁。

正确做法:

除非特定研究明确将其按整年计数,否则将年龄分类为连续变量。

错误做法:

将随机抽样误差与抽样偏差混淆。

原因:

随机误差是随样本规模增大而减小的自然变异,而偏差是不会随样本增大而消失的系统性误差。

正确做法:

只有对群体的系统性过度/不足代表才是偏差,随机变异不是偏差。

错误做法:

分层抽样中,无论层的规模多大,都从每个层抽取相同规模的样本。

原因:

这会导致小层被过度代表,大层被不足代表,引入不必要的偏差。

正确做法:

始终按各层在总体中的规模比例抽样。

错误做法:

假设普查不存在任何误差。

原因:

普查仍然可能存在来自无回应、测量错误或数据缺失的非抽样误差。

正确做法:

要知道即使测量了整个总体,仍然可能存在误差。

错误做法:

将分层抽样与简单随机抽样混淆。

原因:

分层抽样先将总体划分为组再抽样,而简单随机抽样直接从整个总体抽样。

正确做法:

记住:分层=先划分为层,再从每个组抽样。

5. 速查表

类别

类型

核心特征/偏差风险

数据类型

定性(分类)

非数值属性,例如眼睛颜色

数据类型

离散定量

不同数值(计数),例如学生人数

数据类型

连续定量

区间内可取任意值(测量),例如身高

抽样

简单随机

所有样本概率相等,偏差风险低

抽样

系统

个成员选取一个,偏差风险低

抽样

分层

按比例从各层抽样,偏差风险最低

抽样

方便

仅选容易接触的成员,偏差风险极高

6. 常见问题

普查一定比样本好吗?

不是。普查耗时、成本高,而且通常无法完成(例如破坏性测试)。选择得当的随机样本可以用低得多的成本和工作量得到准确结果。

连续数据可以被当作离散数据处理吗?

可以,当测量精度有限时可以。例如,四舍五入到最近厘米的身高在分析中会被当作离散数据,但它本质上仍然是连续变量。

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2025 · 2

    识别所用抽样方法的类型

  • 2024 · 1

    按数据类型对给定变量分类

  • 2023 · 2

    评论研究中偏差的来源

下一步

数据类型与抽样是IB AA HL所有统计工作的基础。正确的数据分类决定了你可以进行哪些分析,合适的抽样确保你的结论有效且可推广。收集并分类数据后,下一步就是用描述统计汇总数据,然后可视化数据来识别模式和关系。这些基础技能是课程后续所有推断统计主题(包括假设检验和回归)都需要的。