学习指南

数据分类与解读

数学· 教学大纲章节 9.1, 9.2· 12 分钟阅读

1. 数据的分类类型★☆☆☆☆⏱ 2 min

📘 定义

数据分类

将原始观测值按照共同特征划分为不同组别以简化分析的过程

例:

将关于最喜爱学科的调查回复归类为定性数据,将每周学习时长归类为定量数据。

数据首先被划分为两大核心类别:定性数据(非数值型、描述性的值,例如眼睛颜色或最喜爱的电影)和定量数据(可排序、相加或比较的数值型值,例如年龄或考试分数)。定量数据可进一步划分为离散数据(计数得到的整数值,例如宠物数量)和连续数据(可带小数的测量值,例如身高),不过核心考试仅要求你区分定性数据和定量数据。

📐 例题

将以下各项分类为定性或定量数据:a) 鞋码,b) 最喜爱的食物,c) 跑完100米所用的时间,d) 停车场的汽车数量。

  1. 1

    步骤1:判断数据是否为数值型。如果不是,就属于定性数据。

  2. 2

    步骤2:对于(b)最喜爱的食物:非数值型 = 定性数据。

  3. 3

    步骤3:其余所有选项都是数值型,因此属于定量数据。

  4. 4

    最终答案:a) 定量数据,b) 定性数据,c) 定量数据,d) 定量数据

Exam tip:

数据分类题几乎都是1分的简答题,牢记定性数据和定量数据的区别就能轻松拿到这部分分数。

2. 构建与解读计数表★★☆☆☆⏱ 3 min

📘 定义

计数表

使用计数标记记录每个观测值频数的表格,每第五个标记横向划过之前的四个标记,方便计数。

例:

记录步行、骑车、乘公交或自驾上学的学生人数的计数表。

要制作计数表,首先在第一列列出数据的所有唯一类别。逐个处理原始观测值,在对应类别行中每出现一次就添加一个竖的计数标记。每第五个标记横向划过前四个,组成5个一组,这样计数更快。最终的频数列是每个类别对应的计数标记总数。

📐 例题

20名学生最喜爱的水果原始数据:苹果、香蕉、苹果、橙子、香蕉、香蕉、苹果、橙子、葡萄、苹果、香蕉、葡萄、橙子、苹果、香蕉、苹果、橙子、葡萄、香蕉、苹果。为该数据构建计数表。

  1. 1

    步骤1:在第一列列出所有唯一的水果类别:苹果、香蕉、橙子、葡萄。

  2. 2

    步骤2:为原始数据中每种水果的每一次出现添加一个计数标记,将计数标记按5个为一组划分。

  3. 3

    步骤3:统计计数标记得到每个类别的频数:

  4. 4
    Apple:7,Banana:6,Orange:4,Grape:3Apple: 7, Banana: 6, Orange: 4, Grape: 3
  5. 5

    步骤4:验证总频数等于20以排查计数错误:7+6+4+3=20,与样本量一致。

3. 使用双向表★★★☆☆⏱ 3 min

📘 定义

双向表

展示两个分类变量频数的表格,其中一个变量在行中,另一个在列中,同时包含行总计和列总计。

例:

展示性别与最喜爱学科对应关系的双向表,包含每个性别和每个学科的总人数。

双向表用于展示两组之间的关系。大多数核心考试题会给出一个不完整的双向表,要求你填写缺失值。你可以利用给出的行总计和列总计:用行或列的总计减去该行或该列的已知值,就能得到缺失单元格的值。

📐 例题

以下不完整的双向表展示了按性别划分的数学考试通过/未通过的学生人数,请填写缺失值。

通过未通过总计
男生22?32
女生?5?
总计45?60
  1. 1

    步骤1:计算未通过的男生人数:男生总人数减去通过的男生人数 = 32 - 22 = 10。

  2. 2

    步骤2:计算未通过的总人数:学生总人数减去通过的总人数 = 60 - 45 = 15。

  3. 3

    步骤3:计算女生总人数:学生总人数减去男生总人数 = 60 - 32 = 28。

  4. 4

    步骤4:计算通过的女生人数:女生总人数减去未通过的女生人数 = 28 - 5 = 23。

  5. 5

    步骤5:验证总计匹配:总通过人数=22+23=45,总未通过人数=10+5=15,总学生数=32+28=60,所有数值均正确。

Exam tip:

双向表题目通常占3-4分,即便你犯了一个错误,每个正确的缺失值也能得分。写出你的加减计算过程就能拿到步骤分。

4. 解读数据与识别局限性★★☆☆☆⏱ 2 min

从数据中得出结论时,你只能提出表格中数字直接支持的观点。如果你的样本不具有代表性,就不能将结果泛化到更广泛的群体,也绝不能仅因为两个变量相关(存在关联)就假设其中一个变量会导致另一个变量发生。

📐 例题

针对50名11年级学生的调查发现,70%学习乐器的学生成绩高于C等级。一名学生得出结论:'学习乐器能让你取得更好的成绩。'解释为什么这个结论是无效的。

  1. 1

    步骤1:识别数据的局限性:该调查仅显示学习乐器和成绩优异之间存在相关性,而非因果关系。

  2. 2

    步骤2:识别可能的混淆变量:学习乐器的学生可能有更多时间学习,或者家庭环境更具支持性,这些才是成绩更好的真正原因。

  3. 3

    步骤3:指出样本局限性:该调查仅包含11年级学生,因此结果不能泛化到所有年级。

  4. 4

    最终答案:该结论假设存在因果关系,但数据仅显示相关性,且样本仅限于11年级学生,因此无法泛化。

5. 常见陷阱

错误做法:

将鞋码这类数值型数据归类为定性数据,因为它指代一个'尺码'标签。

原因:

鞋码是可以排序和计数的数值型值,因此属于定量数据,即便它指代鞋类尺码的类别。

正确做法:

只有非数值型的数据才能归类为定性数据,例如最喜爱的鞋品牌是定性数据,但鞋码属于定量数据。

错误做法:

将4个竖标记加一个横划的组合计为4个观测值。

原因:

划过4个计数标记的横划代表5个观测值,而非4个,将其计为4会导致总频数计算错误。

正确做法:

将计数标记按5个为一组划分,第五个标记横划前四个,因此每个带横划的组在计算频数时计为5。

错误做法:

忘记检查双向表中的行总计和列总计相加是否等于总合计值。

原因:

这会导致填写缺失值时的算术错误无法被发现,因单元格填写错误而失分。

正确做法:

填写完双向表的所有值后,将所有行总计相加、所有列总计相加,确认二者都等于题目给出的总样本量。

错误做法:

得出泛化到比样本代表范围更大的群体的结论,例如仅调查男子足球队就得出所有学生都喜欢足球的结论。

原因:

该样本存在偏差,不能代表更广泛的群体,因此结论无效。

正确做法:

仅得出适用于实际采样群体的结论,如果要求你评价局限性,要明确说明样本不具有代表性。

错误做法:

假设两个变量之间的相关性意味着其中一个导致另一个发生,例如因为冰淇淋销量和溺水死亡数都在夏季上升,就得出冰淇淋销量导致溺水死亡的结论。

原因:

相关性不等于因果关系;第三个混淆变量(例如炎热天气)可能同时导致两个变量上升。

正确做法:

仅说明两个变量之间存在关联,除非题目给出明确的因果机制证据,否则永远不要声称一个变量导致另一个变量发生。

6. 速查表

概念

核心规则

考试快速核查点

数据分类

定性=非数值,定量=数值

自问:我可以对这些值做加法或排序吗?如果可以=定量数据

计数表

一个带横划的计数标记组=5个观测值

总频数=题目给出的观测值总数

双向表

行总计之和 + 列总计之和 = 总合计值

用总计减去已知值得到缺失单元格的值

结论

不假设因果,不过度泛化

检查样本是否具有代表性,结论是否得到数据的直接支持

7. 常见问题

填写双向表时需要写出计算过程吗?

需要,你应当展示填写缺失值用到的所有计算步骤,即便最终表格存在小错误,通常也能获得步骤分。

什么样的结论属于从数据中得出的无效结论?

超出样本组范围进行泛化,或仅显示相关性就假设存在因果关系的结论是无效的。例如,仅因为你班上60%的学生喜欢数学就得出所有学生都喜欢数学的结论,如果你的样本不能代表整个学校,那这个结论就是无效的。

深入阅读

下一步

现在你已经掌握了分类和解读表格数据的方法,可以继续学习使用图表可视化展示数据的内容,这是CIE IGCSE数学0580统计单元的下一个核心主题。你在这里学到的技能将成为所有后续统计学习的基础,因为在构建或分析任何其他类型的数据表示之前,你都需要先对数据进行分类并解读表格。你在解决概率相关问题时也会用到这些技能,因为双向表经常被用于计算联合事件的概率。请务必定期练习完成和解读计数表与双向表,这些都是核心试卷中很容易拿到的分数点,也经常在较长的考题中与其他统计知识点结合出现。