学习指南

数据的表示与总结(Edexcel IAL 数学 S1)

数学· 2018 Specification Issue 3, S1 §2.1–§2.4· 25 分钟阅读

1. 解读数据可视化图表以对比分布★★☆☆☆⏱ 5 min

✓ 计算器

考试题目几乎都会提供预先绘制好的图表,因此你的重点是提取关键统计量,结合题目背景对比两个或多个分布。常见图表包括直方图、茎叶图(包括背靠背形式)和箱线图。

📘 定义

箱线图

展示数据集的最小值、下四分位数(Q₁)、中位数(Q₂)、上四分位数(Q₃)和最大值的图表,可清晰呈现数据的离散程度和集中趋势。

📐 例题

下方箱线图展示了学习生物和化学的12年级学生的测试分数(满分100分)。对比两个科目分数的分布特征。

  1. 1

    对比集中趋势:生物科中位数=68,化学科中位数=56,因此生物科的典型分数高出12分。

  2. 2

    对比离散程度:生物科四分位距=72 - 58 = 14,化学科四分位距=62 - 43 = 19,因此生物科分数的差异更小。

  3. 3

    对比极差:生物科全距=88 - 32 = 56,化学科全距=92 - 22 = 70,因此化学科分数的整体分布范围更广。

  4. 4

    结合背景得出结论:总体而言,本次测试中学生的生物成绩更好,且分数比化学科更稳定。

Exam tip:

对比分布时务必结合题目背景,不能只给出数值,才能拿到全部分数。

2. 位置度量与数据编码★★★☆☆⏱ 7 min

✓ 计算器

位置度量描述数据集的中心值或典型值。你需要针对未分组和分组的离散/连续数据计算这些统计量,并使用编码简化复杂计算。

📘 定义

编码

y=xaby = \frac{x - a}{b}

对原始数据进行的线性变换,其中是选定的常数,用于缩小待处理数值的大小。原始均值可通过公式还原。

📐 例题

30名学生的身高( 单位cm)使用进行编码,编码后数据的均值为,计算学生的平均身高。

  1. 1

    变形编码公式,用表示

  2. 2
    x=10y+150x = 10y + 150
  3. 3

    对编码后数据的均值应用线性变换:

  4. 4
    xˉ=10yˉ+150=10(2.4)+150=24+150=174\bar{x} = 10\bar{y} + 150 = 10(2.4) + 150 = 24 + 150 = 174
  5. 5

    学生的平均身高为174 cm。

3. 离散程度度量★★★★☆⏱ 8 min

✓ 计算器

离散程度度量描述数据集中数值的分布范围。你需要计算极差、百分位距、方差和标准差,并对分组数据使用简单插值法计算落在组界之间的百分位数。

📘 定义

样本标准差

样本方差的平方根,衡量数值相对于均值的平均偏差,单位与原始数据一致。对于编码后的数据

📐 例题

沿用之前的身高编码数据,已知的标准差为0.82,计算原始身高数据的标准差,单位为cm。

  1. 1

    注意编码只会将标准差乘以除数的绝对值:加减常数不会影响离散程度。

  2. 2
    sx=b×sys_x = b \times s_y
  3. 3

    代入给定数值(, ):

  4. 4
    sx=10×0.82=8.2s_x = 10 \times 0.82 = 8.2
  5. 5

    原始身高数据的标准差为8.2 cm。

Exam tip:

计算分组数据的百分位距时,务必使用组界(而非组限)进行插值,避免出错。

4. 偏度与异常值★★★☆☆⏱ 5 min

✓ 计算器

偏度描述分布的不对称性。你需要根据图表或汇总统计量解读偏度,并应用题目中明确给出的异常值规则(不需要记忆默认规则)。

📘 定义

正(右)偏

分布右侧有长尾,满足均值 > 中位数 > 众数。负(左)偏分布左侧有长尾,满足众数 > 中位数 > 均值。

📐 例题

月度薪资数据的分布均值为3200英镑,中位数为2800英镑,众数为2200英镑。指出该分布的偏度类型并给出理由。

  1. 1

    对比众数、中位数和均值的数值:

  2. 2
    2200<2800<3200    众数<中位数<均值2200 < 2800 < 3200 \implies \text{众数} < \text{中位数} < \text{均值}
  3. 3

    该度量值的对应顺序属于正(右)偏,原因是少数极高薪资将均值拉高至中位数以上。

5. 常见陷阱

错误做法:

仅使用中位数对比分布,未提及离散程度或题目背景

原因:

考题要求2-3个对比点才能拿满分,包括集中趋势、离散程度和结合背景的解读

正确做法:

对比分布时务必同时比较中位数、四分位距/极差,再补充一句结合背景的结论

错误做法:

计算原始均值或标准差时忘记还原编码

原因:

编码后数值经过变换,不能直接将编码后的统计量作为原始数据题目的最终答案

正确做法:

使用计算均值,使用计算标准差,还原原始数值

错误做法:

对分组数据的百分位数插值时使用组限而非组界

原因:

组限是一个组可包含的最小和最大数值,而组界是相邻两组的分界点,使用组限会导致插值结果错误

正确做法:

进行百分位数插值前,务必先将分组数据的组转换为连续组界

错误做法:

未给出规则时自行使用默认异常值判定规则(例如1.5×IQR)

原因:

Edexcel IAL S1考试明确说明所有异常值规则都会在题目中给出,使用未声明的规则会得出错误答案并失分

正确做法:

仅严格按照题目正文中给出的异常值规则进行判定

错误做法:

混淆正偏和负偏,搞反均值、中位数和众数的顺序

原因:

偏度是按长尾的方向命名,而非峰值的位置,很容易记混

正确做法:

记住正偏的长尾在右侧(数值更大的一侧),因此均值被拉高到中位数之上;负偏的长尾在左侧(数值更小的一侧),因此均值被拉低到中位数之下

6. 速查表

概念

公式/规则

考试注意事项

均值(未分组数据)

分组数据使用组中值作为的取值

编码变换(

,

加减常数不会对标准差产生任何影响

四分位距

衡量数据中间50%部分的离散程度,不受异常值影响

标准差

单位与原始数据一致,方差的单位是原始数据单位的平方

偏度解读

众数 < 中位数 < 均值 = 正偏;众数 > 中位数 > 均值 = 负偏

偏度按长尾的方向命名

异常值

仅应用题目中给出的规则

除非明确说明,否则不要使用1.5×IQR规则

7. 常见问题

S1考试中我需要背诵异常值判定规则吗?

不需要:所有Edexcel IAL S1考试的异常值判定规则都会在题目正文中明确给出,你不需要记忆诸如1.5×IQR这类默认规则。

考试中会要求我绘制直方图或箱线图吗?

直接绘制图表不是考察重点;大多数题目要求你解读或对比给定的图表,或是计算用于构建图表的统计量。

深入阅读

下一步

掌握Edexcel IAL S1数据表示与总结的内容后,你就可以进入下一个核心主题——概率的学习。你学到的分布形状和离散程度相关概念,将直接为后续学习概率分布、相关与回归内容打下基础。请练习该主题的历年真题,提升解题速度和准确率,重点关注要求你进行对比、解读或计算数值的指令词,最大化你的得分。