学习指南

集中趋势与离散程度度量

IB 数学:分析与方法 SL· 4.4 描述统计学· 40 分钟阅读

1. 集中趋势度量★★☆☆☆⏱ 15 min

集中趋势度量描述数据集的典型值或中心值。共有三种主要度量,每种适用于不同场景。

📘 定义

均值

(样本), (总体)

所有数据值的和除以数据个数。对于分组数据,我们使用类别区间的组中值计算估计均值。

📘 定义

中位数

有序数据集的中间值。当为偶数时,中位数是两个中间值的平均值。

📘 定义

众数

数据集中出现频率最高的值,可用于分类数据。

📐 例题

求以下未分组数据集的均值、中位数和众数:

  1. 1

    通过求和再除以计算均值:

  2. 2
    Mean=2+3+5+5+7+8+107=4075.71\text{Mean} = \frac{2+3+5+5+7+8+10}{7} = \frac{40}{7} \approx 5.71
  3. 3

    数据已排序,(奇数),因此中位数是第个值:

  4. 4

    中位数 =

  5. 5

    出现频率最高的值是,因此众数为

📐 例题

计算以下分组频数表的估计均值:

  1. 1

    求出每个类别区间的组中值

  2. 2

    计算

  3. 3
    fx=(4×5)+(8×15)+(3×25)=20+120+75=215\sum fx = (4 \times 5) + (8 \times 15) + (3 \times 25) = 20 + 120 + 75 = 215
  4. 4
    f=4+8+3=15\sum f = 4 + 8 + 3 = 15
  5. 5

    计算估计均值:

  6. 6
    xˉ=2151514.33\bar{x} = \frac{215}{15} \approx 14.33

Exam tip:

始终说明分组数据的均值是估计值而非精确值,忘记这一点可能会丢失分数。

2. 离散程度度量★★★☆☆⏱ 20 min

✓ 计算器

离散程度度量描述数据值围绕集中趋势的分散程度。常见度量包括极差、四分位距(IQR)、方差和标准差。

📘 定义

标准差

数据值到均值的平均距离,单位与原始数据相同。方差是标准差的平方。

📐 例题

计算数据集的样本方差和标准差

  1. 1

    首先计算样本均值:

  2. 2
    xˉ=2+4+63=4\bar{x} = \frac{2+4+6}{3} = 4
  3. 3

    计算离均差平方和:

  4. 4
    (xxˉ)2=(24)2+(44)2+(64)2=4+0+4=8\sum (x - \bar{x})^2 = (2-4)^2 + (4-4)^2 + (6-4)^2 = 4 + 0 + 4 = 8
  5. 5

    对于样本方差,除以

  6. 6
    s2=82=4s^2 = \frac{8}{2} = 4
  7. 7

    样本标准差是方差的平方根:

  8. 8
    s=4=2s = \sqrt{4} = 2

3. 选择合适的度量★★★☆☆⏱ 15 min

度量的选择取决于分布的形状和是否存在异常值。均值会受极端值影响,而中位数和四分位距不受影响。

📐 例题

一家小商店的时薪:$12, $12, $15, $16, $18, $22, $75(经理工资)。哪种集中趋势度量最能代表典型工资?证明你的结论。

  1. 1

    计算三种度量:均值 ≈ $24.29,中位数 = $16,众数 = $12

  2. 2

    识别出$75是异常值,远高于其他所有工资。

  3. 3

    异常值使均值偏斜,将其拉到远高于大多数员工工资的位置。众数过低,不具代表性。

  4. 4

    结论:中位数是最佳度量,因为它不受极端异常值影响,能反映典型工资。

  • 对称、无异常值的数据使用均值/标准差

  • 偏态数据或含异常值的数据使用中位数/四分位距

  • 仅分类数据或含重复值的离散数据使用众数

Exam tip:

如果题目要求你证明选择的合理性,你必须明确提及异常值或偏度才能得满分。

4. 五数概括法★★☆☆☆⏱ 10 min

五数概括法结合了最小值、第一四分位数()、中位数、第三四分位数()和最大值,用于构建箱线图和识别异常值。

📘 定义

四分位距 (IQR)

中间50%数据的分布范围,计算公式为

📐 例题

求以下测试分数的五数概括:

  1. 1

    最小值 = 45,最大值 = 90,为偶数。

  2. 2

    中位数 = 第5和第6项的平均值:

  3. 3

    = 下半部分(前5项)的中位数:第3项 = 60

  4. 4

    = 上半部分(后5项)的中位数:上半部分的第3项 = 80

  5. 5

    五数概括:

5. 常见陷阱

错误做法:

报告分组数据的精确均值

原因:

分组数据不保留单个原始值,组中值只是近似

正确做法:

明确说明你的答案是分组数据的估计均值

错误做法:

混淆GDC输出中的样本标准差和总体标准差

原因:

IB考官仅会给题目要求的值满分

正确做法:

仔细读题:样本使用,总体使用

错误做法:

对含异常值的偏态数据使用均值

原因:

异常值会将均值拉离中心,使其不具代表性

正确做法:

偏态数据使用中位数作为集中趋势度量

错误做法:

求中位数或四分位数前忘记排序数据

原因:

未排序数据会得到错误的中位数和四分位数位置

正确做法:

计算任何位置度量前始终将数据从小到大排序

错误做法:

将IQR计算为

原因:

IQR是上下四分位数的完整差值,而非差值的一半

正确做法:

直接计算IQR为

6. 速查表

度量

类型

要点

(未分组)均值

集中趋势

,受异常值影响

(分组)估计均值

集中趋势

,使用组中值,仅为估计值

中位数

集中趋势

有序数据的中间值,不受异常值影响

众数

集中趋势

出现频率最高的值,适用于分类/离散数据

极差

离散程度

,受异常值影响

IQR

离散程度

,中间50%数据的分布,对异常值稳健

样本方差

离散程度

,适用于样本数据

总体方差

离散程度

,适用于完整总体

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2022 · 1

    分组数据的估计均值

  • 2023 · 2

    四分位距与异常值识别

  • 2021 · 1

    证明合适集中趋势度量的合理性

下一步

集中趋势与离散程度度量是IB AA SL所有统计分析的基础。这些概念经常出现在试卷1和试卷2中,通常与数据表示、箱线图或累积频数题目结合考查。你将在后续主题中使用这些技能比较分布、分析双变量关系和描述概率分布。掌握这些计算和解释对统计题拿高分至关重要。