# 集中趋势与离散程度度量

> IB 数学：分析与方法 SL · 第4单元：统计学与概率
> 来源: https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-measures-of-central-tendency-and/

本模块讲解如何使用描述中心（集中趋势）和分散（离散程度）的度量汇总数值数据，涵盖未分组和分组的离散、连续数据，包括计算和情境解释。

**先修:** [数据整理与表示](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-organizing-data/)

## 学习目标

- 计算未分组和分组数值数据的平均数、中位数和众数
- 计算常见离散程度度量：极差、四分位距、方差和标准差
- 针对不同数据类型和分布选择并证明合适度量的合理性
- 在实际场景中解释这些度量

## 集中趋势度量

集中趋势度量描述数据集的典型值或中心值。共有三种主要度量，每种适用于不同场景。

**均值** — 所有数据值的和除以数据个数。对于分组数据，我们使用类别区间的组中值计算估计均值。

*记法:* $\bar{x}$ (样本), $\mu$ (总体)

**中位数** — 有序数据集的中间值。当$n$为偶数时，中位数是两个中间值的平均值。

**众数** — 数据集中出现频率最高的值，可用于分类数据。

**例题:** 求以下未分组数据集的均值、中位数和众数：$[2, 3, 5, 5, 7, 8, 10]$

1. 通过求和再除以$n=7$计算均值：
2. $$\text{Mean} = \frac{2+3+5+5+7+8+10}{7} = \frac{40}{7} \approx 5.71$$
3. 数据已排序，$n=7$（奇数），因此中位数是第$\frac{7+1}{2} = 4$个值：
4. 中位数 = $5$
5. 出现频率最高的值是$5$，因此众数为$5$。

**例题:** 计算以下分组频数表的估计均值：$0 < x \leq 10, f=4$；$10 < x \leq 20, f=8$；$20 < x \leq 30, f=3$

1. 求出每个类别区间的组中值$x$：$5, 15, 25$
2. 计算$\sum fx$和$\sum f$：
3. $$\sum fx = (4 \times 5) + (8 \times 15) + (3 \times 25) = 20 + 120 + 75 = 215$$
4. $$\sum f = 4 + 8 + 3 = 15$$
5. 计算估计均值：
6. $$\bar{x} = \frac{215}{15} \approx 14.33$$

> **考试提示:** 始终说明分组数据的均值是估计值而非精确值，忘记这一点可能会丢失分数。

## 离散程度度量

离散程度度量描述数据值围绕集中趋势的分散程度。常见度量包括极差、四分位距（IQR）、方差和标准差。

**标准差** — 数据值到均值的平均距离，单位与原始数据相同。方差是标准差的平方。

> **note**
>
> IB要求你区分样本标准差和总体标准差。在你的GDC（图形计算器）中，$s_x$是样本标准差（除以$n-1$），$\sigma_x$是总体标准差（除以$n$）。

**例题:** 计算数据集$[2, 4, 6]$的样本方差和标准差

1. 首先计算样本均值：
2. $$\bar{x} = \frac{2+4+6}{3} = 4$$
3. 计算离均差平方和：
4. $$\sum (x - \bar{x})^2 = (2-4)^2 + (4-4)^2 + (6-4)^2 = 4 + 0 + 4 = 8$$
5. 对于样本方差，除以$n-1 = 2$：
6. $$s^2 = \frac{8}{2} = 4$$
7. 样本标准差是方差的平方根：
8. $$s = \sqrt{4} = 2$$

*计算器:* allowed

## 选择合适的度量

度量的选择取决于分布的形状和是否存在异常值。均值会受极端值影响，而中位数和四分位距不受影响。

**例题:** 一家小商店的时薪：\$12, \$12, \$15, \$16, \$18, \$22, \$75（经理工资）。哪种集中趋势度量最能代表典型工资？证明你的结论。

1. 计算三种度量：均值 ≈ \$24.29，中位数 = \$16，众数 = \$12
2. 识别出\$75是异常值，远高于其他所有工资。
3. 异常值使均值偏斜，将其拉到远高于大多数员工工资的位置。众数过低，不具代表性。
4. 结论：中位数是最佳度量，因为它不受极端异常值影响，能反映典型工资。

- 对称、无异常值的数据使用均值/标准差
- 偏态数据或含异常值的数据使用中位数/四分位距
- 仅分类数据或含重复值的离散数据使用众数

> **考试提示:** 如果题目要求你证明选择的合理性，你必须明确提及异常值或偏度才能得满分。

## 五数概括法

五数概括法结合了最小值、第一四分位数($Q_1$)、中位数、第三四分位数($Q_3$)和最大值，用于构建箱线图和识别异常值。

**四分位距 (IQR)** — 中间50%数据的分布范围，计算公式为$IQR = Q_3 - Q_1$

**例题:** 求以下测试分数的五数概括：$[45, 52, 60, 65, 68, 72, 75, 80, 85, 90]$

1. 最小值 = 45，最大值 = 90，$n=10$为偶数。
2. 中位数 = 第5和第6项的平均值：$\frac{68 + 72}{2} = 70$
3. $Q_1$ = 下半部分（前5项）的中位数：第3项 = 60
4. $Q_3$ = 上半部分（后5项）的中位数：上半部分的第3项 = 80
5. 五数概括：$[45, 60, 70, 80, 90]$，$IQR = 20$

## 常见错误

- **错误做法:** 报告分组数据的精确均值
  - 原因: 分组数据不保留单个原始值，组中值只是近似
  - 正确做法: 明确说明你的答案是分组数据的估计均值
- **错误做法:** 混淆GDC输出中的样本标准差和总体标准差
  - 原因: IB考官仅会给题目要求的值满分
  - 正确做法: 仔细读题：样本使用$s_x$，总体使用$\sigma_x$
- **错误做法:** 对含异常值的偏态数据使用均值
  - 原因: 异常值会将均值拉离中心，使其不具代表性
  - 正确做法: 偏态数据使用中位数作为集中趋势度量
- **错误做法:** 求中位数或四分位数前忘记排序数据
  - 原因: 未排序数据会得到错误的中位数和四分位数位置
  - 正确做法: 计算任何位置度量前始终将数据从小到大排序
- **错误做法:** 将IQR计算为$\frac{Q_3 - Q_1}{2}$
  - 原因: IQR是上下四分位数的完整差值，而非差值的一半
  - 正确做法: 直接计算IQR为$IQR = Q_3 - Q_1$

## 速查表

| 度量 | 类型 | 要点 |
| --- | --- | --- |
| (未分组)均值 | 集中趋势 | $\frac{\sum x}{n}$，受异常值影响 |
| (分组)估计均值 | 集中趋势 | $\frac{\sum fx}{\sum f}$，使用组中值，仅为估计值 |
| 中位数 | 集中趋势 | 有序数据的中间值，不受异常值影响 |
| 众数 | 集中趋势 | 出现频率最高的值，适用于分类/离散数据 |
| 极差 | 离散程度 | $\text{Max} - \text{Min}$，受异常值影响 |
| IQR | 离散程度 | $Q_3 - Q_1$，中间50%数据的分布，对异常值稳健 |
| 样本方差 | 离散程度 | $\frac{\sum (x-\bar{x})^2}{n-1}$，适用于样本数据 |
| 总体方差 | 离散程度 | $\frac{\sum (x-\mu)^2}{N}$，适用于完整总体 |

## 下一步

集中趋势与离散程度度量是IB AA SL所有统计分析的基础。这些概念经常出现在试卷1和试卷2中，通常与数据表示、箱线图或累积频数题目结合考查。你将在后续主题中使用这些技能比较分布、分析双变量关系和描述概率分布。掌握这些计算和解释对统计题拿高分至关重要。

- [累积分布函数与百分位数](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-cumulative-distributions-and-percentiles/)
- [概率、条件概率与独立事件](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-probability-conditional-probability-and-independent/)
- [离散概率分布、期望与方差](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-discrete-probability-distributions-expectation-and/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-measures-of-central-tendency-and/
