# 描述统计：集中趋势与离散程度度量

> IB 数学：应用与解释 HL · IB AI HL
> 来源: https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-descriptive-statistics-measures-of-center/

本子主题将教你如何使用集中趋势（中心）和离散程度（离散）度量汇总数值数据。你将学习计算关键度量，并针对不同数据类型和分布选择合适的度量。

**先修:** [数据整理与表示](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-organizing-representing-data/)

## 学习目标

- 计算并区分作为集中趋势度量的均值、中位数和众数
- 计算并解释作为离散程度度量的极差、四分位距、方差和标准差
- 针对不同数据类型和分布选择合适的集中趋势与离散程度度量
- 明确线性变换对集中趋势和离散程度度量的影响
- 绘制并解读直方图和累积频数图，用以估计中位数、四分位数和百分位数

## 集中趋势（中心）度量

**集中趋势度量** — 描述一组数值数据中心位置的单个统计量，也称为集中趋势度量

*例:* 班级学生的平均身高就是一个集中趋势度量

描述统计中常用三种集中趋势度量，每种适用于不同场景：

- **均值**：所有数据值的算术平均值，计算方式为所有值的总和除以值的数量。
- **中位数**：有序数据集中的中间值，一半数据在它上方，一半在它下方。
- **众数**：数据集中出现频率最高的值，既可用于分类数据也可用于数值数据。

**例题:** 一家小咖啡馆记录了6小时内每小时的顾客数：[12, 8, 15, 10, 8, 14]。计算均值、中位数和众数。

1. 步骤1：计算均值，将所有值相加后除以观测值数量：
2. $$\frac{12 + 8 + 15 + 10 + 8 + 14}{6} = \frac{67}{6} \approx 11.17$$
3. 步骤2：将数据集从小到大排序：
4. $$[8, 8, 10, 12, 14, 15]$$
5. 步骤3：当观测值数量为偶数时，中位数是两个中间值的平均值：
6. $$\text{Median} = \frac{10 + 12}{2} = 11$$
7. 步骤4：众数是出现频率最高的值：
8. 众数 = 8名顾客

## 离散程度（离散）度量

**离散程度度量** — 描述数据点之间以及数据点与分布中心之间距离的统计量

*例:* 考试分数的标准差可以告诉你分数在平均值周围的波动程度

常用的离散程度度量可以量化数据集的变异程度：

- **极差**：最大值与最小值的差，计算简单但对异常值非常敏感。
- **四分位距（IQR）**：第三四分位数（Q3，即第75百分位数）与第一四分位数（Q1，即第25百分位数）的差，对异常值不敏感。
- **方差**：各数据与均值离差平方的平均值。
- **标准差**：方差的平方根，单位与原始数据相同。

**例题:** 对于有序顾客数据集[8, 8, 10, 12, 14, 15]，计算四分位距和样本标准差。

1. 步骤1：找到四分位数：Q1是下半部分的中位数，Q3是上半部分的中位数：
2. $$Q1 = \frac{8 + 8}{2} = 8, \quad Q3 = \frac{14 + 15}{2} = 14.5$$
3. 步骤2：计算IQR = Q3 - Q1：
4. $$IQR = 14.5 - 8 = 6.5$$
5. 步骤3：使用样本标准差公式，样本均值$\bar{x} \approx 11.17$：
6. $$s = \sqrt{\frac{\sum (x_i - \bar{x})^2}{n-1}}$$
7. 步骤4：计算离差平方和，除以$n-1=5$，再取平方根：
8. $$s \approx 2.99$$

> **考试提示:** 务必检查题目要求的是总体标准差还是样本标准差——如果GDC输出错误会被扣分。

## 选择合适的度量

选择哪种度量完全取决于分布的形状以及是否存在异常值。

> **tip**
>
> 通用经验法则：对于没有异常值的对称分布，使用均值+标准差。对于偏斜分布或存在异常值的数据，使用中位数+四分位距。

**例题:** 一家公司有5名员工，年薪（单位：千美元）为：[45, 48, 52, 55, 250]。哪种集中趋势度量最适合描述员工的典型薪资？

1. 步骤1：识别出250是极端异常值，说明分布严重右偏。
2. 步骤2：计算均值和中位数进行比较：
3. $$\text{Mean} = 90, \quad \text{Median} = 52$$
4. 步骤3：均值被异常值拉高到90000美元，高于5份薪资中的4份。中位数为52000美元，更接近典型薪资，因此它是合适的度量。

## 线性变换的影响

当你对所有数据点应用形如$y = kx + c$的线性变换时（例如将单位从厘米转换为英寸），集中趋势和离散程度度量会以可预测的方式变化：

1. 给所有值加上常数$c$：所有集中趋势度量都增加$c$，**不会**改变任何离散程度度量。
2. 给所有值乘以正常数$k$：所有集中趋势度量都乘以$k$，所有离散程度度量都乘以$k$，方差乘以$k^2$。

**例题:** 一个长度数据集的均值为25厘米，标准差为3厘米。转换为英寸（1英寸 = 2.54厘米）后，求新的均值和标准差。

1. 步骤1：变换公式为$x_{\text{英寸}} = \frac{x_{\text{厘米}}}{2.54}$，因此$k = \frac{1}{2.54} \approx 0.3937$。
2. 步骤2：新均值等于原均值乘以$k$：
3. $$\text{New Mean} = 25 \times 0.3937 \approx 9.84 \text{ 英寸}$$
4. 步骤3：新标准差等于原标准差乘以$k$：
5. $$\text{New SD} = 3 \times 0.3937 \approx 1.18 \text{ 英寸}$$

## 直方图与累积频数图

对于较大的数据集，原始数据列表会被频数分布取代。有两种标准图形用于汇总分组数据：**直方图**用于揭示分布的形状，**累积频数图**则用于读取中位数、四分位数和百分位数。

**直方图** — 用于连续（分组）数据的图形，用相邻的柱表示各组区间。等宽分组时柱高为频数；不等宽分组时柱高为频数密度（频数除以组距）。

*例:* 以组距20绘制的80名学生考试分数直方图，显示分布大致对称且为单峰。

**累积频数图** — 将累积频数（频数的累加值）对各组上界作图并连成平滑曲线，得到S形的肩形图（ogive）。

*例:* 若有5名学生分数不超过20，另有15名不超过40，则分数为40处的累积频数为20。

在含有$n$个数据值的累积频数图上，在以下累积频数处读取对应的$x$值来估计各位置度量：

- **中位数**：在累积频数$\frac{n}{2}$处横向读取。
- **下四分位数Q1**：在$\frac{n}{4}$处读取。
- **上四分位数Q3**：在$\frac{3n}{4}$处读取。
- **第$k$百分位数**：在$\frac{k}{100} \times n$处读取。
- 然后 **IQR** $= Q3 - Q1$。

| 分数区间 | 频数 | 上界 | 累积频数 |
| --- | --- | --- | --- |
| $0 < x \le 20$ | 5 | 20 | 5 |
| $20 < x \le 40$ | 15 | 40 | 20 |
| $40 < x \le 60$ | 30 | 60 | 50 |
| $60 < x \le 80$ | 20 | 80 | 70 |
| $80 < x \le 100$ | 10 | 100 | 80 |

**例题:** 利用上面80名学生考试分数的累积频数表，估计中位数、四分位数和四分位距。

1. 步骤1：$n = 80$，中位数在累积频数$\frac{n}{2} = 40$处。它落在$40 < x \le 60$这一组内，介于累积频数20（在40处）和50（在60处）之间。用内插法：
2. $$\text{Median} \approx 40 + \frac{40 - 20}{50 - 20} \times 20 \approx 53.3$$
3. 步骤2：Q1在$\frac{n}{4} = 20$处。累积频数20恰好出现在分数40处，因此$Q1 \approx 40$。
4. 步骤3：Q3在$\frac{3n}{4} = 60$处，落在$60 < x \le 80$这一组内，介于累积频数50（在60处）和70（在80处）之间。用内插法：
5. $$Q3 \approx 60 + \frac{60 - 50}{70 - 50} \times 20 = 70$$
6. 步骤4：计算四分位距：
7. $$IQR = Q3 - Q1 = 70 - 40 = 30$$

> **tip**
>
> 直方图能一眼看出分布形状（对称、偏斜、峰数），而累积频数图是读取中位数、四分位数和百分位数的工具。考试常把两者结合：先从直方图描述形状，再从肩形图提取四分位数。

> **考试提示:** 在累积频数图上，中位数在累积频数$\frac{n}{2}$处读取，Q1在$\frac{n}{4}$处，Q3在$\frac{3n}{4}$处——对AI的分组数据用$n$本身，而不是$n+1$。

## 常见错误

- **错误做法:** 在GDC输出中混淆总体标准差和样本标准差
  - 原因: 大多数图形计算器会用不同符号输出两个值，考试要求根据上下文给出正确值
  - 正确做法: 检查题目：如果处理的是样本（AI HL中大多数情况都是），使用$s$；如果处理的是完整总体，使用$\sigma$
- **错误做法:** 对存在异常值的严重偏斜数据使用均值和标准差
  - 原因: 异常值会将均值拉离数据的真实中心，导致对典型值的描述产生误导
  - 正确做法: 先检查偏度和异常值：如果存在，改用中位数和四分位距
- **错误做法:** 从未排序的数据集中计算中位数
  - 原因: 中位数被定义为排序数据的中间值，因此取未排序数据的中间值几乎总是错误的
  - 正确做法: 计算中位数或四分位数前，务必将数据集从小到大排序
- **错误做法:** 混淆极差和四分位距
  - 原因: 许多学生错误地将IQR计算为最大值减最小值，这其实是极差
  - 正确做法: IQR是Q3减Q1，它衡量的是数据中间50%的离散程度
- **错误做法:** 认为给所有数据加上常数会改变离散程度
  - 原因: 学生通常认为加上常数会同时改变集中趋势和离散程度
  - 正确做法: 加上常数会平等移动所有点，因此点之间的距离（离散程度）保持不变

## 速查表

| 度量类型 | 名称 | 最佳适用场景 | 变换 $x \to kx + c$ |
| --- | --- | --- | --- |
| 中心 | 均值 | 对称数据，无异常值 | $\to k\mu + c$ |
| 中心 | 中位数 | 偏斜数据，存在异常值 | $\to kM + c$ |
| 中心 | 众数 | 分类数据/双峰数据 | $\to km + c$ |
| 离散 | 极差 | 快速粗略估计 | $\to k \times \text{Range}$ |
| 离散 | IQR | 偏斜数据，存在异常值 | $\to k \times IQR$ |
| 离散 | 标准差 | 对称数据，无异常值 | $\to k \times \sigma$ |
| 离散 | 方差 | 统计计算 | $\to k^2 \times \sigma^2$ |

## 下一步

理解集中趋势和离散程度度量是IB AI HL所有后续统计主题的基础。你接下来会用这些概念分析二元数据，在相关性和回归中计算变量的集中趋势和离散程度。之后，你会用这些度量描述概率分布，并用于统计推断，其中抽样分布的集中趋势和离散程度对于构造置信区间和进行假设检验至关重要。

- [相关性与线性回归](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-correlation-and-linear-regression/)
- [概率概念、条件概率、独立事件](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-probability-concepts-conditional-probability-independent/)
- [概率分布：期望与方差](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-probability-distributions-expected-value-and/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-descriptive-statistics-measures-of-center/
