# 集中趋势度量

> IB 数学 AI SL · 统计与概率
> 来源: https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-measures-of-central-tendency/

本模块介绍三种核心集中趋势度量：平均数、中位数和众数。你将学习如何对原始数据和分组数据分别计算它们，并针对不同数据情境选择最合适的度量。

**先修:** [数据类型（分类、离散、连续）](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-types-of-data/)

## 学习目标

- 计算原始离散和连续数据的平均数、中位数和众数
- 估计分组连续数据的平均数
- 针对不同数据类型和分布选择合适的集中趋势度量
- 预测数据线性变换后集中趋势的变化

## 平均数：原始数据与分组数据的计算

**算术平均数** — 所有数据值的总和除以值的个数。对于分组数据，它是使用组区间中点计算得到的估计值。

*记法:* \bar{x}

*例:* 对于数据 $[2, 4, 6]$, $\bar{x} = 12/3 = 4$

**例题:** 5名学生一小时内发送的短信数量为 $[12, 15, 8, 10, 15]$。计算平均数。

1. 对数据集中所有值求和：
2. $$12 + 15 + 8 + 10 + 15 = 60$$
3. 将总和除以观测值数量 $n=5$：
4. $$\bar{x} = \frac{60}{5} = 12$$

**例题:** 下表显示了30名学生的身高。估计平均身高。

1. 首先，计算每个组的组中点和 $f \times x$：
2. | 组区间 | 组中点 $(x)$ | 频率 $(f)$ | $f \times x$ |
| --- | --- | --- | --- |
| $140 \leq h < 150$ | 145 | 4 | 580 |
| $150 \leq h < 160$ | 155 | 10 | 1550 |
| $160 \leq h < 170$ | 165 | 11 | 1815 |
| $170 \leq h < 180$ | 175 | 5 | 875 |
3. 对频率和 $f \times x$ 求和：
4. $$\sum f = 30, \quad \sum fx = 4820$$
5. 计算估计平均数：
6. $$\bar{x} = \frac{\sum fx}{\sum f} = \frac{4820}{30} \approx 160.7 \text{ cm}$$

> **考试提示:** 始终记住分组数据得到的平均数只是估计值，不是精确值。

## 中位数与众数：定义与计算

**中位数** — 有序数据集中的中间值。对于 $n$ 个观测值：若 $n$ 为奇数，中位数是第 $\frac{n+1}{2}$ 个值；若 $n$ 为偶数，中位数是第 $\frac{n}{2}$ 个和第 $\frac{n}{2}+1$ 个值的平均值。

**众数** — 数据集中出现频率最高的值。对于分组数据，众数组是频率最高的组区间。

**例题:** 对于有序短信数据 $[8, 10, 12, 15, 15]$，求中位数和众数。

1. 我们得到 $n=5$（奇数），因此中位数是第 $\frac{5+1}{2} = 3$ 个值。第三个值是12，因此中位数 $= 12$。
2. 众数是频率最高的值。15出现两次，因此众数 $= 15$。

**例题:** 向上述集合中添加第6个数据点 $7$。求新的中位数。

1. 重新排序数据：$[7, 8, 10, 12, 15, 15]$, $n=6$ (even).
2. 对第3个和第4个值取平均：$\frac{10 + 12}{2} = 11$. New median $= 11$.

## 选择合适的集中趋势度量

度量的选择取决于数据类型和分布形状。异常值和偏度会影响哪个度量最能代表'典型'值。

- **众数**：仅适用于名义分类数据；也可用于离散数值数据。
- **中位数**：适用于有序数据、偏态数值数据和含异常值的数据，因为它不受极端值影响。
- **平均数**：适用于无异常值的对称数值数据，它使用了所有数据值，但对极端值敏感。

> **tip**
>
> 如果考题要求求'平均值'但未指定，始终要根据上下文选择最合适的度量。

**例题:** 一家企业有4名员工，每周薪资为\$2000 per week，老板每周薪资为\$12000 per week。哪种度量最能描述典型周薪资？证明你的结论。

1. 排序后的薪资：$[2000, 2000, 2000, 2000, 12000]$. Mode = 2000, median = 2000, mean = $\frac{4(2000) + 12000}{5} = 4000$.
2. 老板的薪资是异常值，会让分布右偏。平均数被拉高到\$4000，比5个薪资中的4个都高。
3. 结论：中位数（或众数）是最佳选择，因为它不受异常值影响，能反映典型薪资。

## 数据线性变换的影响

当数据集中所有值都通过加常数或乘常数进行变换时，三种集中趋势度量都会以可预测的方式变化：

- 给每个值加上常数 $c$：平均数、中位数和众数都增加 $c$。
- 给每个值乘上常数 $k$：平均数、中位数和众数都乘 $k$。

**例题:** 一个班级的平均身高为161厘米，单位为厘米。转换为米后新的平均数是多少？

1. 将厘米转换为米需要将每个值乘 $k = 0.01$。
2. 所有集中趋势度量都会按相同常数缩放，因此新平均数 = $161 \times 0.01 = 1.61$ m。

## 常见错误

- **错误做法:** 计算中位数前忘记对数据集排序
  - 原因: 中位数仅被定义为有序集合的中间值；未排序的数据会得到错误结果
  - 正确做法: 找中位数前始终要将数据从小到大排序
- **错误做法:** 将分组数据的估计平均数当作精确值
  - 原因: 我们使用组中点来近似原始数据，而分组数据集无法获得原始数据
  - 正确做法: 始终记住分组数据得到的平均数是估计值，并进行适当舍入
- **错误做法:** 对含异常值的偏态数据使用平均数
  - 原因: 极端值会将平均数拉离中心，导致典型值的度量产生误导
  - 正确做法: 对偏态数据或含极端异常值的数据使用中位数
- **错误做法:** 对所有值都唯一的连续原始数据计算单个众数
  - 原因: 连续数据很少有重复值，因此单个众数对原始连续数据没有意义
  - 正确做法: 对原始连续数据使用中位数或平均数，对分组连续数据使用众数组
- **错误做法:** 认为中位数一定是原始数据集中的某个值
  - 原因: 对于大小为偶数的数据集，中位数是两个中间值的平均值，可能不存在于原始数据中
  - 正确做法: 当 $n$ 为偶数时，即使结果不在原始数据中，也要对两个中间值取平均

## 速查表

| 度量 | 使用场景 | 公式/规则 |
| --- | --- | --- |
| 众数 | 名义分类数据 | 频率最高的值 / 众数组 |
| 中位数 | 有序数据、偏态数据、含异常值的数据 | 有序数据的中间值 |
| 原始数据平均数 | 无异常值的对称数值数据 | $\bar{x} = \frac{\sum x_i}{n}$ |
| 分组数据平均数 | 分组连续数据的估计 | $\bar{x} = \frac{\sum f_i x_i}{\sum f_i}$ |

## 下一步

集中趋势度量是描述统计的基础，它几乎总是与离散程度度量结合使用，以完整描述数据分布的形状和中心。理解何时使用每种度量有助于你在分析真实世界数据时避免常见的解释错误，这是IB AI SL统计考题的核心技能。考试中经常会要求你比较两个或多个数据集的集中趋势度量，因此在这里打下扎实的基础将支持你未来从相关性到假设检验的所有统计学习。

- [离散程度度量：方差、标准差](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-measures-of-spread-variance-standard/)
- [相关性与线性回归](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-correlation-and-linear-regression/)
- [基础概率概念与复合事件](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-basic-probability-concepts-and-combined/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-measures-of-central-tendency/
