# 单定量变量的描述性统计量

> AP 统计学 · AP 2024-2026 统计学课程考试大纲(CED)
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u10-summary-statistics-for-one-quantitative/

本部分涵盖核心的集中趋势度量、离散程度度量、正式异常值检测方法，以及针对对称分布和偏态分布选择合适描述性统计量的指导，完全符合AP统计学第一单元CED大纲要求。

**先修:** [定量变量与分类变量的基础概念](https://www.owlsprep.com/zh/study/ap-statistics-u10-intro-to-data-types/); [分布的形态（对称、左偏/右偏）](https://www.owlsprep.com/zh/study/ap-statistics-u10-distribution-shapes/)

## 学习目标

- 计算未分组定量数据的集中趋势度量（均值、中位数）
- 计算离散程度度量（极差、四分位距、标准差）并解释其在现实场景中的含义
- 使用标准的1.5×IQR规则识别异常值
- 针对偏态分布和对称分布选择最合适的描述性统计量

## 集中趋势度量：均值与中位数

两个最常用的集中趋势度量用于描述定量数据集的典型取值。均值是算术平均值，计算方式为将所有数值求和后除以观测值总数。中位数是排序后数据集的中间值，不受极端异常值影响。

**耐抗性统计量** — 当向数据集中加入极端异常值时，取值不会发生显著变化的统计量。中位数具有耐抗性，而均值不具备耐抗性。

**例题:** 计算以下7个已排序的AP统计学考试分数的均值和中位数：62, 75, 78, 81, 83, 87, 94

1. 步骤1：将7个分数求和得到总和：62 + 75 + 78 + 81 + 83 + 87 + 94 = 560
2. 步骤2：将总和除以观测值数量n=7：560 / 7 = 80，即样本均值
3. 步骤3：对于n=7（奇数），第4个排序后的值为中间点，即81，也就是中位数

**概念自测**

验证你对集中趋势计算的理解

1. 对于5个数值2,4,6,8,10，其均值是多少？

   - 5
   - 6
   - 7
   - 8

   *解析:* 数值总和为30，除以n=5得到6，该值与这个完全对称数据集的中位数相等。

## 离散程度度量：极差、四分位距、标准差

离散程度度量用于量化单个数据点距离数据集中心的分布远近。极差是最简单的度量方式，计算为最大值减去最小值。四分位距(IQR)描述数据中间50%部分的离散程度，而标准差量化数值相对于均值的典型平方偏离程度。

**四分位距** — 有序数据集的第75百分位数(Q3)与第25百分位数(Q1)的差值，完全不受异常值影响。

*记法:* IQR = Q3 - Q1

**例题:** 对于已排序的考试分数62,75,78,81,83,87,94，计算极差、四分位距和样本标准差

1. 步骤1：极差 = 最大值 - 最小值 = 94 - 62 = 32
2. 步骤2：Q1 = 下半部分数据[62,75,78]的中位数 =75，Q3 = 上半部分数据[83,87,94]的中位数=87，因此IQR=87-75=12
3. 步骤3：与均值80的平方偏差之和为324+25+4+1+9+49+196=608
4. 步骤4：将总和除以n-1=6，开平方得到：s=√(608/6)≈10.07

> **考试提示:** AP考试明确要求你在计算样本标准差时使用n-1（而非n）才能获得全部分数。

## 使用1.5×IQR规则识别异常值

1.5×IQR规则是College Board官方认可的用于标记定量数据集中异常值的正式方法。任何落在计算得到的上下围栏之外的数值都被归类为异常值。

**例题:** 检查上述考试分数数据集是否存在异常值，之后加入一个新分数50并重新检查

1. 步骤1：计算1.5×IQR=1.5×12=18
2. 步骤2：下围栏=Q1-18=75-18=57，上围栏=Q3+18=87+18=105
3. 步骤3：所有原始分数都落在57到105之间，因此原始数据集中不存在异常值
4. 步骤4：新加入的分数50低于下围栏57，因此它被归类为异常值

> **mnemonic**
>
> 1.5是官方异常值乘数：任何距离最近四分位超过1.5倍IQR的点都会被标记为异常值。

## 针对不同分布形态选择描述性统计量

你选择的描述性统计量必须与你所描述的分布形态相匹配。对于没有极端异常值的对称分布，均值和标准差是首选指标。对于偏态分布或存在已知异常值的数据集，中位数和四分位距能够更好地代表典型取值。

**考试命令词**

AP考试的自由问答题经常要求你证明自己选择的描述性统计量是合理的，注意以下常见提示词：

- **Justify your choice** — 你必须明确说明你所选的指标是否具有耐抗性，并解释它为什么符合当前分布的形态

- **Compare the two distributions** — 你必须同时引用两组数据的一个集中趋势度量和一个离散程度度量，才能获得全部比较分数

## 常见错误

- **错误做法:** 使用n而非n-1计算样本标准差
  - 原因: 这样得到的是总体标准差，不是AP考试要求样本数据使用的数值
  - 正确做法: 所有样本标准差计算都要将平方偏差总和除以n-1
- **错误做法:** 在未排序的数据上计算中位数或四分位数
  - 原因: 未排序的数值会得到错误的中间点，无法代表真实的中心位置
  - 正确做法: 在计算中位数、Q1或Q3之前，务必将所有数据点从小到大排序
- **错误做法:** 使用均值和标准差描述严重偏态的数据集
  - 原因: 极端值会拉偏均值并放大标准差，导致它们无法代表典型取值
  - 正确做法: 对于偏态分布，优先报告中位数和四分位距作为描述性统计量
- **错误做法:** 将1.5×IQR加到均值上而非Q1/Q3来计算围栏
  - 原因: 异常值规则使用四分位数而非整体中心来定义非异常值的可接受范围
  - 正确做法: 下围栏计算为Q1减去1.5×IQR，上围栏计算为Q3加上1.5×IQR
- **错误做法:** 将标准差定义为与均值的平均绝对偏差
  - 原因: 标准差使用平方偏差而非绝对偏差，因此该定义在数学上是错误的
  - 正确做法: 将标准差定义为样本均值平均平方偏差的平方根

## 速查表

| 统计量 | 类别 | 耐抗性？ | 最佳适用场景 |
| --- | --- | --- | --- |
| 均值 | 集中趋势 | 否 | 无异常值的对称数据 |
| 中位数 | 集中趋势 | 是 | 偏态数据或存在异常值的数据 |
| 四分位距 | 离散程度 | 是 | 偏态数据或存在异常值的数据 |
| 样本标准差 | 离散程度 | 否 | 无异常值的对称数据 |

## 下一步

熟练掌握这些描述性统计量是后续AP统计学所有推断统计内容（包括总体均值的置信区间和假设检验）不可或缺的基础。接下来你将应用这些计算方法构建定量数据的可视化表示，包括箱线图和点图，并学习如何比较两个或多个组的描述性统计量以得出基于证据的正式结论。该技能几乎在每一套AP统计学自由问答题中都会被考察，因此在继续学习之前，请确保你可以快速计算任意给定数据集的指标并能证明你的选择合理性。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u10-summary-statistics-for-one-quantitative/
