# 单变量汇总统计量的图形表示

> AP 统计学 · AP 统计学 2024-2026
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u10-graphical-representations-of-summary-statistics/

本模块将带你学习单变量定量数据的四种核心图形展示方式的构建、解读与比较，完全符合AP统计学考试要求。

**先修:** [计算定量数据的五数概括](https://www.owlsprep.com/zh/study/ap-statistics-u10-five-number-summary-and-outliers/); [定义单变量分布的形状、中心和离散程度](https://www.owlsprep.com/zh/study/ap-statistics-u10-describing-distributions/)

## 学习目标

- 为单变量定量数据集选择合适的图形展示方式
- 基于原始数据或汇总统计量构建并解读点图、茎叶图、直方图和箱线图
- 使用对齐的图形表示比较不同组的分布
- 直接从图形汇总图中识别异常值和分布形状特征

## 点图与茎叶图：原始数据可视化

这两种展示方式保留了所有独立的原始数据值，非常适合需要完整观测透明度的中小型数据集。

**茎叶图（Stem-and-Leaf Plot）** — 将每个数据点拆分为共享的前导茎数字和唯一的尾随叶数字，在对数值分组的同时保留全部精度的展示方式

*记法:* 茎 = 前导数字，叶 = 末尾数字

*例:* 数据点23、27、31、32的茎分别为2和3，对应的叶分别为[3,7]和[1,2]

**例题:** 为以下12个考试分数构建茎叶图：62, 65, 71, 74, 75, 77, 80, 82, 86, 91, 93, 98

1. 将十位前导数字设为茎，个位末尾数字设为叶
2. 在图的左侧按升序列出从6到9的所有唯一茎
3. 将每个分数的个位数字作为叶分配到对应茎下，所有叶按升序排序
4. 添加注释说明符号含义，例如 6 | 2 = 62分

> **考试提示**
>
> AP阅卷官接受使用拆分茎的茎叶图（例如茎7分为两行，一行放叶0-4，另一行放叶5-9），以提升分布形状的可读性

**概念自测**

测试你对原始数据展示方式的理解：

1. 某个茎叶图的茎为9，叶为2、4、7，其中的最大值是多少？

   *解析:* 茎9代表十位，7是个位数字。

## 直方图：分箱频数可视化

**直方图** — 针对定量数据的条形图，x轴被划分为连续且互不重叠的分箱，条形高度代表每个分箱内观测值的频数或相对频数

*例:* 分箱0-10包含7个观测值，因此其条形在y轴上的高度为7

**例题:** 为20名学生的通勤时间构建直方图，分箱为0-10、10-20、20-30、30-40、40-50，对应频数为5、7、4、3、1

1. 绘制连续x轴，标注为“通勤时间（分钟）”，范围覆盖0到50
2. 绘制y轴，标注为“学生人数”，范围覆盖0到8，以容纳最大值7的频数
3. 为每个分箱绘制相邻的条形，高度等于对应频数，条形之间不留空隙
4. 确认所有条形互不重叠，所有数据点都恰好落入一个分箱内

> **常见错误**
>
> 如果使用不等宽分箱，你必须将y轴按密度而非原始频数缩放，以避免扭曲每个分箱的相对面积

**考试命令词**

AP考试针对直方图任务会使用特定的指令术语：

- **Describe the shape** — 你必须明确提及偏度、峰数和异常值 *(该分布呈右偏态，在50分钟附近有一个异常值)*

## 箱线图：汇总统计量可视化

**箱线图** — 完全基于五数概括构建的紧凑展示方式，使用1.5*IQR规则清晰标记异常值

*记法:* 箱体从Q1延伸到Q3，中位数处有竖线，须线延伸到最远的非异常值点

**推导:** 根据五数概括构建箱线图

*起点:* 最小值 = 12，第一四分位数（Q1）= 18，中位数 = 25，第三四分位数（Q3）= 32，最大值 = 47，异常值为 58

1. 绘制数轴，覆盖包含异常值在内的全部数值范围
2. 绘制矩形箱体，从Q1=18延伸到Q3=32，在中位数25的位置画一条竖线
3. 计算IQR = Q3 - Q1 = 14，因此1.5*IQR = 21，上栅栏 = Q3 + 21 = 53
4. 从Q1向下绘制须线到最小值12，从Q3向上绘制须线到上栅栏以下的最大值47
5. 将异常值58绘制为上须线之外的独立孤立点

*结论:* 最终的箱线图可清晰显示异常值导致的右偏特征，以及数据中间50%的分布范围

> **考试助记符**
>
> 使用SOCS描述任意分布：形状（Shape）、异常值（Outliers）、中心（Center）、离散程度（Spread）

## 使用对齐图形进行跨分布比较

**方法对比**

根据样本量和所需细节程度选择合适的分组比较展示方式：

- **并排点图** — 最适合2组且样本量n < 30的场景
  - 优点: 保留所有独立数据点
  - 缺点: 样本量大时会显得杂乱

- **并排箱线图** — 最适合3组及以上任意样本量的场景
  - 优点: 可一眼快速比较中心和离散程度
  - 缺点: 隐藏单个数据点的细节

**概念自测**

测试你的比较技能：

1. 以下哪种展示方式最适合比较5个不同班级的考试分数分布？

   - 并排箱线图
   - 点图
   - 茎叶图

   *解析:* 箱线图足够紧凑，可以在同一坐标轴上容纳5个对齐的展示，便于比较。

## 常见错误

- **错误做法:** 直方图使用不等宽分箱，同时y轴统计原始频数
  - 原因: 这会扭曲分箱的相对面积，导致分布形状显示出错误的偏态
  - 正确做法: 使用等宽分箱，如果必须使用不等宽分箱，则将y轴按密度缩放
- **错误做法:** 在直方图的条形之间添加空隙来分隔分箱
  - 原因: 直方图的条形代表连续有序数据，空隙会错误地表示该数值范围内没有数据
  - 正确做法: 相邻直方图条形之间不留空隙，频数为0的空分箱除外
- **错误做法:** 声称箱线图可以显示数据集的众数
  - 原因: 箱线图仅展示四分位数，无法显示单个数据点或最高频数的位置
  - 正确做法: 使用点图或茎叶图识别众数，注意无法从箱线图中确认众数
- **错误做法:** 比较两个并排箱线图时忽略异常值
  - 原因: 异常值是代表极端值的点，会影响数据的离散程度和背景信息，AP评分标准会因遗漏异常值扣分
  - 正确做法: 比较分布时必须将异常值作为独立特征明确提及
- **错误做法:** 将数值范围较大的茎叶图的茎仅拆分为2部分
  - 原因: 这会过度聚合数据，隐藏双峰性等分布形状特征
  - 正确做法: 根据需要将茎拆分为5份或2份，确保总茎数在6-15之间，清晰呈现分布形状

## 速查表

| 展示类型 | 最佳适用场景 | 显示精确数据值？ | 易于识别异常值？ | AP考试常见指令术语 |
| --- | --- | --- | --- | --- |
| 点图 | 样本量n < 50的定量数据 | 是 | 是 | 构建 / 描述 |
| 茎叶图 | 样本量n < 200的中小型定量数据 | 是 | 是 | 构建 / 比较 |
| 直方图 | 样本量n > 100的连续定量数据 | 否 | 否 | 解读 / 描述形状 |
| 箱线图 | 比较3组及以上的数据集 | 否 | 是 | 比较分布 |

## 下一步

掌握这些图形表示是你后续学习AP考试所有推断统计和比较统计内容的基础。后续课程中你将使用这些展示方式为t检验、卡方检验和回归分析的假设提供依据，也能在要求比较两个分布的自由作答题中拿到满分——这类题型几乎在每一届AP统计学考试中都会出现。为了巩固这些知识，请练习将你的解读技能应用到正式的分布描述框架中，之后学习计算均值、标准差和四分位距等数值汇总统计量，与你的图形分析相互补充。这些配套技能将确保你在考试中不会因为描述不完整而丢分。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u10-graphical-representations-of-summary-statistics/
