# 两个定量变量之间的图形表示

> AP 统计学 · AP 统计学 2024-2026
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u14-graphical-representations-between-two-quantitative/

本模块将带你掌握成对定量数据的核心图形工具，包括散点图解读、残差图诊断，以及用于消除混淆变量影响的分层图。

**先修:** [掌握单变量定量图形表示（直方图、箱线图）](https://www.owlsprep.com/zh/study/ap-statistics-u01-univariate-quantitative-graphs/); [了解线性关系的基本性质](https://www.owlsprep.com/zh/study/ap-statistics-u13-intro-to-linear-correlation/)

## 学习目标

- 识别散点图展示双变量定量数据的适用场景
- 解读双变量散点图中的方向、形态、强度与离群点
- 区分残差图与原始数据散点图，评估线性模型的拟合效果
- 构建并解读分层散点图，控制第三类混淆变量

## 散点图构建核心规则

合格的散点图将解释变量（自变量）映射到水平x轴，将响应变量（因变量）映射到垂直y轴。每一个成对观测值都被绘制为独立的不相连点，除非专门针对时间序列数据追踪时间，否则不得用线连接连续的点。

**散点图** — 一种二维可视化图形，展示全部双变量定量观测值的分布，揭示两个变量之间的关联模式。

*记法:* 成对数据点 $(x_i, y_i)$

**例题:** 为以下成对数据构建散点图：x为小测学习时长，y为满分10分的小测得分，共5名学生的数据：(1,3), (2,5), (3,7), (4,8), (5,9)

1. 将x轴标注为「学习时长」，刻度范围设为0到6；将y轴标注为「小测得分」，刻度范围设为0到10。
2. 在对应的x、y坐标处绘制每一个成对数据点，不要添加连接线或额外标记。
3. 添加清晰的标题「学习时长与小测得分的关联」，完成绘图。

**概念自测**

测试你对散点图构建的理解：

1. 标准散点图的x轴上绘制的是哪一类变量？

   - 响应变量
   - 解释变量
   - 分类变量
   - 混淆变量

   *解析:* 标准双变量分析中，解释变量（自变量）始终被映射到水平x轴。

## 散点图核心特征解读

所有散点图解读都必须覆盖四个标准化特征：方向（正相关、负相关或无关联）、形态（线性、曲线、聚类）、强度（根据点贴合形态的紧密程度分为强、中等、弱）、离群点（与整体模式偏差极大的点）。

- 正相关：x增大时，y整体呈上升趋势
- 负相关：x增大时，y整体呈下降趋势
- 无关联：x和y的取值之间不存在稳定趋势

**例题:** 解读上一个示例中学习时长与小测得分的散点图

1. 方向：正相关，学习时长增加时，小测得分整体呈上升趋势。
2. 形态：完全线性，不存在可见的曲率或聚类。
3. 强度：极强，所有点几乎完全贴合一条直线趋势。
4. 离群点：不存在偏离整体线性模式的点。

> **考试提示:** AP 考试阅卷人要求你在描述散点图时必须明确提及全部四个特征（方向、形态、强度、离群点），遗漏任意一项都无法获得满分。

## 用于线性拟合评估的残差图

残差图将残差（计算方式为 $y - \hat{y}$，即观测y值减去预测y值）绘制在纵轴，将解释变量x绘制在横轴。拟合效果良好的线性模型会呈现出随机分散的点分布，所有点无可见模式，整体以残差=0为中心分布。

> **注意**
>
> 如果残差图中出现U型或抛物线形态，即可明确证明线性模型不适用于原始数据，即便原始散点图看起来大致呈线性也不例外。

**例题:** 评估呈现明显向上开口U型形态的残差图对应的线性模型拟合效果

1. 首先确认残差图的坐标轴：x轴为解释变量，y轴为残差值。
2. 识别出在x的全部取值范围内都存在的清晰抛物线曲线模式。
3. 结论：该线性模型拟合效果很差，使用二次曲线模型可以大幅提升数据拟合度。

## 用于控制混淆变量的分层散点图

分层散点图使用不同的颜色、形状或标记大小，按第三类分类变量的不同水平区分数据点，能够揭示所有点合并绘制时被掩盖的隐藏关联，是消除混淆变量影响的常用工具。

**例题:** 使用分层散点图揭示辛普森悖论：原始数据整体呈现冰淇淋销量与溺水死亡人数的负相关关系，按月份分层后可得到不同结论

1. 首先将所有点合并绘制，观察到虚假的负向趋势。
2. 按季节（冬季、春季、夏季、秋季）使用不同的标记颜色对数据点进行分层。
3. 可以观察到，在每一个季节内部，冰淇淋销量与溺水死亡人数都呈现极强的正相关，揭示出隐藏的混淆变量——户外温度。

## 常见错误

- **错误做法:** 仅凭呈现强关联的散点图直接得出因果关系结论
  - 原因: 散点图仅能展示观测得到的关联，无法证明变量之间存在因果关系
  - 正确做法: 明确描述观测到的关联，同时说明因果结论需要受控实验设计支撑
- **错误做法:** 使用描述原始散点图的方向/强度术语来描述残差图
  - 原因: 残差图的设计目的就是消除整体线性趋势，本身不存在可解读的固有方向或强度
  - 正确做法: 仅通过识别可见模式（曲率、扇形分布、聚类）来判断线性模型是否适用
- **错误做法:** 解读散点图时忽略x方向上的强影响点
  - 原因: 远离x均值的单个极端离群点可以完全改变相关系数的符号和回归斜率
  - 正确做法: 标记所有x方向的离群点，说明移除这些点后关联的强度和方向会发生怎样的变化
- **错误做法:** 针对第三类定量变量使用分层散点图
  - 原因: 按连续定量变量分层会生成大量难以区分、过度拥挤的标记组，导致图形无法读取
  - 正确做法: 分层散点图仅适用于第三类分类变量，如有需要可使用标记大小区分连续第三类变量
- **错误做法:** 在标准散点图中添加额外线条连接连续数据点
  - 原因: 连接无关数据点会生成原始数据中不存在的人为视觉趋势
  - 正确做法: 仅绘制独立的不相连点，仅当分析明确要求时才添加单条回归趋势线

## 速查表

| 图形类型 | 核心用途 | 关键诊断特征 | 拟合效果差的警示信号 |
| --- | --- | --- | --- |
| 原始散点图 | 展示双变量关联 | 方向、形态、强度、离群点 | 无可见趋势、极端x方向离群点 |
| 残差图 | 评估线性模型拟合效果 | 以0为中心的随机分散点分布 | 曲线模式、残差分布呈扇形扩散 |
| 分层散点图 | 控制第三类分类变量 | 可识别分组专属趋势 | 标记重叠、分组无明确区分 |
| 叠加散点图 | 对比两组双变量数据集 | 两个独立趋势组清晰可辨 | 两组完全重叠无区分度 |

## 下一步

熟练掌握这些图形工具是你计算正式回归统计量的关键前置步骤，在AP考试中你必须先通过图形验证模型适用性，再开展数值计算。跳过图形检查是考生丢失自由作答题分数的最常见原因之一，College Board阅卷人会明确为引用残差图模式支撑模型选择的作答分配分数。接下来你将在此基础上学习皮尔逊相关系数，构建最小二乘回归线，开展正式残差分析以量化模型拟合效果。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u14-graphical-representations-between-two-quantitative/
