# 残差

> AP 统计学 · AP 统计学 2024-2026
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u14-residuals/

我们将介绍残差计算、正式语境解释、残差图模式分析，以及使用残差验证核心线性回归假设，这是AP统计学自由作答部分分值很高的考点。

**先修:** [通过最小二乘回归线计算预测值](https://www.owlsprep.com/zh/study/ap-statistics-u14-least-squares-regression/); [回忆线性回归推断的核心假设](https://www.owlsprep.com/zh/study/ap-statistics-u14-regression-assumptions-overview/)

## 学习目标

- 使用正确的运算顺序计算线性回归模型的残差
- 在完整语境下解释残差值，以在AP考试中获得满分
- 分类残差图模式以验证核心线性回归假设
- 利用残差大小检测异常值和高影响数据点

## 正确计算残差

所有最小二乘回归线的构造都满足所有残差之和恰好为0，且残差平方和最小。残差计算的唯一允许公式遵循观测值减预测值的顺序，没有例外。

**残差** — 原始观测数据点与回归线之间的垂直距离，衡量模型预测值与实际观测值的偏差大小。

*记法:* e

$$e_i = y_i - \hat{y}_i$$

**例题:** 某条根据学习时长预测学生考试分数的回归线为\(\hat{y} = 62 + 7.2x\)。一名学习了3小时的学生得分85，计算其残差。

1. 步骤1：计算x=3小时学习时长对应的预测考试分数
2. $$\hat{y} = 62 + 7.2(3) = 62 + 21.6 = 83.6$$
3. 步骤2：用观测分数减去预测值得到残差
4. $$e = 85 - 83.6 = 1.4$$
5. 最终残差=+1.4，代表该学生的得分比模型预测值高1.4分。

**概念自测**

测试你对残差计算的理解

1. 如果回归模型预测一辆车的油耗为32英里/加仑，实际观测油耗为29英里/加仑，残差是多少？

   - +3
   - -3
   - 32
   - 29

   *解析:* 残差 = 观测值 - 预测值 = 29 - 32 = -3

> **考试提示:** 如果将计算顺序颠倒为预测值减观测值，AP阅卷者会扣除该题全部分值，务必始终先写观测值。

## 残差的语境化解释

对残差的通用数学解释无法在AP考试中获得满分。你必须明确指出解释变量、响应变量、单位以及预测误差的方向。

**考试命令词**

AP考试残差题的常见指令术语有严格的评分规则：

- **Calculate residual** — 展示完整的减法步骤，标注单位避免计算错误

- **Interpret residual** — 参考具体数据集语境，说明观测值高于还是低于模型预测值

- **Explain what this residual means** — 额外明确说明模型对该特定数据点是高估还是低估

**例题:** 解释面积为1200平方英尺的住宅对应的残差-2.3，该回归模型预测房价单位为千美元。

1. 步骤1：确认残差符号为负，因此观测值低于预测值
2. 步骤2：正确转换单位：-2.3千美元 = -\$2300
3. 步骤3：完整语境解释：该残差为-2.3意味着这套1200平方英尺住宅的实际售价比房屋面积与售价的线性回归模型预测的价格低2300美元。

> **考试提示:** 在残差解释中务必带上单位，避免丢失部分分数。

## 残差图模式分析

残差图是检查线性模型是否适用的主要诊断工具，x轴对应解释变量的值，y轴绘制每个数据点的残差值。

| 残差图模式 | 解释 | 推荐操作 |
| --- | --- | --- |
| 围绕0随机散布，无明显趋势 | 线性模型完全适用 | 继续进行线性推断 |
| 清晰的U形或倒U形曲线 | 线性性假设不满足 | 对x或y变量进行变换（例如对数变换）以修正非线性 |
| 向外扇形展开（残差大小随x增大而增大） | 等方差（同方差性）假设不满足 | 应用加权最小二乘法或对y变量进行变换 |

**例题:** 根据植物生长天数预测株高的回归残差图呈现清晰的向上开口抛物线模式，这说明原线性模型存在什么问题？

1. 步骤1：识别残差点中存在的非随机曲线趋势
2. 步骤2：将该模式与回归假设关联：线性性假设不满足
3. 步骤3：结论：直线模型不适用于该数据集，二次或指数增长模型的拟合效果会好得多。

## 用残差检测异常值

标准化残差大于+2或小于-2的点被归类为潜在异常值。这些极端点会将整条回归线向自身拉动，大幅偏斜斜率和截距值。

> **异常值检测记忆口诀**
>
> 残差大于2或小于-2，异常值跑不了

**概念自测**

识别异常值阈值

1. 以下哪个标准化残差值代表潜在异常值？

   - 0.7
   - 1.2
   - -2.4
   - -0.9

   *解析:* 任何绝对值大于2的标准化残差都会被标记为潜在异常值。

## 常见错误

- **错误做法:** 将残差计算为预测值减观测值
  - 原因: 颠倒顺序会翻转残差的符号，导致解释完全错误
  - 正确做法: 始终使用公式 残差 = 观测y - 预测\hat{y}
- **错误做法:** 不参考数据集语境就解释残差
  - 原因: AP阅卷者会不给不提及变量和单位的通用解释任何分数
  - 正确做法: 明确说明语境、单位，以及观测值和预测值之间的比较
- **错误做法:** 看到图中微小的非零平均残差就判定模型无效
  - 原因: 所有最小二乘回归线的平均残差都恰好为0，微小偏差只是绘图噪声
  - 正确做法: 忽略微小的垂直偏移，重点关注残差点的可见模式
- **错误做法:** 认为随机散布的残差图代表模型精度很高
  - 原因: 随机散布仅证实线性性和等方差性，不代表模型解释了很高比例的变异
  - 正确做法: 将残差图分析与R平方值结合以评估整体模型拟合度
- **错误做法:** 计算平方误差和之前去掉残差的负号
  - 原因: 这会导致SSE值错误，模型误差估计有偏
  - 正确做法: 平方前保留每个残差的完整符号以得到正确的求和结果

## 速查表

| 公式 / 规则 | 定义 | AP考试注意事项 |
| --- | --- | --- |
| e = y - \hat{y} | 残差值 | 观测值在前，预测值在后，避免符号错误 |
| 残差随机散布 | 线性模型适用 | 不允许存在曲线或扇形模式 |
| \|标准化残差\| > 2 | 潜在异常值 | 移除点之前先检查其影响力 |

## 下一步

掌握残差分析是学习更高级回归诊断前的关键关卡，因为残差模式是识别会产生无效推断结果的缺陷模型的第一步。该技能几乎在每一场AP统计学自由作答考试中都会被考察，经常与R平方、斜率解释或回归斜率推断的题目结合。你将在运行斜率t检验之前使用残差验证条件，识别可能偏斜模型结果的点。接下来练习处理标准化残差，然后探索非线性数据集的残差变换，之后学习完整的回归推断工作流。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u14-residuals/
