# 线性回归模型

> AP 统计学 · AP 统计学 2024-2027
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u14-linear-regression-models/

我们将讲解理论总体线性回归模型、参数解释、残差条件验证，以及真实总体斜率的入门推断，内容完全符合AP统计学考试评分标准。

**先修:** [拟合最小二乘回归线的计算](https://www.owlsprep.com/zh/study/ap-statistics-u14-least-squares-regression/); [样本统计量的抽样分布](https://www.owlsprep.com/zh/study/ap-statistics-u7-sampling-distributions/)

## 学习目标

- 定义总体线性回归模型，区分其与样本拟合最小二乘直线的差异
- 结合完整上下文解释斜率、截距和残差标准差的含义
- 验证线性回归参数推断所需的四个前提条件
- 计算所有核心总体回归参数的无偏点估计

## 理论总体线性回归模型

与你从观测数据计算得到的样本最小二乘回归线不同，总体线性回归模型描述了目标总体中所有个案背后的真实潜在关系。它明确考虑了单个观测值与均值趋势线之间的随机变异。

$$y = \beta_0 + \beta_1 x + \epsilon$$

**误差项** — 给定x下单个观测y值与y均值的随机偏差，假设其独立且服从均值为0的正态分布。

*记法:* \epsilon

*例:* 一名学习4小时的学生得分比所有学习4小时学生的平均得分高7分。

**例题:** 一名研究者模拟某州所有12年级学生的学习时长(x)与考试分数(y)的总体关系，真实参数为\(\beta_0 = 32\)，\(\beta_1 = 4.2\)。该模型对学习5小时的学生预测的平均分数是多少？

1. 将已知总体参数和x=5代入总体回归方程
2. $$\text{Mean } y = 32 + (4.2 \times 5)$$
3. 化简得到平均考试分数=53

> **tip**
>
> 总体模型给出的是固定x下y的**均值**，而非单个预测的个体y值，这是AP自由问答题中常见的扣分点。

## 结合上下文的关键参数解释

线性回归模型中的每个参数都有特定的上下文解释，AP阅卷员会为明确表述的解释打分，不允许使用模糊表述。

- 真实截距\(\beta_0\)：当解释变量x等于0时响应变量y的均值，仅当x=0在数据集中是合理取值时才可解释。
- 真实斜率\(\beta_1\)：解释变量x每增加1单位时，y的均值对应的预测变化量。
- 残差标准差\(\sigma\)：观测y值与总体回归线之间的典型距离，单位与响应变量相同。

**考试命令词**

AP考试在回归解释类题目中使用以下标准指令术语：

- **Interpret the slope** — 你必须提及x的1单位增量、y均值的变化，以及变量的完整上下文 *(臂展每增加1厘米，身高的平均值平均增加0.92厘米。)*

- **Explain what \(\sigma\) represents** — 你必须说明它是观测y值与回归线的典型偏差，而非y本身的标准差

**例题:** 对于描述月度广告支出(x，单位：千美元)与月度销售额(y，单位：千美元)关系的总体模型，\(\beta_1 = 2.7\)。结合上下文解释该参数。

1. 确定x的1单位增量：月度广告支出增加1000美元
2. 确定y均值对应的变化：月度销售额均值增加2700美元
3. 组合为完整上下文表述：广告支出每多花1000美元，月度销售额的平均值平均增加2700美元。

## 线性回归模型的推断条件

所有线性回归推断程序（斜率的置信区间、显著性检验）都需要满足四个核心条件，之后才能将结果推广到整个总体。

> **mnemonic**
>
> 四个条件可缩写为LINE：线性关系(Linear)、残差独立(Independent)、残差正态分布(Normal)、所有x值下残差方差相等(Equal variance)。

- 线性：x与y的均值之间的真实关系是线性的，可通过x与y的散点图验证，图中不应出现明显的曲线模式。
- 独立：单个观测值之间相互独立，可通过随机抽样或随机分配验证，不放回抽样时需满足10%条件。
- 正态：残差在每个x值下都近似服从正态分布，可通过残差的正态概率图或直方图验证，不应存在强偏态。
- 等方差：所有x值下残差的分布范围大致一致，可通过残差图验证，图中不应出现扇形模式。

**例题:** 一名学生绘制了树龄与树干直径回归的残差图，发现残差的分布范围随x增大而明显变大。哪个条件被违反了？对推断有什么影响？

1. 将模式与LINE条件匹配：分布范围增大违反了等方差条件
2. 说明影响：斜率的标准误计算将不准确，导致置信区间宽度和p值产生误导。

**概念自测**

测试你对回归条件的理解：

1. 以下哪个图最适合验证回归的线性条件？

   - x与y的散点图
   - 残差直方图
   - 残差与x的关系图
   - 正态概率图

   *解析:* 原始变量的散点图可以让你确认不存在曲线型的非线性模式。

## 回归参数的无偏点估计

我们使用样本数据计算线性回归模型未知总体参数的无偏点估计，这是所有后续推断程序的基础。

$$\hat{\beta_1} = r \frac{s_y}{s_x}, \quad \hat{\beta_0} = \bar{y} - \hat{\beta_1} \bar{x}$$

**估计残差标准差** — 总体残差标准差\(\sigma\)的无偏样本估计，使用自由度n-2计算，以考虑两个被估计的回归参数。

*记法:* s

**例题:** 对于n=20个观测值的样本，r=0.72，\(s_y=8.1\)，\(s_x=2.3\)，\(\bar{y}=45\)，\(\bar{x}=12\)。计算估计的斜率和截距。

1. $$\text{Estimated slope: } \hat{\beta_1} = 0.72 \times (8.1 / 2.3) \approx 2.53$$
2. $$\text{Estimated intercept: } \hat{\beta_0} = 45 - (2.53 \times 12) \approx 14.64$$
3. 确认得到的样本直线经过均值点\((\bar{x}, \bar{y})\)。

## 常见错误

- **错误做法:** 将总体斜率解释为单个y的变化而非y均值的变化
  - 原因: 这在AP自由问答题中会直接被扣1分
  - 正确做法: 在每一次斜率解释中都明确加入“响应变量的均值”这一表述。
- **错误做法:** 当x=0不在观测x值的范围内时，仍尝试解释截距
  - 原因: 这种情况下截距没有现实意义，它只是直线的数学锚点
  - 正确做法: 如果x=0不是数据集的合理取值，说明该截距在上下文中不可解释。
- **错误做法:** 在x与y的散点图上而非残差图上检查等方差条件
  - 原因: 在原始散点图上很难发现不等方差
  - 正确做法: 始终使用残差与拟合值的关系图来评估扇形的不等分布范围。
- **错误做法:** 回归推断中使用n-1自由度而非n-2
  - 原因: 估计两个参数\(\beta_0\)和\(\beta_1\)时会损失两个自由度
  - 正确做法: 针对真实斜率的所有t检验程序都使用df = n-2。
- **错误做法:** 混淆s（残差标准差）与\(s_y\)（响应变量的标准差）
  - 原因: 如果x和y之间存在非零相关性，s始终小于\(s_y\)
  - 正确做法: 明确说明s描述的是与回归线的偏差，而非y的整体变异。

## 速查表

| 参数 | 总体符号 | 样本估计量 | 自由度 |
| --- | --- | --- | --- |
| Y轴截距 | \(\beta_0\) | \(\hat{\beta_0} = \bar{y} - \hat{\beta_1}\bar{x}\) | n-2 |
| 斜率 | \(\beta_1\) | \(\hat{\beta_1} = r \frac{s_y}{s_x}\) | n-2 |
| 残差标准差 | \(\sigma\) | \(s = \sqrt{\frac{SSE}{n-2}}\) | n-2 |

## 下一步

掌握了总体线性回归模型的核心结构和假设后，你就可以开始学习针对真实斜率的正式推断程序，包括构建置信区间和运行假设检验，以评估总体中是否存在线性关系。这些技能约占AP统计学自由问答部分的15-20%，坚持练习参数解释和条件校验将大幅提升你的考试分数。你也可以复习残差分析，对非线性关系进行变换，以满足LINE条件实现有效推断。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u14-linear-regression-models/
