# 二元数据：相关性与回归

> IB 数学 分析与方法 SL · IB Math AA SL
> 来源: https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-bivariate-data-correlation-and-regression/

本模块涵盖核心二元统计概念，包括相关性强度评估、线性回归构建和有效预测规则，符合IB 数学 AA SL 试卷1和试卷2的要求。

**先修:** [散点图的绘制与解读](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-scatter-plots/); [单变量描述性统计汇总](https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-univariate-summary-stats/)

## 学习目标

- 区分配对二元数据集中的自变量和因变量
- 计算并解读皮尔逊积矩相关系数(r)
- 推导并使用y对x的最小二乘线性回归线
- 评估预测的有效性，识别相关性分析的局限性

## 二元数据集的相关性分类

二元数据由配对的(x,y)观测值组成，其中x是自变量解释变量，y是因变量响应变量。相关性描述这两个变量之间的线性关联，不存在固有的因果关系假设。

**皮尔逊相关系数** — 取值范围在-1到1之间，用于量化线性关联：正值表示变量同步增长，负值表示一个变量随另一个变量增长而减小。

*记法:* r

- 0 ≤ |r| < 0.3：极弱或无线性关联
- 0.3 ≤ |r| < 0.7：中等线性关联
- 0.7 ≤ |r| ≤ 1：强线性关联

**例题:** 一个包含12名学生的数据集记录了复习时长（小时）和考试分数（百分比），计算得到的r值为-0.82。请对两个变量之间的关联进行分类。

1. 步骤1：检查r的符号。该值为负，因此随着复习时长增加，考试分数倾向于下降。
2. 步骤2：将r的绝对值与分类阈值比较。|-0.82| = 0.82，属于0.7到1的区间。
3. 步骤3：最终分类：复习时长和考试分数之间存在强负线性关联。

**概念自测**

1. 以下哪个r值代表最强的负线性关联？

   - -0.91
   - -0.23
   - 0
   - 0.76

   *解析:* 绝对值最大的负r值代表最强的负线性关系。

> **考试提示:** IB评分标准要求你解读r时必须同时说明方向和强度，才能获得全部分数。

## 计算皮尔逊r值

你可以使用乘积和公式手动计算r，也可以在输入配对x和y数据集后直接从图形显示计算器(GDC)输出结果。考试中很少要求手动计算，但你必须理解公式结构。

$$r = \frac{n\sum xy - \sum x \sum y}{\sqrt{\left[n\sum x^2 - \left(\sum x\right)^2\right]\left[n\sum y^2 - \left(\sum y\right)^2\right]}}$$

> **tip**
>
> 请始终确认你的GDC设置为输出3位有效数字的r值，这是IB最终答案要求的精度。

**例题:** 针对3个配对数据点：(1, 3), (2, 5), (3, 7)计算r值

1. 步骤1：计算所有所需求和项：n=3, Σx=6, Σy=15, Σxy=34, Σx²=14, Σy²=83
2. 步骤2：代入公式：分子 = 3*34 - 6*15 = 102 - 90 = 12
3. 步骤3：分母 = sqrt([3*14 - 36][3*83 - 225]) = sqrt([6][24]) = sqrt(144) = 12
4. 步骤4：r = 12 / 12 = 1，代表完全正线性关联。

## 最小二乘线性回归线

y对x的回归线是唯一的线性模型，可最小化每个数据点到直线的垂直距离平方和。它经过数据集的均值点(\bar{x}, \bar{y})。

**推导:** 求回归线y = ax + b的斜率a

*起点:* 最小化残差平方和S = Σ(y_i - ax_i - b)^2

1. 对b求S的导数，令其为零，得到b = \bar{y} - a\bar{x}
2. 将b代回S，对a求导，令其为零
3. 整理得到a = \frac{n\sum xy - \sum x \sum y}{n\sum x^2 - (\sum x)^2}

*结论:* 斜率a代表x每增加1个单位时，y的预测变化量。

**例题:** 已知n=10, Σx=60, Σy=420, Σxy=3200, Σx²=500，求完整的回归线方程

1. 步骤1：计算斜率a：a = (10*3200 - 60*420)/(10*500 - 60²) = (32000 - 25200)/(5000 - 3600) = 6800 / 1400 ≈ 4.86
2. 步骤2：计算均值：\bar{x} = 60/10 = 6, \bar{y} = 420/10 = 42
3. 步骤3：计算截距b：b = 42 - 4.86*6 ≈ 12.8
4. 步骤4：最终回归方程：y = 4.86x + 12.8

**考试命令词**

- **Write down** — 直接复制GDC输出结果，无需展示计算过程

- **Find** — 在给出最终答案前至少展示一个中间计算步骤

- **Interpret** — 将斜率或截距值与数据集的实际场景关联起来

## 预测有效性与局限性

针对原始观测数据集范围内的x值做出的预测称为内插，在统计上是可靠的。超出该范围做出的预测称为外推，几乎总是不可靠，因为线性趋势不适用于未观测到的数值。

> **warning**
>
> 高r值不能证明两个变量之间存在因果关系。第三个混淆变量可能驱动观测到的关联。

**例题:** 针对5-12岁人群的年龄(x，岁)与身高(y，cm)的回归线为y = 5.2x + 85，观测x范围为5到12岁。预测x=9和x=30时的身高，并评价有效性。

1. 步骤1：x=9时：y = 5.2*9 + 85 = 131.8 cm。这是观测范围内的内插，因此预测有效。
2. 步骤2：x=30时：y = 5.2*30 + 85 = 241 cm。这是远超出5-12岁年龄范围的外推，因此预测完全无效。

## 常见错误

- **错误做法:** 假设强相关性意味着变量之间存在直接因果关系
  - 原因: 相关性仅衡量线性关联，无法确认因果方向，也不能排除混淆变量的存在
  - 正确做法: 明确说明相关性不能证明因果关系，并列出可能解释该趋势的第三变量
- **错误做法:** 使用x对y的回归线预测y值
  - 原因: 两条不同的回归线最小化不同的偏差集，如果互换会产生错误的预测
  - 正确做法: 在生成回归模型前，始终确认哪个变量是因变量响应(y)
- **错误做法:** 声称r=0代表两个变量之间不存在任何关系
  - 原因: r仅衡量线性关联，即使r等于0，也可能存在强非线性关系
  - 正确做法: 注意r=0代表不存在线性关联，查看散点图以检查是否存在曲线型非线性模式
- **错误做法:** 在原始数据集的观测x范围之外进行远距外推
  - 原因: 测量范围内观测到的线性趋势几乎不会无限延续到未观测的数值
  - 正确做法: 明确说明原始数据范围之外的预测在统计上无效
- **错误做法:** 最终答案中将r舍入到1或2位小数
  - 原因: IB评分标准要求r值保留3位有效数字才能给予全部分数
  - 正确做法: 直接从GDC输出所有r值，保留3位有效数字，不进行额外舍入

## 速查表

| 指标 | 公式 / GDC输入 | 解读规则 |
| --- | --- | --- |
| 皮尔逊r | 输入配对数据，在GDC上运行LinReg | -1 ≤ r ≤ 1，符号代表方向，绝对值代表强度 |
| 回归斜率a | a = (nΣxy - ΣxΣy)/(nΣx² - (Σx)²) | x每增加1个单位时y的变化量 |
| 回归截距b | b = \bar{y} - a\bar{x} | x=0时y的预测值 |
| 有效预测 | x在原始数据范围内 | 内插在统计上可靠 |
| 无效预测 | x超出原始数据范围 | 不推荐外推 |

## 下一步

掌握相关性和线性回归是IB 数学 AA SL考试的高分考点，这些概念经常出现在6-8分的试卷2题目中。请确保你可以计算并解读皮尔逊积矩相关系数r，求出y对x的回归线，并使用它进行预测，同时认识到外推以及混淆相关性和因果关系的风险。完成完整的考试风格二元数据练习题，避免常见的失分点。注意：独立性卡方检验——经常与本主题混淆——属于数学AI的内容，不属于AA，因此AA SL不做要求。如果你选择对配对实验或调查数据进行统计分析，本内容也可直接支撑你的内部评估(IA)。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-aa-sl-u4-bivariate-data-correlation-and-regression/
