学习指南

相关性与线性回归

IB 数学应用与解释 HL· 20 分钟阅读

1. 双变量数据与相关性★★☆☆☆⏱ 15 min

双变量数据描述了从同一样本收集的两个不同变量的成对值。我们使用散点图可视化变量之间的关系,并用皮尔逊相关系数量化线性关系的强度。

📘 定义

皮尔逊相关系数

衡量两个连续变量之间线性关系强度和方向的数值指标,取值范围从

例:

= 完全正线性相关, = 完全负线性相关, = 无线性相关。

通用解释准则: = 强相关, = 中等相关, = 弱/无线性相关。

📐 例题

对于数据 ,计算 并解释结果。

  1. 1
    1. 计算样本均值:
  2. 2
    xˉ=3,yˉ=5.4\bar{x} = 3, \quad \bar{y} = 5.4
  3. 3
    1. 计算样本标准差:
  4. 4
    sx1.581,sy2.702s_x \approx 1.581, \quad s_y \approx 2.702
  5. 5
    1. 计算协方差:
  6. 6
    1. 使用公式
  7. 7
    r4.2(1.581)(2.702)=0.984r \approx \frac{4.2}{(1.581)(2.702)} = 0.984
  8. 8

    解释: 之间存在非常强的正线性关系。

Exam tip:

考试中始终使用GDC计算 ,很少需要手动计算。

2. 最小二乘回归线★★★☆☆⏱ 20 min

回归线对两个变量之间的线性关系建模。最小二乘法通过最小化观测 值和预测 值之间的垂直距离(残差)平方和来拟合直线。

📘 定义

$y$ 对 $x$ 回归线

用于从解释变量 预测响应变量 值的直线,它始终经过点 (ar{x}, ar{y})

例:

斜率 ,截距

我们根据不同的预测目标使用不同的直线: 用于从 预测 用于从 预测 ,两条直线并不相同。

📐 例题

使用之前的数据(ar{x}=3ar{y}=5.4),求 回归线并解释斜率。

  1. 1
    1. 计算斜率
  2. 2
    b=0.984×2.7021.5811.68b = 0.984 \times \frac{2.702}{1.581} \approx 1.68
  3. 3
    1. 计算截距
  4. 4
    a=5.4(1.68)(3)=0.36a = 5.4 - (1.68)(3) = 0.36
  5. 5
    1. 最终方程:
  6. 6
    y=0.36+1.68xy = 0.36 + 1.68x
  7. 7

    解释: 每增加1个单位, 平均预计增加1.68个单位。

Exam tip:

考试中可以利用直线经过 (ar{x}, ar{y}) 这一性质验证你的答案。

3. 预测:内插 vs 外插★★★☆☆⏱ 15 min

回归线用于预测响应变量的未知值,预测的可靠性取决于输入值落在原始收集数据范围的内部还是外部。

内插通常可靠,因为我们知道线性关系在该范围内成立。外插不可靠,因为我们没有证据表明线性关系在观测范围外仍然成立。

📐 例题

使用回归线 (原始 范围为 1 到 5),预测 对应的 值,并评论预测的可靠性。

  1. 1

    对于

  2. 2
    y=0.36+1.68(3.5)=6.24y = 0.36 + 1.68(3.5) = 6.24
  3. 3

    说明: 在原始范围 1 到 5 内,因此这是内插,预测可靠。

  4. 4

    对于

  5. 5
    y=0.36+1.68(10)=17.16y = 0.36 + 1.68(10) = 17.16
  6. 6

    说明: 在原始范围外,因此这是外插,预测不可靠,因为我们不知道线性关系在 处是否仍然成立。

4. 相关性 vs 因果关系★★☆☆☆⏱ 10 min

一个常见误解是:两个变量之间的强相关性证明一个变量导致另一个变量。这并不正确,相关性也可出现在多种非因果场景中。

📐 例题

一项研究发现月度冰淇淋销量和月度溺水死亡人数之间存在强正相关。冰淇淋销量会导致溺水吗?

  1. 1
    1. 观察到存在强正相关,但没有明显的直接联系。
  2. 2
    1. 找出潜伏变量:气温。更高的温度同时增加冰淇淋销量和游泳人数,导致更多溺水事件。
  3. 3
    1. 结论:冰淇淋销量和溺水死亡人数之间不存在因果关系,相关性可由潜伏变量解释。

Exam tip:

考试中要求解释结果时,一定要明确说明相关性不代表因果关系。

5. 常见陷阱

错误做法:

声称强相关性证明因果关系

原因:

相关性仅衡量关联,而非定向因果联系,且相关性可由潜伏变量解释

正确做法:

除非有实验证据证实因果关系,否则始终明确说明相关性不代表因果关系

错误做法:

认为外插预测和内插预测同样可靠

原因:

线性关系仅在观测数据范围内得到验证

正确做法:

讨论结果时始终将外插预测标记为不可靠

错误做法:

使用x对y回归线由x预测y

原因:

回归线是针对特定响应变量拟合以最小化误差的,因此使用错误的直线会得到有偏预测

正确做法:

使用y对x直线由x预测y,使用x对y直线由y预测x

错误做法:

假设接近零的相关系数意味着不存在关系

原因:

皮尔逊r仅衡量线性相关,强非线性关系也可能得到接近零的r

正确做法:

在得出不存在关系的结论前,始终绘制散点图检查是否存在非线性模式

错误做法:

计算早期将回归系数四舍五入到2位小数

原因:

过早四舍五入会给最终预测带来显著误差

正确做法:

在计算的最后一步之前,将完整未舍入的系数存储在你的GDC中

6. 速查表

概念

关键值/公式

说明

皮尔逊

衡量线性相关的强度

强相关

明确的线性趋势

弱相关

无明确的线性趋势

y对x直线

预测

斜率

x每增加一单位y的变化量

截距

x=0时的预测y值

内插

在数据范围内预测

通常可靠

外插

在数据范围外预测

通常不可靠

核心准则

相关性 因果关系

始终考虑潜伏变量

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2021 · 1

    计算r和回归线

  • 2022 · 2

    内插与外插

  • 2023 · 1

    相关性与因果关系讨论

深入阅读

下一步

相关性和线性回归是IB AI HL所有统计建模的基础。这些技能可直接用于你的内部评估(IA),你需要在IA中分析自有数据集中变量之间的关系。接下来,你会将这些思想拓展到非线性回归,将非线性关系转换为线性模型进行拟合,并学习如何检验观测到的相关性是否具有统计显著性。掌握本小节是课程中所有后续统计工作的关键。