二元数据:相关性与回归
IB 数学 分析与方法 SL· 12 分钟阅读
1. 二元数据集的相关性分类★☆☆☆☆⏱ 3 min
二元数据由配对的(x,y)观测值组成,其中x是自变量解释变量,y是因变量响应变量。相关性描述这两个变量之间的线性关联,不存在固有的因果关系假设。
皮尔逊相关系数
取值范围在-1到1之间,用于量化线性关联:正值表示变量同步增长,负值表示一个变量随另一个变量增长而减小。
0 ≤ |r| < 0.3:极弱或无线性关联
0.3 ≤ |r| < 0.7:中等线性关联
0.7 ≤ |r| ≤ 1:强线性关联
一个包含12名学生的数据集记录了复习时长(小时)和考试分数(百分比),计算得到的r值为-0.82。请对两个变量之间的关联进行分类。
- 1
步骤1:检查r的符号。该值为负,因此随着复习时长增加,考试分数倾向于下降。
- 2
步骤2:将r的绝对值与分类阈值比较。|-0.82| = 0.82,属于0.7到1的区间。
- 3
步骤3:最终分类:复习时长和考试分数之间存在强负线性关联。
以下哪个r值代表最强的负线性关联?
-0.91
-0.23
0
0.76
显示答案
-0.91 —绝对值最大的负r值代表最强的负线性关系。
Exam tip:
IB评分标准要求你解读r时必须同时说明方向和强度,才能获得全部分数。
2. 计算皮尔逊r值★★☆☆☆⏱ 3 min
你可以使用乘积和公式手动计算r,也可以在输入配对x和y数据集后直接从图形显示计算器(GDC)输出结果。考试中很少要求手动计算,但你必须理解公式结构。
针对3个配对数据点:(1, 3), (2, 5), (3, 7)计算r值
- 1
步骤1:计算所有所需求和项:n=3, Σx=6, Σy=15, Σxy=34, Σx²=14, Σy²=83
- 2
步骤2:代入公式:分子 = 334 - 615 = 102 - 90 = 12
- 3
步骤3:分母 = sqrt([314 - 36][383 - 225]) = sqrt([6][24]) = sqrt(144) = 12
- 4
步骤4:r = 12 / 12 = 1,代表完全正线性关联。
3. 最小二乘线性回归线★★★☆☆⏱ 4 min
y对x的回归线是唯一的线性模型,可最小化每个数据点到直线的垂直距离平方和。它经过数据集的均值点(\bar{x}, \bar{y})。
求回归线y = ax + b的斜率a
最小化残差平方和S = Σ(y_i - ax_i - b)^2
- 1
对b求S的导数,令其为零,得到b = \bar{y} - a\bar{x}
- 2
将b代回S,对a求导,令其为零
- 3
整理得到a = \frac{n\sum xy - \sum x \sum y}{n\sum x^2 - (\sum x)^2}
斜率a代表x每增加1个单位时,y的预测变化量。
已知n=10, Σx=60, Σy=420, Σxy=3200, Σx²=500,求完整的回归线方程
- 1
步骤1:计算斜率a:a = (103200 - 60420)/(10*500 - 60²) = (32000 - 25200)/(5000 - 3600) = 6800 / 1400 ≈ 4.86
- 2
步骤2:计算均值:\bar{x} = 60/10 = 6, \bar{y} = 420/10 = 42
- 3
步骤3:计算截距b:b = 42 - 4.86*6 ≈ 12.8
- 4
步骤4:最终回归方程:y = 4.86x + 12.8
4. 预测有效性与局限性★★☆☆☆⏱ 2 min
针对原始观测数据集范围内的x值做出的预测称为内插,在统计上是可靠的。超出该范围做出的预测称为外推,几乎总是不可靠,因为线性趋势不适用于未观测到的数值。
针对5-12岁人群的年龄(x,岁)与身高(y,cm)的回归线为y = 5.2x + 85,观测x范围为5到12岁。预测x=9和x=30时的身高,并评价有效性。
- 1
步骤1:x=9时:y = 5.2*9 + 85 = 131.8 cm。这是观测范围内的内插,因此预测有效。
- 2
步骤2:x=30时:y = 5.2*30 + 85 = 241 cm。这是远超出5-12岁年龄范围的外推,因此预测完全无效。
5. 常见陷阱
错误做法:
假设强相关性意味着变量之间存在直接因果关系
原因:
相关性仅衡量线性关联,无法确认因果方向,也不能排除混淆变量的存在
正确做法:
明确说明相关性不能证明因果关系,并列出可能解释该趋势的第三变量
错误做法:
使用x对y的回归线预测y值
原因:
两条不同的回归线最小化不同的偏差集,如果互换会产生错误的预测
正确做法:
在生成回归模型前,始终确认哪个变量是因变量响应(y)
错误做法:
声称r=0代表两个变量之间不存在任何关系
原因:
r仅衡量线性关联,即使r等于0,也可能存在强非线性关系
正确做法:
注意r=0代表不存在线性关联,查看散点图以检查是否存在曲线型非线性模式
错误做法:
在原始数据集的观测x范围之外进行远距外推
原因:
测量范围内观测到的线性趋势几乎不会无限延续到未观测的数值
正确做法:
明确说明原始数据范围之外的预测在统计上无效
错误做法:
最终答案中将r舍入到1或2位小数
原因:
IB评分标准要求r值保留3位有效数字才能给予全部分数
正确做法:
直接从GDC输出所有r值,保留3位有效数字,不进行额外舍入
6. 速查表
指标 | 公式 / GDC输入 | 解读规则 |
|---|---|---|
皮尔逊r | 输入配对数据,在GDC上运行LinReg | -1 ≤ r ≤ 1,符号代表方向,绝对值代表强度 |
回归斜率a | a = (nΣxy - ΣxΣy)/(nΣx² - (Σx)²) | x每增加1个单位时y的变化量 |
回归截距b | b = \bar{y} - a\bar{x} | x=0时y的预测值 |
有效预测 | x在原始数据范围内 | 内插在统计上可靠 |
无效预测 | x超出原始数据范围 | 不推荐外推 |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2024 · Paper 2
相关性计算与解读
- 2023 · Paper 1
回归线预测任务
- 2022 · Paper 2
外推的局限性
下一步
掌握相关性和线性回归是IB 数学 AA SL考试的高分考点,这些概念经常出现在6-8分的试卷2题目中。请确保你可以计算并解读皮尔逊积矩相关系数r,求出y对x的回归线,并使用它进行预测,同时认识到外推以及混淆相关性和因果关系的风险。完成完整的考试风格二元数据练习题,避免常见的失分点。注意:独立性卡方检验——经常与本主题混淆——属于数学AI的内容,不属于AA,因此AA SL不做要求。如果你选择对配对实验或调查数据进行统计分析,本内容也可直接支撑你的内部评估(IA)。
