学习指南

相关性

AP 统计学· 12 分钟阅读

1. 定义皮尔逊相关系数★★☆☆☆⏱ 3 min

皮尔逊r值是一种标准化指标,它消除了两个变量的单位,因此改变x或y的尺度(例如将英寸转换为厘米)永远不会改变r的取值。

📘 定义

皮尔逊相关系数

rr

取值严格介于-1和1之间的无量纲值,用于衡量两个定量变量之间线性关系的强度和方向

例:

r=0.9表示强正线性关联,r=-0.7表示中等强度的负线性关联

r=1n1i=1n(xixˉsx)(yiyˉsy)r = \frac{1}{n-1} \sum_{i=1}^{n} \left( \frac{x_i - \bar{x}}{s_x} \right) \left( \frac{y_i - \bar{y}}{s_y} \right)
📐 例题

为以下3个数据点计算r值:(1, 2), (2, 4), (3, 5)

  1. 1

    首先计算x和y的均值与标准差:, , ,

  2. 2

    将每个x和y值转换为z分数:x的z分数 = [-1, 0, 1],y的z分数 = [-1.09, 0.22, 0.87]

  3. 3

    将配对的z分数相乘、求和后除以n-1:

✓ 快速检测

测试你对r的性质的理解

  1. r的最大可能取值是多少?

    • 1

    • 100

    • 无穷大

    • 0

    显示答案
    1

    r永远不能超过1,也不能小于-1

2. 从散点图解读r值★★☆☆☆⏱ 3 min

r取值范围

关联强度

典型散点图模式

0.7 到 1.0

强正相关

点紧密聚集在向上倾斜的直线周围

0.3 到 0.7

中等正相关

点松散聚集在向上倾斜的直线周围

-0.3 到 0.3

极弱或无关联

点随机散布,没有明显趋势

-0.7 到 -0.3

中等负相关

点松散聚集在向下倾斜的直线周围

-1.0 到 -0.7

强负相关

点紧密聚集在向下倾斜的直线周围

📐 例题

将4张散点图与r值匹配:-0.9、0.2、0.7、-0.4

  1. 1

    散点图1(紧密向下直线)= -0.9

  2. 2

    散点图2(随机无趋势)= 0.2

  3. 3

    散点图3(松散向上直线)= 0.7

  4. 4

    散点图4(非常松散向下直线)= -0.4

Exam tip:

AP阅卷者会扣分,如果你在描述r的度量对象时忘记加上“线性”一词

3. 会扭曲相关系数取值的因素★★★☆☆⏱ 3 min

📐 例题

展示添加单个异常点(10, 10)如何改变我们之前计算的3点数据集的r值(原r=0.98)

  1. 1

    原始3个点:(1,2), (2,4), (3,5),r=0.98

  2. 2

    添加异常点(10, 10),新的n=4

  3. 3

    重新计算r:新r ≈ 0.97,如果异常点符合现有趋势,变化可以忽略不计

  4. 4

    如果我们改为添加异常点(10, 0),新r会下降到≈-0.3,完全反转观测到的相关方向

✓ 快速检测

识别扭曲相关系数的因素

  1. 一名研究人员仅测试了数学考试得分80%以上的学生,发现学习时长与考试分数之间几乎没有相关性。最可能的原因是什么?

    • 取值范围受限

    • 因果关系

    • 完全相关

    • 非线性趋势

    显示答案
    Restricted range

    将样本限制在全数据范围的狭窄子集内会降低观测到的相关强度

4. 相关性与因果关系★★★☆☆⏱ 3 min

即使r值为0.99,也不能证明x的变化会导致y的变化。这种关联可能由第三个混淆变量驱动,也可能完全是巧合。

📐 例题

美国年度冰淇淋销量与年度溺水死亡人数的相关系数为r=0.9,是非常强的正相关。解释为什么这不是因果关系。

  1. 1

    冰淇淋销量不会导致溺水,溺水死亡人数也不会导致冰淇淋销量上升

  2. 2

    隐藏的混淆变量是室外平均温度:天气温暖时更多人购买冰淇淋、同时更多人游泳,导致两个指标同时上升

5. 常见陷阱

错误做法:

声称强r值证明一个变量导致另一个变量变化

原因:

相关性仅度量线性关联,不提供任何因果方向的证据

正确做法:

明确说明“仅从观测数据中无法得出因果结论”

错误做法:

使用r描述非线性关系

原因:

r仅量化线性趋势,因此会严重低估曲线关联的强度

正确做法:

在计算或解读r之前务必先检查散点图

错误做法:

将r报告为百分比(例如声称r=0.8意味着80%相关)

原因:

r是标准化的无量纲值,不是比例或百分比

正确做法:

将r描述为线性关联的强度和方向的度量,不要转换为百分比

错误做法:

忽略会将r大幅推向1或-1的异常值

原因:

单个极端点可以在原本不相关的数据中制造出虚假的强相关性

正确做法:

标记异常值,同时报告包含和不包含异常值的r值,保证完全透明

错误做法:

假设r=0意味着变量之间不存在任何关系

原因:

r=0仅意味着不存在线性关系,完美的曲线关系的r值也可以恰好为0

正确做法:

用散点图验证r=0的结果,排除非线性模式

6. 速查表

属性

AP考试规则

需要避免的错误

r的取值范围

始终介于-1和1之间(包含端点)

声称r > 1 或 r < -1

解读表述要求

明确说明方向、强度和线性特征

在描述中忘记提及“线性”

因果关系规则

观测数据不允许得出因果结论

在自由问答题作答中声称“X导致Y”

异常值的影响

异常值可以大幅改变r的取值

将r视为不受单个点影响的固定值

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2023 · Paper 1

    r解读相关的选择题

  • 2022 · Paper 2 FRQ

    线性数据的r计算

  • 2021 · Paper 1

    相关性与因果关系辨析

下一步

掌握相关性是学习简单线性回归的关键基础,简单线性回归是本单元的下一个核心主题。你将学习如何使用相关系数计算最小二乘回归直线的斜率和截距,解读决定系数R²作为模型可解释变异占比的含义,以及评估残差以检查线性模型是否适用于你的数据。几乎所有聚焦双变量数据的AP统计学自由问答题都会考察这些技能,因此现在巩固你对r的理解,能避免之后处理更复杂的回归计算时犯下代价高昂的错误。