# 相关性

> AP 统计学 · AP 2024-2026 统计学教学大纲
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u14-correlation/

本模块涵盖皮尔逊相关系数的计算、解读、会扭曲r值的因素，以及相关性与因果关系的关键区分，完全符合AP统计学评分标准。

**先修:** [散点图的绘制与解读](https://www.owlsprep.com/zh/study/ap-statistics-u14-scatterplots/); [定量变量的基础描述性统计](https://www.owlsprep.com/zh/study/ap-statistics-u11-quantitative-descriptive-stats/)

## 学习目标

- 计算并解读双变量定量数据的皮尔逊相关系数r
- 区分相关性与因果关系，避免无效的因果推断
- 识别异常值、非线性关系和取值范围受限对r值的影响
- 将散点图模式与介于-1和1之间的近似r值相匹配

## 定义皮尔逊相关系数

皮尔逊r值是一种标准化指标，它消除了两个变量的单位，因此改变x或y的尺度（例如将英寸转换为厘米）永远不会改变r的取值。

**皮尔逊相关系数** — 取值严格介于-1和1之间的无量纲值，用于衡量两个定量变量之间线性关系的强度和方向

*记法:* r

*例:* r=0.9表示强正线性关联，r=-0.7表示中等强度的负线性关联

$$r = \frac{1}{n-1} \sum_{i=1}^{n} \left( \frac{x_i - \bar{x}}{s_x} \right) \left( \frac{y_i - \bar{y}}{s_y} \right)$$

**例题:** 为以下3个数据点计算r值：(1, 2), (2, 4), (3, 5)

1. 首先计算x和y的均值与标准差：$\bar{x}=2$, $s_x=1$, $\bar{y}=11/3 \approx 3.67$, $s_y \approx 1.53$
2. 将每个x和y值转换为z分数：x的z分数 = [-1, 0, 1]，y的z分数 = [-1.09, 0.22, 0.87]
3. 将配对的z分数相乘、求和后除以n-1：$r = \frac{(-1*-1.09)+(0*0.22)+(1*0.87)}{2} = 0.98$

**概念自测**

测试你对r的性质的理解

1. r的最大可能取值是多少？

   - 1
   - 100
   - 无穷大
   - 0

   *解析:* r永远不能超过1，也不能小于-1

## 从散点图解读r值

**考试命令词**

AP考试的自由问答题针对相关性题目使用特定的指令术语，有严格的评分要求：

- **Describe the association** — 你必须明确说明方向、强度、线性特征以及所有异常值才能获得满分

- **Interpret r** — 你不能提及因果关系，且必须明确说明它度量的是*线性*关联

| r取值范围 | 关联强度 | 典型散点图模式 |
| --- | --- | --- |
| 0.7 到 1.0 | 强正相关 | 点紧密聚集在向上倾斜的直线周围 |
| 0.3 到 0.7 | 中等正相关 | 点松散聚集在向上倾斜的直线周围 |
| -0.3 到 0.3 | 极弱或无关联 | 点随机散布，没有明显趋势 |
| -0.7 到 -0.3 | 中等负相关 | 点松散聚集在向下倾斜的直线周围 |
| -1.0 到 -0.7 | 强负相关 | 点紧密聚集在向下倾斜的直线周围 |

**例题:** 将4张散点图与r值匹配：-0.9、0.2、0.7、-0.4

1. 散点图1（紧密向下直线）= -0.9
2. 散点图2（随机无趋势）= 0.2
3. 散点图3（松散向上直线）= 0.7
4. 散点图4（非常松散向下直线）= -0.4

> **考试提示:** AP阅卷者会扣分，如果你在描述r的度量对象时忘记加上“线性”一词

## 会扭曲相关系数取值的因素

> **关键前置检查**
>
> r对异常值、取值范围受限和非线性趋势极其敏感，如果不先检查散点图，可能会得到具有误导性的r值

**例题:** 展示添加单个异常点(10, 10)如何改变我们之前计算的3点数据集的r值（原r=0.98）

1. 原始3个点：(1,2), (2,4), (3,5)，r=0.98
2. 添加异常点(10, 10)，新的n=4
3. 重新计算r：新r ≈ 0.97，如果异常点符合现有趋势，变化可以忽略不计
4. 如果我们改为添加异常点(10, 0)，新r会下降到≈-0.3，完全反转观测到的相关方向

**概念自测**

识别扭曲相关系数的因素

1. 一名研究人员仅测试了数学考试得分80%以上的学生，发现学习时长与考试分数之间几乎没有相关性。最可能的原因是什么？

   - 取值范围受限
   - 因果关系
   - 完全相关
   - 非线性趋势

   *解析:* 将样本限制在全数据范围的狭窄子集内会降低观测到的相关强度

## 相关性与因果关系

即使r值为0.99，也不能证明x的变化会导致y的变化。这种关联可能由第三个混淆变量驱动，也可能完全是巧合。

**例题:** 美国年度冰淇淋销量与年度溺水死亡人数的相关系数为r=0.9，是非常强的正相关。解释为什么这不是因果关系。

1. 冰淇淋销量不会导致溺水，溺水死亡人数也不会导致冰淇淋销量上升
2. 隐藏的混淆变量是室外平均温度：天气温暖时更多人购买冰淇淋、同时更多人游泳，导致两个指标同时上升

> **tip**
>
> 唯一能可靠建立两个变量之间因果关系的方法是开展设计完善的随机对照实验，而不是在观测数据中观察相关性

## 常见错误

- **错误做法:** 声称强r值证明一个变量导致另一个变量变化
  - 原因: 相关性仅度量线性关联，不提供任何因果方向的证据
  - 正确做法: 明确说明“仅从观测数据中无法得出因果结论”
- **错误做法:** 使用r描述非线性关系
  - 原因: r仅量化线性趋势，因此会严重低估曲线关联的强度
  - 正确做法: 在计算或解读r之前务必先检查散点图
- **错误做法:** 将r报告为百分比（例如声称r=0.8意味着80%相关）
  - 原因: r是标准化的无量纲值，不是比例或百分比
  - 正确做法: 将r描述为线性关联的强度和方向的度量，不要转换为百分比
- **错误做法:** 忽略会将r大幅推向1或-1的异常值
  - 原因: 单个极端点可以在原本不相关的数据中制造出虚假的强相关性
  - 正确做法: 标记异常值，同时报告包含和不包含异常值的r值，保证完全透明
- **错误做法:** 假设r=0意味着变量之间不存在任何关系
  - 原因: r=0仅意味着不存在线性关系，完美的曲线关系的r值也可以恰好为0
  - 正确做法: 用散点图验证r=0的结果，排除非线性模式

## 速查表

| 属性 | AP考试规则 | 需要避免的错误 |
| --- | --- | --- |
| r的取值范围 | 始终介于-1和1之间（包含端点） | 声称r > 1 或 r < -1 |
| 解读表述要求 | 明确说明方向、强度和线性特征 | 在描述中忘记提及“线性” |
| 因果关系规则 | 观测数据不允许得出因果结论 | 在自由问答题作答中声称“X导致Y” |
| 异常值的影响 | 异常值可以大幅改变r的取值 | 将r视为不受单个点影响的固定值 |

## 下一步

掌握相关性是学习简单线性回归的关键基础，简单线性回归是本单元的下一个核心主题。你将学习如何使用相关系数计算最小二乘回归直线的斜率和截距，解读决定系数R²作为模型可解释变异占比的含义，以及评估残差以检查线性模型是否适用于你的数据。几乎所有聚焦双变量数据的AP统计学自由问答题都会考察这些技能，因此现在巩固你对r的理解，能避免之后处理更复杂的回归计算时犯下代价高昂的错误。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u14-correlation/
