# 斯皮尔曼等级相关系数

> IB 数学应用与解读 SL · IB 数学 AI SL
> 来源: https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-spearman-s-rank-correlation-coefficient/

本模块涵盖斯皮尔曼等级相关系数的定义、分步计算、同分等级调整、解读以及其在非线性双变量数据场景下的考试应用。

**先修:** [皮尔逊积矩相关系数](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-pearson-correlation/); [双变量数据与散点图](https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-bivariate-scatterplots/)

## 学习目标

- 计算存在同分等级和不存在同分等级的双变量数据的斯皮尔曼等级相关系数
- 解读$r_s$值以评估单调关联的强度和方向
- 区分斯皮尔曼等级相关系数与皮尔逊积矩相关系数
- 将该方法应用于考试风格的双变量数据集，以获得全部步骤分数

## 斯皮尔曼等级相关的核心定义与用途

斯皮尔曼等级相关系数是一种非参数关联度量，它将原始数据值转换为等级，消除了变量之间必须存在线性关系的要求。它非常适用于预期存在一致上升或下降趋势，但并非完美直线的数据集。

**斯皮尔曼等级相关系数** — 取值在-1到+1之间的统计值，用于量化两个已排序双变量变量之间单调关联的强度和方向

*记法:* $r_s$

*例:* $r_s$值为0.92表示强正趋势，即一个变量的较高值几乎总是对应另一个变量的较高值

> **info**
>
> 与皮尔逊的r不同，斯皮尔曼的$r_s$不要求数据服从正态分布，因此适用于有序调查数据和偏态数据集。

**例题:** 判断以下哪个数据集更适合使用斯皮尔曼等级相关：A) 20名青少年的身高和体重，B) 15件商品的客户满意度评分（1-5分）与产品价格

1. 评估数据集A：身高和体重通常具有近似线性关系，因此皮尔逊r是合适的选择
2. 评估数据集B：满意度评分为有序数据，且其与价格的关系不一定是线性的，因此斯皮尔曼等级相关是正确选择

## 无同分等级的分步计算方法

$$r_s = 1 - \frac{6\sum d_i^2}{n(n^2 - 1)}$$

1. 将所有x值从1（最小值）到n（最大值）排序赋值等级
2. 将所有对应的y值从1到n排序赋值等级
3. 计算每对配对观测的x等级与y等级之差$d_i$
4. 将每个$d_i$值平方得到$d_i^2$
5. 对所有$d_i^2$值求和得到$\sum d_i^2$
6. 将求和结果代入标准斯皮尔曼等级相关公式，得到$r_s$

**例题:** 计算以下4组配对数据的$r_s$：(2,5), (4,7), (6,10), (8,9)

1. 为x值赋值等级：2=1, 4=2, 6=3, 8=4
2. 为y值赋值等级：5=1,7=2,9=3,10=4
3. 计算$d_i$值：1-1=0, 2-2=0, 3-4=-1, 4-3=1
4. 计算$d_i^2$值：0, 0, 1, 1。求和结果为2
5. 代入公式：$r_s = 1 - \frac{6 \times 2}{4(16-1)} = 1 - \frac{12}{60} = 0.8$

**概念自测**

1. 当n=5时，$\sum d_i^2$的最大可能值是多少？

   *解析:* 最大值出现在等级完全反转的情况下，平方和为16+9+4+1+0？不对，n=5反转等级时，$d_i$值为4,2,0,-2,-4，平方和为16+4+0+4+16=40，结果正确。

*计算器:* allowed

## 数据集中同分等级的调整方法

当两个或多个数据点数值完全相同时，不能为它们分配不同的等级。相反，你需要为这些同分数据点分配它们所占据的所有等级位置的平均值。例如，两个同分数据点位于第3和第4位，两者的等级都为3.5。

> **考试提示**
>
> IB考试评分标准允许在同分数量较少时直接使用标准简化公式，只要你正确为同分条目分配平均等级即可。在AI SL评估中，你不需要使用复杂的调整后斯皮尔曼公式。

**例题:** 为以下x值赋值等级：[12, 15, 15, 18]

1. 最小值12位于第1位，因此等级为1
2. 两个15值位于第2和第3位，两者的平均等级为(2+3)/2=2.5
3. 最大值18位于第4位，因此等级为4

## 结果解读与和皮尔逊r的对比

**考试命令词**

IB考试的相关性题目使用特定的指令术语，评分要求清晰明确：

- **Describe the correlation** — 同时说明关联的方向（正/负）和强度（强/中等/弱）

- **Compare Spearman's and Pearson's coefficients** — 明确指出斯皮尔曼系数度量单调关联，而皮尔逊系数度量线性关联

**方法对比**

- **斯皮尔曼等级相关$r_s$** — 使用排序后的数据，适用于非线性趋势，适合有序数据和偏态数据
  - 优点: 对异常值稳健，无正态分布假设
  - 缺点: 无法度量线性关系的强度

- **皮尔逊$r$** — 使用原始连续数据，仅度量线性关联
  - 优点: 对于线性数据集精度更高
  - 缺点: 对异常值敏感，要求数据服从正态分布

## 常见错误

- **错误做法:** 对非线性单调数据使用皮尔逊r公式而非斯皮尔曼等级相关
  - 原因: 对于非线性趋势，皮尔逊r会低估关联的真实强度
  - 正确做法: 当你仅预期存在一致的上升/下降趋势而非直线关系时，使用斯皮尔曼等级相关
- **错误做法:** 为同分数据点分配不同的等级
  - 原因: 会生成异常大的$d_i$值，导致最终$r_s$结果错误
  - 正确做法: 为所有同分条目分配它们所占据的全部等级位置的平均值
- **错误做法:** 过早将中间$d_i^2$值四舍五入到1位小数
  - 原因: 累积的舍入误差会使你的最终$r_s$超出评分允许的范围
  - 正确做法: 在计算出最终$r_s$之前，所有中间值都不要进行舍入
- **错误做法:** 声称$r_s=1$证明存在完美线性关系
  - 原因: 斯皮尔曼的$r_s$仅度量完美单调关联，不要求线性
  - 正确做法: 说明$r_s=1$表示一个变量随另一个变量增大而严格增大，与趋势的形状无关
- **错误做法:** 对少于5组配对观测的数据应用斯皮尔曼等级相关
  - 原因: 相关系数会对随机波动极其敏感，不具备统计意义
  - 正确做法: 在进行计算前确认你至少有6组配对数据点

## 速查表

| 步骤 | 无同分等级操作 | 有同分等级操作 | 解读规则 |
| --- | --- | --- | --- |
| 1 | 将x值从1排序到n赋值等级 | 为同分x值分配平均等级 | $r_s=1$ = 完美正单调关联 |
| 2 | 将y值从1排序到n赋值等级 | 为同分y值分配平均等级 | $r_s=0$ = 无单调关联 |
| 3 | 计算$d_i = rank(x_i) - rank(y_i)$ | 使用调整后的等级计算$d_i$ | $r_s=-1$ = 完美负单调关联 |
| 4 | 对所有$d_i^2$值求和 | 对调整后的$d_i^2$值求和 | 0.7 < $\|r_s\|$ ≤ 1 表示强相关 |

## 下一步

现在你已经掌握了斯皮尔曼等级相关系数，可以将这项非参数技能应用于各类考试场景，从有序调查数据到偏态环境测量数据。该考点在Paper 1和Paper 2中都经常出现，请确保你练习完整的计算流程，不要跳过步骤以免丢失步骤分数。接下来你将在相关性的基础上学习线性回归，它可以为已确认存在线性关联的双变量数据集构建预测模型。你还将探索假设检验，以验证观测到的相关值是否具有统计显著性，而非由随机因素导致。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-ai-sl-u4-spearman-s-rank-correlation-coefficient/
