# 变量

> AP 统计学 · AP 统计
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u10-variables/

本模块覆盖AP统计中完整的变量分类体系，包括分类/数值变量划分、解释/响应变量角色区分、四大测量层级，配套符合考试要求的练习，避免自由问答题失分。

**先修:** [AP统计学数据收集流程的基础概述](https://www.owlsprep.com/zh/study/ap-statistics-u10-intro-to-data-collection/)

## 学习目标

- 零分类误差地区分分类变量与数值变量
- 在任意研究设计场景中正确识别解释变量与响应变量
- 按照四大标准测量层级对变量进行分类
- 使变量识别类答案符合美国大学理事会AP考试评分准则要求

## 核心分类：分类变量与数值变量

AP统计学中所有变量的第一类也是最重要的划分就是分类变量与数值变量。该分类决定了后续所有分析步骤，包括你可以绘制的图表类型，以及课程后期需要选用的推断检验方法。

**分类变量与数值变量** — 分类变量将个体划分到独立标签分组中，数值变量记录可进行求和、求平均等有意义算术运算的数值测量或计数结果。

**例题:** 将以下四个变量分类为分类变量或数值变量：1）学生SAT总分，2）学生眼睛颜色，3）高中高年级学生选修的AP课程数量，4）学生居住邮政编码。

1. 步骤1：评估SAT分数。它是满分1600的数值测量值，对多名学生的分数求平均可以得到有意义的结果，因此属于数值变量。
2. 步骤2：评估眼睛颜色。它的取值为蓝色、棕色、绿色等代表独立分组的类别，没有数值含义，因此属于分类变量。
3. 步骤3：评估AP课程数量。它是课程的计数值，对其求和或求平均有实际意义，因此属于数值变量。
4. 步骤4：评估邮政编码。尽管它以数字形式书写，对邮政编码求平均无法得到任何有效信息，因此属于分类变量。

**概念自测**

1. 以下哪一项属于数值变量？

   - 汽车型号
   - 单位英里燃油消耗量
   - 汽车颜色
   - 车辆牌照号码

   *解析:* 燃油消耗量是可测量的数值，对其求平均可以得到有意义的结果。

> **考试提示:** AP评分准则要求你必须先明确写出变量名称再进行分类，仅单独标注“分类变量”且没有给出依据无法获得全部分数。

## 解释变量与响应变量的角色

在研究设计场景下，变量会按照功能角色进一步划分。解释变量是预测变量，响应变量是你为检验变量间关联而测量的结果变量。

**解释变量与响应变量** — 解释变量（自变量）被假设为会导致或预测响应变量（因变量）发生变化，响应变量是研究中核心关注的结果。

**例题:** 一项营养学研究测试餐食中的膳食纤维克数是否可以预测用餐者进食30分钟后的饱腹感评分，请识别该研究中的解释变量与响应变量。

1. 步骤1：识别用于预测的变量。餐食中的膳食纤维克数是研究人员作为预测因子调整或测量的因素，因此属于解释变量。
2. 步骤2：识别被测量的结果。进食30分钟后的饱腹感评分是研究人员想要验证的结果，因此属于响应变量。

> **tip**
>
> 在AP自由问答题中将解释变量与响应变量写反平均会导致每道题被扣2-3分，这说明你没有理解研究的核心设计逻辑。

## 测量层级：NOIR分类法

变量可以按照其取值承载的信息量从低到高进一步划分为四大测量层级：定类、定序、定距、定比。

> **mnemonic**
>
> 使用助记词NOIR（法语中“黑色”的含义）记忆从最低信息量到最高信息量的层级顺序：Nominal（定类）、Ordinal（定序）、Interval（定距）、Ratio（定比）。

| 测量层级 | 核心特征 |
| --- | --- |
| 定类 | 无顺序的独立类别，不存在等级排序 |
| 定序 | 独立类别具备清晰且有意义的等级排序 |
| 定距 | 不同取值间间隔相等，不存在真正的零点 |
| 定比 | 不同取值间间隔相等，存在真正的零点，取值为0代表对应数量完全不存在 |

**例题:** 将以下每个变量按照其对应的最高测量层级分类：1）电影1-5星评分，2）摄氏度温度，3）出生国家，4）以美元为单位的家庭年收入。

1. 步骤1：1-5星评分具备清晰的等级排序，但2星到3星的间隔与4星到5星的间隔并不完全相等，因此属于定序层级。
2. 步骤2：摄氏度温度每一度的间隔相等，但0摄氏度不代表完全不存在热量，因此属于定距层级。
3. 步骤3：出生国家是无顺序的类别，因此属于定类层级。
4. 步骤4：年收入每1美元的间隔相等，且真正的零点0美元代表完全没有收入，因此属于定比层级。

## AP考试变量类题目答题表述规范

**考试命令词**

AP统计学变量类题目使用特定的指令术语，对应严格的评分准则要求：

- **Classify the variable** — 你必须同时说明变量的核心类型（分类/数值）和测量层级才能获得全部分数

- **Identify the roles of the variables** — 你必须明确标注哪个变量是解释变量、哪个是响应变量，不能使用模糊描述

- **Justify your classification** — 你必须给出选择的一条具体理由，不能仅重复变量名称

## 常见错误

- **错误做法:** 将所有定序变量归类为定类变量
  - 原因: 你忽略了不同类别取值之间存在的有意义等级排序，这是定序变量的核心区分特征
  - 正确做法: 在将变量判定为定类层级之前，先检查所有类别是否可以按照逻辑顺序排序
- **错误做法:** 将所有数值形式的变量都判定为数值变量
  - 原因: 邮政编码、电话号码这类数值标签并不代表测量结果，对其进行算术运算没有实际意义
  - 正确做法: 在将变量归类为数值变量之前，先验证对其所有取值求平均是否可以得到有实际用途的结果
- **错误做法:** 将解释变量与响应变量写反
  - 原因: 你没有参考研究中明确陈述的假设，错误地将结果变量当成了预测变量
  - 正确做法: 通过提问“哪一个变量被用来预测另一个变量”来正确分配二者的角色
- **错误做法:** 将摄氏度或华氏度温度归类为定比变量
  - 原因: 你忘记了定比层级要求存在真正的零点，取值为0代表被测量的数量完全不存在
  - 正确做法: 在将变量判定为定比层级之前，先确认它存在真正的零点
- **错误做法:** 列出单个数据点而非变量本身
  - 原因: 你误读了题干要求，题干需要的是所有个体之间存在差异的特征，而非单个观测值
  - 正确做法: 将变量表述为数据集中不同研究对象可以取不同值的属性

## 速查表

| 变量类别 | 核心特征 | AP考试常见示例 |
| --- | --- | --- |
| 分类变量 | 分组标签，算术运算无意义 | 性别、邮政编码、笔记本电脑品牌 |
| 数值变量 | 数值型计数/测量结果 | 身高、考试分数、月租金 |
| 解释变量 | 预测变量/自变量 | 学习时长、药物剂量 |
| 响应变量 | 结果变量/因变量 | 考试分数、患者血压 |
| 定类 | 无顺序类别 | 大学专业、家乡 |
| 定序 | 带等级排序的类别 | 用户满意度、字母等级 |
| 定距 | 间隔相等，无真正零点 | 温度（摄氏度/华氏度）、IQ分数 |
| 定比 | 间隔相等，存在真正零点 | 任务完成时长、年收入 |

## 下一步

掌握变量分类是后续所有AP统计学单元的基础，从设计观测研究和实验，到课程后期选择正确的假设检验方法都需要用到该知识点。将分类变量误判为数值变量会导致你选择错误的推断方法，在整道自由问答题中最多被扣10分。完成本模块后，你将可以进一步学习单变量数据的图形表示方法，以及区分不同类型的数据收集方法。这些知识点几乎在每一套AP统计试卷中都会出现，因此你需要确保可以在10秒内完成任意变量的分类，为后续更复杂的计算类题目留出充足时间。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u10-variables/
