# 数据的表示与总结（Edexcel IAL 数学 S1）

> 数学 · Edexcel IAL S1
> 来源: https://www.owlsprep.com/zh/study/edexcel-ial-math-s1-representation-and-summary-of-data/

本指南涵盖Edexcel IAL S1中数据表示与总结的全部内容，包括图表解读、位置/离散程度度量、编码、偏度和异常值规则。

**先修:** [基础算术与代数变形](https://www.owlsprep.com/zh/study/edexcel-ial-maths-core-1-algebra-basics/); [熟悉离散和连续数据类型](https://www.owlsprep.com/zh/study/edexcel-ial-maths-s1-data-types/)

## 学习目标

- 解读直方图、茎叶图和箱线图以对比不同分布
- 针对分组和未分组的离散/连续数据计算均值、中位数、众数
- 应用数据编码简化均值和标准差的计算
- 计算方差、标准差、极差和百分位距，包括简单插值法
- 解读偏度并在考题中应用给定的异常值判定规则

## 解读数据可视化图表以对比分布

考试题目几乎都会提供预先绘制好的图表，因此你的重点是提取关键统计量，结合题目背景对比两个或多个分布。常见图表包括直方图、茎叶图（包括背靠背形式）和箱线图。

**箱线图** — 展示数据集的最小值、下四分位数（Q₁）、中位数（Q₂）、上四分位数（Q₃）和最大值的图表，可清晰呈现数据的离散程度和集中趋势。

**例题:** 下方箱线图展示了学习生物和化学的12年级学生的测试分数（满分100分）。对比两个科目分数的分布特征。

1. 对比集中趋势：生物科中位数=68，化学科中位数=56，因此生物科的典型分数高出12分。
2. 对比离散程度：生物科四分位距=72 - 58 = 14，化学科四分位距=62 - 43 = 19，因此生物科分数的差异更小。
3. 对比极差：生物科全距=88 - 32 = 56，化学科全距=92 - 22 = 70，因此化学科分数的整体分布范围更广。
4. 结合背景得出结论：总体而言，本次测试中学生的生物成绩更好，且分数比化学科更稳定。

> **考试提示:** 对比分布时务必结合题目背景，不能只给出数值，才能拿到全部分数。

*计算器:* allowed

## 位置度量与数据编码

位置度量描述数据集的中心值或典型值。你需要针对未分组和分组的离散/连续数据计算这些统计量，并使用编码简化复杂计算。

**编码** — 对原始数据$x$进行的线性变换，其中$a$和$b$是选定的常数，用于缩小待处理数值的大小。原始均值可通过公式$\bar{x} = b\bar{y} + a$还原。

*记法:* y = \frac{x - a}{b}

**例题:** 30名学生的身高（$x$ 单位cm）使用$y = \frac{x - 150}{10}$进行编码，编码后数据的均值为$\bar{y} = 2.4$，计算学生的平均身高。

1. 变形编码公式，用$y$表示$x$：
2. $$x = 10y + 150$$
3. 对编码后数据的均值应用线性变换：
4. $$\bar{x} = 10\bar{y} + 150 = 10(2.4) + 150 = 24 + 150 = 174$$
5. 学生的平均身高为174 cm。

> **tip**
>
> 编码不会改变分布的形状，只会改变数值的位置和尺度，因此编码后偏度保持不变。

*计算器:* allowed

## 离散程度度量

离散程度度量描述数据集中数值的分布范围。你需要计算极差、百分位距、方差和标准差，并对分组数据使用简单插值法计算落在组界之间的百分位数。

**样本标准差** — 样本方差的平方根，衡量数值相对于均值的平均偏差，单位与原始数据一致。对于编码后的数据$y$，$s_x = |b| \times s_y$。

**例题:** 沿用之前的身高编码数据$y = \frac{x - 150}{10}$，已知$y$的标准差为0.82，计算原始身高数据的标准差，单位为cm。

1. 注意编码只会将标准差乘以除数$b$的绝对值：加减常数不会影响离散程度。
2. $$s_x = b \times s_y$$
3. 代入给定数值（$b=10$, $s_y=0.82$）：
4. $$s_x = 10 \times 0.82 = 8.2$$
5. 原始身高数据的标准差为8.2 cm。

> **考试提示:** 计算分组数据的百分位距时，务必使用组界（而非组限）进行插值，避免出错。

*计算器:* allowed

## 偏度与异常值

偏度描述分布的不对称性。你需要根据图表或汇总统计量解读偏度，并应用题目中明确给出的异常值规则（不需要记忆默认规则）。

**正（右）偏** — 分布右侧有长尾，满足均值 > 中位数 > 众数。负（左）偏分布左侧有长尾，满足众数 > 中位数 > 均值。

**例题:** 月度薪资数据的分布均值为3200英镑，中位数为2800英镑，众数为2200英镑。指出该分布的偏度类型并给出理由。

1. 对比众数、中位数和均值的数值：
2. $$2200 < 2800 < 3200 \implies \text{众数} < \text{中位数} < \text{均值}$$
3. 该度量值的对应顺序属于正（右）偏，原因是少数极高薪资将均值拉高至中位数以上。

> **warning**
>
> 除非题目明确说明，否则不要使用1.5×IQR的异常值判定规则。Edexcel IAL S1考试每道题都会给出明确的异常值判定规则。

*计算器:* allowed

## 常见错误

- **错误做法:** 仅使用中位数对比分布，未提及离散程度或题目背景
  - 原因: 考题要求2-3个对比点才能拿满分，包括集中趋势、离散程度和结合背景的解读
  - 正确做法: 对比分布时务必同时比较中位数、四分位距/极差，再补充一句结合背景的结论
- **错误做法:** 计算原始均值或标准差时忘记还原编码
  - 原因: 编码后数值经过变换，不能直接将编码后的统计量作为原始数据题目的最终答案
  - 正确做法: 使用$\bar{x} = b\bar{y} + a$计算均值，使用$s_x = |b|s_y$计算标准差，还原原始数值
- **错误做法:** 对分组数据的百分位数插值时使用组限而非组界
  - 原因: 组限是一个组可包含的最小和最大数值，而组界是相邻两组的分界点，使用组限会导致插值结果错误
  - 正确做法: 进行百分位数插值前，务必先将分组数据的组转换为连续组界
- **错误做法:** 未给出规则时自行使用默认异常值判定规则（例如1.5×IQR）
  - 原因: Edexcel IAL S1考试明确说明所有异常值规则都会在题目中给出，使用未声明的规则会得出错误答案并失分
  - 正确做法: 仅严格按照题目正文中给出的异常值规则进行判定
- **错误做法:** 混淆正偏和负偏，搞反均值、中位数和众数的顺序
  - 原因: 偏度是按长尾的方向命名，而非峰值的位置，很容易记混
  - 正确做法: 记住正偏的长尾在右侧（数值更大的一侧），因此均值被拉高到中位数之上；负偏的长尾在左侧（数值更小的一侧），因此均值被拉低到中位数之下

## 速查表

| 概念 | 公式/规则 | 考试注意事项 |
| --- | --- | --- |
| 均值（未分组数据） | $\bar{x} = \frac{\Sigma x}{n}$ | 分组数据使用组中值作为$x$的取值 |
| 编码变换（$y=\frac{x-a}{b}$） | $\bar{x} = b\bar{y} + a$, $s_x = \|b\|s_y$ | 加减常数$a$不会对标准差产生任何影响 |
| 四分位距 | $Q_3 - Q_1$ | 衡量数据中间50%部分的离散程度，不受异常值影响 |
| 标准差 | $s = \sqrt{\text{方差}}$ | 单位与原始数据一致，方差的单位是原始数据单位的平方 |
| 偏度解读 | 众数 < 中位数 < 均值 = 正偏；众数 > 中位数 > 均值 = 负偏 | 偏度按长尾的方向命名 |
| 异常值 | 仅应用题目中给出的规则 | 除非明确说明，否则不要使用1.5×IQR规则 |

## 下一步

掌握Edexcel IAL S1数据表示与总结的内容后，你就可以进入下一个核心主题——概率的学习。你学到的分布形状和离散程度相关概念，将直接为后续学习概率分布、相关与回归内容打下基础。请练习该主题的历年真题，提升解题速度和准确率，重点关注要求你进行对比、解读或计算数值的指令词，最大化你的得分。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/edexcel-ial-math-s1-representation-and-summary-of-data/
