描述统计:集中趋势与离散程度度量
IB 数学:应用与解释 HL· 30 分钟阅读
1. 集中趋势(中心)度量★☆☆☆☆⏱ 8 min
集中趋势度量
描述一组数值数据中心位置的单个统计量,也称为集中趋势度量
例:
班级学生的平均身高就是一个集中趋势度量
描述统计中常用三种集中趋势度量,每种适用于不同场景:
均值:所有数据值的算术平均值,计算方式为所有值的总和除以值的数量。
中位数:有序数据集中的中间值,一半数据在它上方,一半在它下方。
众数:数据集中出现频率最高的值,既可用于分类数据也可用于数值数据。
一家小咖啡馆记录了6小时内每小时的顾客数:[12, 8, 15, 10, 8, 14]。计算均值、中位数和众数。
- 1
步骤1:计算均值,将所有值相加后除以观测值数量:
- 2
- 3
步骤2:将数据集从小到大排序:
- 4
- 5
步骤3:当观测值数量为偶数时,中位数是两个中间值的平均值:
- 6
- 7
步骤4:众数是出现频率最高的值:
- 8
众数 = 8名顾客
2. 离散程度(离散)度量★★☆☆☆⏱ 10 min
离散程度度量
描述数据点之间以及数据点与分布中心之间距离的统计量
例:
考试分数的标准差可以告诉你分数在平均值周围的波动程度
常用的离散程度度量可以量化数据集的变异程度:
极差:最大值与最小值的差,计算简单但对异常值非常敏感。
四分位距(IQR):第三四分位数(Q3,即第75百分位数)与第一四分位数(Q1,即第25百分位数)的差,对异常值不敏感。
方差:各数据与均值离差平方的平均值。
标准差:方差的平方根,单位与原始数据相同。
对于有序顾客数据集[8, 8, 10, 12, 14, 15],计算四分位距和样本标准差。
- 1
步骤1:找到四分位数:Q1是下半部分的中位数,Q3是上半部分的中位数:
- 2
- 3
步骤2:计算IQR = Q3 - Q1:
- 4
- 5
步骤3:使用样本标准差公式,样本均值:
- 6
- 7
步骤4:计算离差平方和,除以,再取平方根:
- 8
Exam tip:
务必检查题目要求的是总体标准差还是样本标准差——如果GDC输出错误会被扣分。
3. 选择合适的度量★★☆☆☆⏱ 7 min
选择哪种度量完全取决于分布的形状以及是否存在异常值。
一家公司有5名员工,年薪(单位:千美元)为:[45, 48, 52, 55, 250]。哪种集中趋势度量最适合描述员工的典型薪资?
- 1
步骤1:识别出250是极端异常值,说明分布严重右偏。
- 2
步骤2:计算均值和中位数进行比较:
- 3
- 4
步骤3:均值被异常值拉高到90000美元,高于5份薪资中的4份。中位数为52000美元,更接近典型薪资,因此它是合适的度量。
4. 线性变换的影响★★★☆☆⏱ 5 min
当你对所有数据点应用形如的线性变换时(例如将单位从厘米转换为英寸),集中趋势和离散程度度量会以可预测的方式变化:
给所有值加上常数:所有集中趋势度量都增加,不会改变任何离散程度度量。
给所有值乘以正常数:所有集中趋势度量都乘以,所有离散程度度量都乘以,方差乘以。
一个长度数据集的均值为25厘米,标准差为3厘米。转换为英寸(1英寸 = 2.54厘米)后,求新的均值和标准差。
- 1
步骤1:变换公式为,因此。
- 2
步骤2:新均值等于原均值乘以:
- 3
- 4
步骤3:新标准差等于原标准差乘以:
- 5
5. 常见陷阱
错误做法:
在GDC输出中混淆总体标准差和样本标准差
原因:
大多数图形计算器会用不同符号输出两个值,考试要求根据上下文给出正确值
正确做法:
检查题目:如果处理的是样本(AI HL中大多数情况都是),使用;如果处理的是完整总体,使用
错误做法:
对存在异常值的严重偏斜数据使用均值和标准差
原因:
异常值会将均值拉离数据的真实中心,导致对典型值的描述产生误导
正确做法:
先检查偏度和异常值:如果存在,改用中位数和四分位距
错误做法:
从未排序的数据集中计算中位数
原因:
中位数被定义为排序数据的中间值,因此取未排序数据的中间值几乎总是错误的
正确做法:
计算中位数或四分位数前,务必将数据集从小到大排序
错误做法:
混淆极差和四分位距
原因:
许多学生错误地将IQR计算为最大值减最小值,这其实是极差
正确做法:
IQR是Q3减Q1,它衡量的是数据中间50%的离散程度
错误做法:
认为给所有数据加上常数会改变离散程度
原因:
学生通常认为加上常数会同时改变集中趋势和离散程度
正确做法:
加上常数会平等移动所有点,因此点之间的距离(离散程度)保持不变
6. 速查表
度量类型 | 名称 | 最佳适用场景 | 变换 |
|---|---|---|---|
中心 | 均值 | 对称数据,无异常值 | |
中心 | 中位数 | 偏斜数据,存在异常值 | |
中心 | 众数 | 分类数据/双峰数据 | |
离散 | 极差 | 快速粗略估计 | |
离散 | IQR | 偏斜数据,存在异常值 | |
离散 | 标准差 | 对称数据,无异常值 | |
离散 | 方差 | 统计计算 |
7. 常见问题
什么时候应该用中位数代替均值?
当数据严重偏斜或存在极端异常值时使用中位数,因为中位数不受极端值影响,而均值会被异常值拉偏。在这些情况下,中位数能更好地代表典型值。
为什么样本标准差要除以n-1?
除以n-1可以校正在使用样本估计总体方差时的偏差。这种贝塞尔校正能确保你的样本估计值更接近真实的总体值。
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2025 · 1
6分 比较集中趋势与离散程度
- 2024 · 2
4分 数据变换的影响
- 2023 · 1
3分 根据箱线图计算四分位距
下一步
理解集中趋势和离散程度度量是IB AI HL所有后续统计主题的基础。你接下来会用这些概念分析二元数据,在相关性和回归中计算变量的集中趋势和离散程度。之后,你会用这些度量描述概率分布,并用于统计推断,其中抽样分布的集中趋势和离散程度对于构造置信区间和进行假设检验至关重要。
