数据的表示与总结(Edexcel IAL 数学 S1)
数学· 2018 Specification Issue 3, S1 §2.1–§2.4· 25 分钟阅读
1. 解读数据可视化图表以对比分布★★☆☆☆⏱ 5 min
✓ 计算器
考试题目几乎都会提供预先绘制好的图表,因此你的重点是提取关键统计量,结合题目背景对比两个或多个分布。常见图表包括直方图、茎叶图(包括背靠背形式)和箱线图。
箱线图
展示数据集的最小值、下四分位数(Q₁)、中位数(Q₂)、上四分位数(Q₃)和最大值的图表,可清晰呈现数据的离散程度和集中趋势。
下方箱线图展示了学习生物和化学的12年级学生的测试分数(满分100分)。对比两个科目分数的分布特征。
- 1
对比集中趋势:生物科中位数=68,化学科中位数=56,因此生物科的典型分数高出12分。
- 2
对比离散程度:生物科四分位距=72 - 58 = 14,化学科四分位距=62 - 43 = 19,因此生物科分数的差异更小。
- 3
对比极差:生物科全距=88 - 32 = 56,化学科全距=92 - 22 = 70,因此化学科分数的整体分布范围更广。
- 4
结合背景得出结论:总体而言,本次测试中学生的生物成绩更好,且分数比化学科更稳定。
Exam tip:
对比分布时务必结合题目背景,不能只给出数值,才能拿到全部分数。
2. 位置度量与数据编码★★★☆☆⏱ 7 min
✓ 计算器
位置度量描述数据集的中心值或典型值。你需要针对未分组和分组的离散/连续数据计算这些统计量,并使用编码简化复杂计算。
编码
对原始数据进行的线性变换,其中和是选定的常数,用于缩小待处理数值的大小。原始均值可通过公式还原。
30名学生的身高( 单位cm)使用进行编码,编码后数据的均值为,计算学生的平均身高。
- 1
变形编码公式,用表示:
- 2
- 3
对编码后数据的均值应用线性变换:
- 4
- 5
学生的平均身高为174 cm。
3. 离散程度度量★★★★☆⏱ 8 min
✓ 计算器
离散程度度量描述数据集中数值的分布范围。你需要计算极差、百分位距、方差和标准差,并对分组数据使用简单插值法计算落在组界之间的百分位数。
样本标准差
样本方差的平方根,衡量数值相对于均值的平均偏差,单位与原始数据一致。对于编码后的数据,。
沿用之前的身高编码数据,已知的标准差为0.82,计算原始身高数据的标准差,单位为cm。
- 1
注意编码只会将标准差乘以除数的绝对值:加减常数不会影响离散程度。
- 2
- 3
代入给定数值(, ):
- 4
- 5
原始身高数据的标准差为8.2 cm。
Exam tip:
计算分组数据的百分位距时,务必使用组界(而非组限)进行插值,避免出错。
4. 偏度与异常值★★★☆☆⏱ 5 min
✓ 计算器
偏度描述分布的不对称性。你需要根据图表或汇总统计量解读偏度,并应用题目中明确给出的异常值规则(不需要记忆默认规则)。
正(右)偏
分布右侧有长尾,满足均值 > 中位数 > 众数。负(左)偏分布左侧有长尾,满足众数 > 中位数 > 均值。
月度薪资数据的分布均值为3200英镑,中位数为2800英镑,众数为2200英镑。指出该分布的偏度类型并给出理由。
- 1
对比众数、中位数和均值的数值:
- 2
- 3
该度量值的对应顺序属于正(右)偏,原因是少数极高薪资将均值拉高至中位数以上。
5. 常见陷阱
错误做法:
仅使用中位数对比分布,未提及离散程度或题目背景
原因:
考题要求2-3个对比点才能拿满分,包括集中趋势、离散程度和结合背景的解读
正确做法:
对比分布时务必同时比较中位数、四分位距/极差,再补充一句结合背景的结论
错误做法:
计算原始均值或标准差时忘记还原编码
原因:
编码后数值经过变换,不能直接将编码后的统计量作为原始数据题目的最终答案
正确做法:
使用计算均值,使用计算标准差,还原原始数值
错误做法:
对分组数据的百分位数插值时使用组限而非组界
原因:
组限是一个组可包含的最小和最大数值,而组界是相邻两组的分界点,使用组限会导致插值结果错误
正确做法:
进行百分位数插值前,务必先将分组数据的组转换为连续组界
错误做法:
未给出规则时自行使用默认异常值判定规则(例如1.5×IQR)
原因:
Edexcel IAL S1考试明确说明所有异常值规则都会在题目中给出,使用未声明的规则会得出错误答案并失分
正确做法:
仅严格按照题目正文中给出的异常值规则进行判定
错误做法:
混淆正偏和负偏,搞反均值、中位数和众数的顺序
原因:
偏度是按长尾的方向命名,而非峰值的位置,很容易记混
正确做法:
记住正偏的长尾在右侧(数值更大的一侧),因此均值被拉高到中位数之上;负偏的长尾在左侧(数值更小的一侧),因此均值被拉低到中位数之下
6. 速查表
概念 | 公式/规则 | 考试注意事项 |
|---|---|---|
均值(未分组数据) | 分组数据使用组中值作为的取值 | |
编码变换() | , | 加减常数不会对标准差产生任何影响 |
四分位距 | 衡量数据中间50%部分的离散程度,不受异常值影响 | |
标准差 | 单位与原始数据一致,方差的单位是原始数据单位的平方 | |
偏度解读 | 众数 < 中位数 < 均值 = 正偏;众数 > 中位数 > 均值 = 负偏 | 偏度按长尾的方向命名 |
异常值 | 仅应用题目中给出的规则 | 除非明确说明,否则不要使用1.5×IQR规则 |
7. 常见问题
S1考试中我需要背诵异常值判定规则吗?
不需要:所有Edexcel IAL S1考试的异常值判定规则都会在题目正文中明确给出,你不需要记忆诸如1.5×IQR这类默认规则。
考试中会要求我绘制直方图或箱线图吗?
直接绘制图表不是考察重点;大多数题目要求你解读或对比给定的图表,或是计算用于构建图表的统计量。
深入阅读
下一步
掌握Edexcel IAL S1数据表示与总结的内容后,你就可以进入下一个核心主题——概率的学习。你学到的分布形状和离散程度相关概念,将直接为后续学习概率分布、相关与回归内容打下基础。请练习该主题的历年真题,提升解题速度和准确率,重点关注要求你进行对比、解读或计算数值的指令词,最大化你的得分。
