统计推断
CIE A-Level 进阶数学· 5 分钟阅读
1. 推断核心概念与术语★★☆☆☆⏱ 15 min
统计推断
仅从总体的较小随机样本收集的数据,得出关于整个总体的一般性结论的过程。
例:
从500名11年级学生的样本估计英格兰所有11年级学生的平均考试分数
参数与统计量
参数是描述整个总体的固定未知数值;统计量是从样本数据计算得到的已知数值,用于估计未知参数。
例:
所有成年男性的真实平均身高(参数)对比100名抽样男性的平均身高(统计量)
一家面包店每天生产2000条面包,抽取40条样本得到平均质量为402.1g,识别该场景中的参数和统计量。
- 1
感兴趣的参数是当日生产的所有2000条面包的真实平均质量,它对于整个总体来说是未知且固定的。
- 2
统计量是40条样本面包的平均质量402.1g,从抽样得到,是已知量,用于估计未知参数。
2. 无偏估计量★★★☆☆⏱ 20 min
✓ 计算器
无偏估计量
对于总体参数,如果统计量的期望等于真实参数,即,则是的无偏估计量。
例:
样本均值始终是总体均值的无偏估计量
证明是总体方差的无偏估计量。
- 1
展开离均差平方和的期望:
- 2
- 3
利用和化简表达式:
- 4
- 5
整理得到的期望:
- 6
- 7
这证明了是的无偏估计量。
3. 置信区间构造★★★☆☆⏱ 25 min
✓ 计算器
置信区间
根据样本数据构造的区间,旨在以指定置信水平(例如95%)捕获真实未知的总体参数。
例:
电池平均寿命的95%置信区间:(11.5小时, 13.5小时)
总体均值,已知:
总体均值,未知,大样本:
总体均值,未知,小样本:
总体比例,大样本:
抽取25个电池样本,平均寿命为12.5小时,样本标准差为2.4小时,构造真实平均寿命的95%置信区间。
- 1
确定适用情况:未知,样本量,因此使用自由度为的t分布。
- 2
查找95%双侧临界值:。
- 3
计算标准误:。
- 4
计算边际误差:。
- 5
最终95%置信区间:小时。
4. 推断结果的解读★★★★☆⏱ 15 min
测试你对解读的理解:
以下哪一项是对95%置信区间的正确解读?
95%的总体数据落在区间内
真实参数落在区间内的概率为95%
95%按此方法构造的区间会包含真实参数
样本统计量95%的时间落在区间内
显示答案
95%按此方法构造的区间会包含真实参数 —正确:置信水平描述的是区间构造方法的长期表现,而非单个区间或参数。
5. 常见陷阱
错误做法:
将95%置信区间解读为'95%的样本数据落在区间内'
原因:
这混淆了样本数据的分布与未知总体参数的不确定范围
正确做法:
95%置信水平描述的是区间构造方法得到包含真实参数的区间的概率
错误做法:
方差未知的小样本使用z临界值而非t临界值
原因:
t分布考虑了估计总体方差带来的额外不确定性,而z分布没有
正确做法:
对于方差未知的小样本,始终使用自由度为的t分布
错误做法:
将离均差平方和除以得到无偏样本方差
原因:
除以会得到向下偏倚的总体方差估计,导致区间错误
正确做法:
除以得到用于推断的无偏样本方差
错误做法:
声称无偏估计量给出的值始终等于真实参数
原因:
无偏性描述的是所有可能样本的期望,而非任意单个样本
正确做法:
单个样本估计几乎总会与真实参数不同,因此我们使用区间估计来量化不确定性
错误做法:
当或时仍使用正态近似构造比例置信区间
原因:
期望计数非常小时正态近似不成立,会导致区间不准确
正确做法:
使用正态近似前,始终检查和都不小于5
6. 速查表
参数 | 条件 | 置信区间公式 |
|---|---|---|
总体均值 | 已知,任意 | |
总体均值 | 未知,大 | |
总体均值 | 未知,小 | |
总体比例 | 大, |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2022 · 2
无偏估计量与置信区间
- 2023 · 1
解读95%置信区间
- 2024 · 2
构造总体比例的置信区间
下一步
统计推断是假设检验的基础,假设检验是CIE A-Level进阶概率与统计的下一个核心主题。你在这里学到的无偏估计量、抽样变异和区间估计概念,是你接下来遇到的所有假设检验方法的基础。它们帮助你理解假设检验为什么有效,p值如何量化针对原假设的证据,以及如何对未知总体参数得出有效结论。掌握推断基础后,你就可以学习单样本、双样本的均值、比例以及总体参数差的检验,这些内容占9231试卷分数的很大比例。正确解读推断也能帮助你避免考试中常见的丢分错误。
