学习指南

抽样与估计

数学· 25 分钟阅读

1. 核心抽样术语★★☆☆☆⏱ 5 min

CIE所有抽样相关考题都从识别总体参数和样本统计量的区别开始。参数描述完整总体的固定、通常未知的特征,而统计量是从样本数据计算得到的、用于估计该参数的值。

📘 定义

无偏估计量

对于总体参数,若估计量的期望值等于该参数的真实值,则称其为无偏估计量。

例:

样本均值始终是总体均值的无偏估计量。

📐 例题

一名研究人员计算50名随机选取的12年级学生的平均身高,以估计全国所有12年级学生的平均身高。请指出该场景中的参数和统计量。

  1. 1

    步骤1:定位全部感兴趣的群体

  2. 2

    总体是全国所有12年级学生,因此参数是该完整总体的真实平均身高。

  3. 3

    步骤2:定位从子集计算得到的值

  4. 4

    样本是被选中的50名学生,因此统计量是从这50名学生计算得到的平均身高。

2. 常见抽样方法★★★☆☆⏱ 7 min

CIE考试经常要求你比较4种核心抽样方法:简单随机抽样、分层抽样、系统抽样和配额抽样。你需要能够描述每种方法,说出一个优点和一个缺点,并为给定场景选择最合适的方法。

方法对比

所需抽样方法的并列对比:

简单随机抽样

每个大小为n的可能样本都有相等的被选中概率

+ 优点: 无偏,统计上易于证明合理性

− 缺点: 需要完整抽样框,可能过度代表小的子群体

分层抽样

总体被划分为不同的子群体(层),从每个层中按层大小的比例随机抽取样本

+ 优点: 减少抽样误差,代表所有子群体

− 缺点: 需要预先知道所有总体成员的层归属信息

系统抽样

从抽样框中每隔k个成员选取一个,起始点为1到k之间的随机整数

+ 优点: 在实地工作中快速且易于执行

− 缺点: 如果总体存在与间隔k匹配的周期性模式则会产生偏差

配额抽样

访谈者选取非随机的参与者以满足预先设定的子群体配额

+ 优点: 成本低,不需要抽样框

− 缺点: 选择偏差风险高,不具备统计随机性

📐 例题

一所学校共有1200名学生(12年级450人,13年级750人),想要抽取40名学生的分层样本用于调查。计算每个年级组需要选取的学生人数。

  1. 1

    步骤1:计算整个总体的抽样比例

  2. 2
    Proportion=Total sample sizeTotal population=401200=130\text{Proportion} = \frac{\text{Total sample size}}{\text{Total population}} = \frac{40}{1200} = \frac{1}{30}
  3. 3

    步骤2:将比例应用到每个层

  4. 4
    Year 12 sample size=450×130=15\text{Year 12 sample size} = 450 \times \frac{1}{30} = 15
  5. 5
    Year 13 sample size=750×130=25\text{Year 13 sample size} = 750 \times \frac{1}{30} = 25
  6. 6

    最终答案:15名12年级学生,25名13年级学生

3. 均值和方差的无偏估计★★★★☆⏱ 8 min

这是本主题中权重最高的子概念,几乎出现在每一份统计学6卷和7卷试卷中。样本均值始终是总体均值的无偏估计,但原始样本方差(除以n)是有偏的,因此你必须使用n-1校正因子。

🔬 推导
目标:

推导无偏样本方差公式

起点:

有偏样本方差

  1. 1

    展开平方差项:

  2. 2

    取期望值:

  3. 3

    为使估计量无偏,除以n-1而非n

结果:

无偏样本方差:

📐 例题

针对样本数据12、15、17、21、25,计算总体均值和方差的无偏估计。

  1. 1

    步骤1:计算x的和与x平方的和

  2. 2
    x=12+15+17+21+25=90\sum x = 12 + 15 + 17 + 21 + 25 = 90
  3. 3
    x2=144+225+289+441+625=1724\sum x^2 = 144 + 225 + 289 + 441 + 625 = 1724
  4. 4

    步骤2:无偏均值估计

  5. 5
    xˉ=905=18\bar{x} = \frac{90}{5} = 18
  6. 6

    步骤3:无偏方差估计,使用n-1=4

  7. 7
    s2=14(17249025)=14(17241620)=26s^2 = \frac{1}{4}\left(1724 - \frac{90^2}{5}\right) = \frac{1}{4}(1724 - 1620) = 26
✓ 快速检测

在继续学习前测试你的理解:

  1. 以下哪个分母可以得到总体方差的无偏估计?

    • n

    • n-1

    • n+1

    • n/2

    显示答案
    n-1

    n-1贝塞尔校正消除了样本方差的偏差。

4. 抽样分布入门★★★★☆⏱ 5 min

统计量的抽样分布是从同一总体中抽取的相同大小样本计算得到的该统计量所有可能值的概率分布。对于大样本n,中心极限定理告诉我们样本均值的抽样分布将近似服从正态分布。

If XN(μ,σ2) then XˉN(μ,σ2n)\text{If } X \sim N(\mu, \sigma^2) \text{ then } \bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)
📐 例题

一个总体的均值为42,方差为18。对于大小为9的样本,求样本均值抽样分布的方差。

  1. 1

    步骤1:应用抽样分布方差规则

  2. 2
    Var(Xˉ)=σ2n=189=2\text{Var}(\bar{X}) = \frac{\sigma^2}{n} = \frac{18}{9} = 2
  3. 3

    最终答案:样本均值的方差为2

5. 常见陷阱

错误做法:

样本方差使用n作为分母而非n-1

原因:

即使所有其他步骤都正确,CIE评分标准也会为此错误扣除2-3分

正确做法:

在方差计算中明确写出n-1项,确认你使用的是无偏估计量

错误做法:

混淆总体参数和样本统计量

原因:

识别类1分题对于混淆这两个术语的情况不给任何部分分

正确做法:

所有总体值用希腊字母标记,所有样本值用拉丁字母标记,以区分二者

错误做法:

在答案中将配额抽样称为「随机抽样」

原因:

配额抽样使用非随机选择,CIE评分标准明确不接受该描述

正确做法:

准确写出要求的抽样方法名称,只有当总体的每个成员都有相等的被选中概率时,才能将该方法标记为随机

错误做法:

计算样本均值概率时忘记将总体方差除以n

原因:

这会得到完全错误的正态分布,导致整个概率计算得0分

正确做法:

在每道题的开头写出完整的抽样分布符号,避免遗漏方差缩放步骤

错误做法:

在求和之前就对分层样本大小取整

原因:

这可能导致总样本大小与要求的值不匹配

正确做法:

先计算所有层的样本大小,然后调整最大的小数值,使总样本大小完全符合要求

6. 速查表

公式

CIE考试要求

总体均值无偏估计

与原始样本均值完全相同

总体方差无偏估计

分母必须为n-1

系统抽样间隔

k必须为正整数

分层层样本大小

四舍五入到最近整数

样本均值的抽样分布

方差除以样本大小n

真题中的出现

AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。

  • 2023 · 7

    无偏方差计算

  • 2022 · 6

    抽样方法比较

  • 2021 · 7

    参数与统计量的识别

下一步

掌握抽样与估计是CIE 9709所有后续推断统计学主题的关键基础,这些内容合计占统计学试卷总分的约30%。你在本课程中学到的无偏方差公式将直接在后续每一道置信区间和假设检验题目中复用。为巩固掌握程度,请先练习识别有偏和无偏估计量的针对性题目,再做结合抽样方法选择和方差计算的完整历年真题。下方链接的模块将直接基于本知识拓展你的统计推断技能。