# 估计量

> AP 统计学 · AP 2024-2027 统计学
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u12-estimators/

本模块讲解点估计量的核心性质、估计量偏差的计算方法，以及如何为总体比例选择最优估计量，内容完全符合AP分类推断的考纲要求。

**先修:** [理解样本比例的抽样分布相关知识](https://www.owlsprep.com/zh/study/ap-statistics-u12-sampling-distributions-proportions/); [能够基本区分总体参数和样本统计量](https://www.owlsprep.com/zh/study/ap-statistics-u11-intro-to-inference/)

## 学习目标

- 定义点估计量并将其与固定的总体参数区分开
- 通过计算期望值验证一个估计量是否无偏
- 利用方差和一致性性质比较不同估计量
- 在AP考试场景下为总体比例选择最优估计量

## 点估计量简介

点估计量是用于近似未知固定总体参数的任意样本统计量。在比例推断中，最常用的估计量是样本比例$\hat{p}$，它用于估计真实的总体比例$p$。从某一个特定样本中计算得到的估计量的单个取值被称为点估计值。

**点估计量** — 基于样本数据生成单个值、用于估计未知固定总体参数$\theta$的函数

*记法:* $\hat{\theta}$ (通用形式)

*例:* 样本比例$\hat{p} = \frac{\text{样本中成功的次数}}{\text{样本量 } n}$是总体比例$p$的标准估计量。

**例题:** 指出以下哪些属于总体比例p的估计量：(A) 固定样本量n，(B) 样本中成功的原始计数X，(C) 样本比例X/n

1. 第一步，排除所有不是随机样本结果的函数、且设计目的不是估计p的取值
2. 样本量n是由研究设计固定的，不是样本结果的函数，因此它不是估计量
3. 原始计数X没有按样本量归一化，无法直接估计p，因此它不是估计量
4. 样本比例X/n是样本数据的函数，设计目的是近似p，因此它是这里唯一有效的估计量

**概念自测**

测试你对估计量定义的基础理解

1. 以下哪一项是总体均值$\mu$的有效估计量？

   - A) 总体标准差$\sigma$
   - B) 样本均值$\bar{x}$
   - C) 固定样本量n

   *解析:* 样本均值由样本数据计算得到，用于估计未知的总体均值，因此它是一个有效的点估计量。

## 估计量的无偏性

如果一个估计量的抽样分布的期望值等于它所估计的总体参数的真实值，那么这个估计量就被定义为无偏的。这意味着，在所有相同大小的随机样本上，该估计量的平均值将完全等于总体参数，不存在系统性的高估或低估。

$$E[\hat{\theta}] = \theta$$

**推导:** 证明样本比例$\hat{p}$是总体比例p的无偏估计量

*起点:* 我们知道二项样本中成功的计数X的期望值为E[X] = np

1. 样本比例的定义为$\hat{p} = X/n$
2. 应用期望的线性性质：$E[\hat{p}] = E[X/n] = \frac{1}{n} E[X]$
3. 代入E[X] = np：$E[\hat{p}] = \frac{1}{n} \times np = p$

*结论:* $\hat{p}$的期望值完全等于p，因此样本比例是总体比例的无偏估计量。

**例题:** 一名学生提出了一个总体比例p的新估计量：$\hat{p}_{adj} = \frac{X+1}{n+2}$。如果真实p为0.3且n=10，计算这个新估计量的偏差。

1. 偏差的定义是$E[\hat{\theta}] - \theta$，因此首先计算$E[\hat{p}_{adj}]$
2. $E[\hat{p}_{adj}] = E\left[\frac{X+1}{n+2}\right] = \frac{E[X] +1}{n+2} = \frac{np +1}{n+2}$
3. 代入n=10, p=0.3：$E[\hat{p}_{adj}] = \frac{10*0.3 +1}{10+2} = \frac{4}{12} \approx 0.333$
4. 计算偏差：$0.333 - 0.3 = 0.033$，因此该估计量存在约0.033的正偏差

**考试命令词**

AP考试题目针对估计量性质使用特定的指令术语，你必须严格遵循要求才能拿到全部分数：

- **Show that the estimator is unbiased** — 你必须显式计算估计量的期望值，并证明它等于目标参数，才能获得全部分数

- **Calculate the bias of this estimator** — 你不需要证明无偏性，只需要计算期望值和真实参数之间的差值即可

## 最小方差与一致性

仅有无偏性不足以让一个估计量成为最优估计量。你还希望估计量的抽样变异性较低，这由其抽样分布的方差衡量。在所有针对某一参数的无偏估计量中，拥有最小可能方差的估计量被称为最小方差无偏估计量（MVUE）。

> **tip**
>
> 对于总体比例p，标准样本比例$\hat{p}$就是MVUE，因此除非另有明确说明，它始终是你在AP推断流程中应该使用的默认估计量。

如果当样本量n趋于无穷大时，估计量任意接近真实参数的概率趋近于1，那么这个估计量就是一致的。所有针对比例的无偏估计量都是一致的，因为增大样本量会减小它们的标准误。

**例题:** 提出了两个p的无偏估计量：估计量A的方差为$\frac{p(1-p)}{n}$，估计量B的方差为$\frac{2p(1-p)}{n}$。哪个估计量更好，为什么？

1. 两个估计量都是无偏的，因此我们比较它们的方差来选择最优的一个
2. 对于任意固定样本量n，估计量A的方差是估计量B的一半
3. 这意味着平均而言，估计量A得到的估计值比估计量B更接近真实的p
4. 因此估计量A是更优的最小方差无偏估计量

## 比例推断中的估计量选择

AP考试中所有针对总体比例的置信区间和假设检验流程都使用样本比例$\hat{p}$作为点估计量。标准推断题永远不会要求你使用其他替代估计量，但你可能会被考察为什么选择$\hat{p}$而不是其他可能的估计量。

> **warning**
>
> 一个常见错误是在计算置信区间的点估计时使用假设值p0，或者在比例假设检验中使用$\hat{p}$计算标准误。这两个值不能互换。

**例题:** 一名研究者调查了200名随机选择的美国成年人，发现其中120人支持一项新的公共卫生政策。真实总体支持比例的正确点估计量是什么？

1. 确定成功的次数X = 120，样本量n = 200
2. 计算样本比例：$\hat{p} = 120 / 200 = 0.6$
3. 该值是真实总体支持比例的无偏最小方差估计量

## 常见错误

- **错误做法:** 声称所有样本统计量都是无偏估计量
  - 原因: 很多常见统计量（例如样本极差、样本标准差s）都是对应总体参数的有偏估计量
  - 正确做法: 只有当你能证明估计量的期望值等于目标参数时，才能确认它是无偏的
- **错误做法:** 选择估计量时优先考虑低方差而非无偏性
  - 原因: 一个方差极低的有偏估计量会系统性地生成错误的估计值，即使它是一致的
  - 正确做法: 首先确认估计量是无偏的，然后选择其中方差最小的那个
- **错误做法:** 混淆点估计值（从单个样本计算得到的单个值）和点估计量（通用公式）
  - 原因: 如果你将某个0.6的样本值称为估计量而非公式X/n，AP阅卷人会扣除分数
  - 正确做法: 将公式标记为估计量，将单个计算得到的数值标记为点估计值
- **错误做法:** 将偏差计算为你的样本点估计值和真实参数之间的差值
  - 原因: 偏差是估计量抽样分布的性质，不是单个样本的结果
  - 正确做法: 偏差的定义是估计量在所有样本上的期望值与真实参数之间的差值

## 速查表

| 性质 | 定义 | 估计量$\hat{p}$（p的估计量）满足的要求 |
| --- | --- | --- |
| 无偏性 | $E[\hat{\theta}] = \theta$ | 满足，$E[\hat{p}] = p$ |
| 最小方差 | 所有无偏估计量中方差最小 | 简单随机样本下满足 |
| 一致性 | 当$n \to \infty$时估计量收敛到$\theta$ | 满足，标准误随n增大而缩小 |
| 偏差 | $E[\hat{\theta}] - \theta$ | $\hat{p}$的偏差 = 0 |

## 下一步

掌握估计量的性质是你学习后续所有比例推断主题的关键基础。$\hat{p}$的无偏性是单比例z置信区间和z假设检验能够生成有效、可靠结果、不会系统性高估或低估真实总体比例的核心依据。几乎每一场AP考试都会用1-2道选择题直接考察估计量的性质，在自由作答的推断题中，估计量性质也经常作为得分所需的推理步骤出现。接下来你将应用这些估计量性质计算样本比例的标准误，之后学习为总体比例构建正式的置信区间。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u12-estimators/
