# 构建两个独立总体均值之差的置信区间

> AP 统计学 · AP 2024 统计学
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u13-constructing-a-confidence-interval-for/

我们将介绍必要的条件校验、分步区间计算、符合语境的规范解读，以及用于估计两个独立总体均值差的AP评分规则。

**先修:** [单样本t置信区间的构建](https://www.owlsprep.com/zh/study/ap-statistics-u12-one-sample-t-confidence-intervals/); [样本均值差的抽样分布](https://www.owlsprep.com/zh/study/ap-statistics-u13-sampling-distribution-difference-means/)

## 学习目标

- 明确构建独立总体均值差的有效双样本t置信区间所需的全部条件
- 使用非合并公式计算点估计、标准误、临界t值以及最终区间边界
- 按照AP评分标准写出符合全分要求的、结合题目语境的区间完整解读
- 区分非合并方差与合并方差双样本t置信区间的适用场景

## 构建前的条件校验

在计算有效的双样本t置信区间之前，你必须明确验证三个不可省略的条件，在所有考察该知识点的AP自由问答题中，这部分占1-2分。

**组间独立性** — 两个样本必须来自相互独立的不同总体，组间不存在配对或匹配的观测值。

*例:* 对比两个独立班级的考试分数属于独立场景，而对比同一学生的考前和考后分数则不属于独立场景。

1. 随机性：两个样本都必须通过从各自总体中随机抽样得到，或者在实验中对组进行随机分配。
2. 10%条件：当进行无放回抽样时，每个样本量必须小于其对应总体的10%。
3. 正态性/大样本条件：满足以下任意一项即可：两个底层总体都服从正态分布，或每个样本量n ≥ 30。

> **warning**
>
> 即使你的最终区间计算完全正确，如果没有明确列出全部三个条件，也无法在AP自由问答题中获得全分。

**概念自测**

判断以下哪个场景满足双样本t区间的全部条件：

1. 场景A：25名学生的配对考前、考后分数

   - 有效
   - 无效

   *解析:* 配对数据需要使用针对均值差的单样本t区间，而非双样本区间。

2. 场景B：从总人数1200的学校中随机抽取40名男性和40名女性AP统计学学生

   - 有效
   - 无效

   *解析:* 两个样本都是随机抽取的，均小于对应总体的10%，且n ≥ 30，因此正态性条件满足。

## 核心双样本t区间计算

$$(\bar{x}_1 - \bar{x}_2) \pm t^* \cdot \sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}$$

该非合并公式是AP大学理事会针对所有双样本t区间题目的默认接受公式，即使方差相等也可以直接使用。除非题目明确要求，否则你不需要使用合并方差方法。

**韦尔奇-萨特思韦特自由度** — 为避免在样本方差不等时高估区间宽度而调整的自由度值，计算公式为 $df = \frac{\left(\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}\right)^2}{\frac{(s_1^2/n_1)^2}{n_1-1} + \frac{(s_2^2/n_2)^2}{n_2-1}}$

**例题:** 一名研究人员随机抽取32名每日喝1杯咖啡的受访者，测得平均每日睡眠时间为7.2小时，标准差为0.8小时。另一个随机抽取的36名不喝咖啡的受访者样本测得平均睡眠时间为7.8小时，标准差为0.7小时。构建总体平均睡眠差值（不喝咖啡组减去喝咖啡组）的95%置信区间。

1. 计算点估计：
2. $$\bar{x}_1 - \bar{x}_2 = 7.8 - 7.2 = 0.6 \text{ 小时}$$
3. 计算标准误：
4. $$SE = \sqrt{\frac{0.7^2}{36} + \frac{0.8^2}{32}} \approx 0.175$$
5. 查找t*临界值：使用韦尔奇-萨特思韦特自由度df ≈ 62，95%置信水平下t* ≈ 2.0
6. 计算边际误差和最终区间：
7. $$0.6 \pm (2.0 \times 0.175) = (0.25, 0.95) \text{ 小时}$$

> **考试提示:** 在AP考试中你可以安全使用保守自由度，即取n₁-1和n₂-1中的较小值，即可获得全分，无需手动计算完整的韦尔奇-萨特思韦特值。

## 全分区间解读

双样本置信区间的全分解读必须包含四个强制组成部分：置信水平、对总体参数真实差值的指代、题目语境、区间的明确边界。

**考试命令词**

AP考试题目通常会要求你“解读该区间”，这需要覆盖全部四个组成部分，不能只给出部分陈述。

- **We are 95% confident** — 正确的开头表述，指代置信水平，不能对特定区间作出概率陈述。

- **the true difference between the population mean of [group 1] and [group 2]** — 你必须明确指代总体参数，而非样本统计量，才能获得全分。

> **解读记忆口诀**
>
> 使用口诀C-P-C-B来记忆：置信水平（Confidence level）、总体参数（Population parameter）、语境（Context）、边界（Bounds）。

## 合并方差特殊场景

只有当题目明确告知两个总体方差相等时，合并方差方法才是合适的，这种场景在AP考试中几乎不会出现。

$$s_p^2 = \frac{(n_1 - 1)s_1^2 + (n_2 - 1)s_2^2}{n_1 + n_2 - 2}$$

- 合并自由度 = n₁ + n₂ - 2
- 合并标准误会替换核心区间公式中的非合并标准误项

## 常见错误

- **错误做法:** 将双样本独立区间公式用于配对匹配数据
  - 原因: 配对数据会降低变异性，使用不同的抽样分布，最终得到过宽的错误区间。
  - 正确做法: 首先确认组间独立性，如果观测值跨组匹配，则使用配对t区间。
- **错误做法:** 表述为“该特定区间内包含真实差值的概率为95%”
  - 原因: 区间和参数都是固定值，概率指代的是长期运行中捕获真实值的区间占比。
  - 正确做法: 将解读表述为对方法的置信，而非对单个计算出的区间的概率陈述。
- **错误做法:** 在没有记录减法方向的情况下交换两个样本均值的减法顺序
  - 原因: 你会错误判断哪一组的均值更高/更低，丢失全部解读分数。
  - 正确做法: 在计算点估计之前，明确说明你的减法顺序（组1减去组2）。
- **错误做法:** 在总体标准差未知的情况下使用z临界值而非t临界值
  - 原因: 在真实双样本推断场景中，总体标准差几乎永远是未知的，因此z值是无效的。
  - 正确做法: 双样本均值区间始终使用t*，除非题目明确给出总体σ值。
- **错误做法:** 无放回抽样时忘记验证两个样本的10%条件
  - 原因: 这违反了抽样分布的独立性要求，导致标准误计算不可靠。
  - 正确做法: 明确确认两个样本都小于其对应总体的10%。

## 速查表

| 组成部分 | 公式/规则 | AP评分注意事项 |
| --- | --- | --- |
| 点估计 | $\bar{x}_1 - \bar{x}_2$ | 必须明确说明减法顺序 |
| 标准误 | $\sqrt{s_1^2/n_1 + s_2^2/n_2}$ | 非合并为默认设置，除非告知方差相等否则不使用合并 |
| 自由度 | min(n₁-1, n₂-1) 或 韦尔奇-萨特思韦特 | 保守最小值方法可获得AP全分 |
| 解读 | C-P-C-B 结构 | 缺失任意组成部分扣1分 |
| 条件 | 随机性、10%条件、正态性 | 必须明确列出全部三个条件才能获得全分 |

## 下一步

掌握双样本t置信区间是后续学习两个总体均值差对应假设检验的基础，该检验是AP统计学考试中考察频率最高的自由问答题主题之一。你还将基于该技能在后续单元中使用ANOVA比较多组均值，学会区分配对和独立双样本推断场景，避免代价高昂的方法选择错误。该主题约占考试总分的10-15%，因此坚持练习条件校验、计算和符合评分标准的解读，是你考试拿到5分的关键。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u13-constructing-a-confidence-interval-for/
