# 对两个总体均值之差开展假设检验

> AP 统计学 · AP 2024-2026 统计学
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u13-carrying-out-a-test-for/

我们将讲解用于比较两个独立总体均值的、完全符合AP考纲的4步假设检验全流程，包含条件验证、t统计量计算、p值解读以及贴合具体情境的有效结论撰写。

**先修:** [单总体均值的单样本t检验](https://www.owlsprep.com/zh/study/ap-statistics-u13-one-sample-t-test/); [两个独立均值之差的置信区间](https://www.owlsprep.com/zh/study/ap-statistics-u13-two-sample-t-confidence-interval/)

## 学习目标

- 正确写出格式规范的、用于总体均值差的双样本t检验的原假设和备择假设
- 验证两个独立组对应的随机、独立、正态这三项必备的推断条件
- 使用AP考试认可的方法计算非合并t检验统计量和对应的p值
- 写出完全贴合情境、能在AP自由作答题中拿到满分的完整结论

## 第1步：写出假设并定义参数

任何双样本t检验的第一个正式步骤是明确定义你要比较的总体参数，之后使用正确的符号写出原假设和备择假设。双样本检验的原假设几乎总是假定两个总体均值不存在差异，因此$H_0: \mu_1 - \mu_2 = 0$。

**双样本假设检验符号体系** — 原假设主张两个总体均值不存在差异；备择假设主张差值不为0、大于0或小于0，完全匹配给定的研究问题。

*记法:* $H_0, H_a$

**例题:** 某研究者声称10年级学生的平均每日睡眠时间比9年级学生更长。请写出该检验对应的正确假设。

1. 首先明确定义参数：
2. $\mu_1$ = 所有10年级学生的真实平均每日睡眠时间，$\mu_2$ = 所有9年级学生的真实平均每日睡眠时间
3. 原假设（总体均值无差异）：
4. $$H_0: \mu_1 - \mu_2 = 0$$
5. 与研究者主张对应的单侧备择假设：
6. $$H_a: \mu_1 - \mu_2 > 0$$

**考试命令词**

AP考试中该步骤的常见指令术语：

- **State hypotheses** — 你必须明确定义两个总体参数才能拿到满分，不能只写出符号表达式

- **Identify appropriate test** — 你必须明确写出「总体均值差的双样本t检验」，以此说明你没有使用配对t检验

## 第2步：验证推断条件

所有双样本t检验在开展计算前都需要满足三项必备条件：随机、独立、正态/大样本。随机条件要求两个样本都从各自对应的总体中随机抽取，或是在对照实验中对分组进行随机分配。

1. 独立性：每个样本内部的观测相互独立，且两个样本完全互不相关。10%准则要求每个总体的规模至少是对应样本量的10倍。
2. 正态/大样本：对于每个样本，若n < 30，你必须确认样本分布不存在严重偏态或异常值。若n ≥ 30，中心极限定理成立，$\bar{x}_1 - \bar{x}_2$的抽样分布近似正态。

> **常见错误提醒**
>
> 绝对不要将两个样本量相加来验证n ≥ 30的规则：你必须分别对每个样本单独验证正态条件。

**例题:** 你要比较50名城区通勤者和42名郊区通勤者的平均通勤时长，两个样本均为随机样本。请验证该检验的正态条件。

1. 样本1（城区通勤者）：n1 = 50 ≥ 30，根据中心极限定理，$\bar{x}_1$的抽样分布近似正态。
2. 样本2（郊区通勤者）：n2 = 42 ≥ 30，根据中心极限定理，$\bar{x}_2$的抽样分布近似正态。
3. 两个近似正态分布的差值也服从近似正态分布，因此正态条件完全满足。

## 第3步：计算检验统计量和P值

非合并双样本t检验是所有AP统计学考试中默认的、可获得满分的方法。你无需假设总体方差相等，可以使用图形计算器计算得到的韦尔奇-萨特思韦特自由度，在没有计算器的情况下也可以使用保守下界df = min(n1 - 1, n2 - 1)。

$$t = \frac{(\bar{x}_1 - \bar{x}_2) - (\mu_1 - \mu_2)_{H_0}}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}$$

**例题:** 样本1：n1=25，x̄1=18.2，s1=3.1；样本2：n2=30，x̄2=15.7，s2=2.8。针对H0: μ1 - μ2 = 0的检验计算t统计量。

1. 将数值代入检验统计量公式：
2. $$t = \frac{(18.2 - 15.7) - 0}{\sqrt{\frac{3.1^2}{25} + \frac{2.8^2}{30}}}$$
3. 先化简分母：
4. $$\sqrt{\frac{9.61}{25} + \frac{7.84}{30}} = \sqrt{0.3844 + 0.2613} = \sqrt{0.6457} \approx 0.8036$$
5. 最终t统计量：
6. $$t \approx \frac{2.5}{0.8036} \approx 3.111$$

**概念自测**

测试你对计算规则的理解：

1. 当n1=25、n2=30时，正确的保守自由度是多少？

   - 24
   - 29
   - 53
   - 54

   *解析:* 保守自由度为min(n1-1, n2-1) = min(24, 29) = 24。

## 第4步：写出贴合情境的结论

你的结论需要遵循三部分结构才能拿到AP考试的满分：首先将p值与预先设定的显著性水平α进行比较，之后说明你拒绝或不拒绝原假设的决策，最后将该决策直接关联到原始研究问题的完整情境中。

> **结论记忆口诀**
>
> 使用口诀「P-D-C」（P值、决策、情境）来记住结论的三个必备部分，避免失分。

**例题:** 前面的睡眠时间差异检验得到的p值为0.023，显著性水平α = 0.05。请写出完整有效的结论。

1. 1. 比较p值和α：0.023 < 0.05
2. 2. 给出正式决策：我们拒绝原假设。
3. 3. 关联完整情境：有充分证据表明10年级学生的真实平均睡眠时间长于9年级学生的真实平均睡眠时间。

## 常见错误

- **错误做法:** 默认使用合并双样本t检验
  - 原因: 除非题目明确说明总体方差相等，否则AP阅卷员会对使用合并检验的答案扣分
  - 正确做法: 在AP考试中开展所有双样本均值推断时，始终使用非合并的韦尔奇t检验。
- **错误做法:** 将n1和n2相加来验证n ≥ 30的正态条件
  - 原因: 中心极限定理适用于每个独立的抽样分布，而非合并后的样本
  - 正确做法: 分别对两个组单独验证正态/大样本条件。
- **错误做法:** 写出仅提及样本差值而非总体差值的结论
  - 原因: 假设检验是对总体参数作出推断，而非对观测到的样本结果作出推断
  - 正确做法: 在结论的每一部分都明确提及「真实总体均值」。
- **错误做法:** 对两个独立样本使用配对t检验
  - 原因: 配对检验适用于匹配的观测值，不适用于相互独立的不同分组
  - 正确做法: 在选择双样本t检验之前，先确认两个样本是相互独立的。
- **错误做法:** 当p值较大时声称你「接受原假设」
  - 原因: 我们没有证据证明原假设100%成立，仅能说明我们无法拒绝它
  - 正确做法: 对于不显著的结果，使用标准表述「不拒绝原假设」。

## 速查表

| 组成部分 | 公式 / 要求 |
| --- | --- |
| 假设 | $H_0: \mu_1 - \mu_2 = 0$, $H_a: \mu_1 - \mu_2 > / < / \neq 0$ |
| 条件 | 随机、独立（10%准则）、正态（n≥30或无异常值） |
| t统计量 | $t = \frac{(\bar{x}_1 - \bar{x}_2)}{\sqrt{s_1^2/n_1 + s_2^2/n_2}}$ |
| 保守自由度 | $\min(n_1 - 1, n_2 -1)$ |
| 结论结构 | p值 < α → 拒绝H0，写出贴合情境的结论 |

## 下一步

完全掌握双样本t检验的全流程是AP统计学自由作答题中权重最高的考点之一，几乎每隔一次考试就会出现该类题目。接下来你会将该逻辑拓展到比较两个总体比例之差的场景（而非定量均值），并学习如何针对任意给定的题干判断应当使用哪类推断检验。该技能也能帮助你在占总分25%的探究任务自由作答题中拿到满分。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u13-carrying-out-a-test-for/
