# 统计学入门：我们能从数据中学到什么？

> AP 统计学 · AP 2024-2026 统计学大纲
> 来源: https://www.owlsprep.com/zh/study/ap-statistics-u10-introducing-statistics-what-can-we/

我们将讲解统计学核心基础定义，区分轶事证据与严谨的实证数据，并介绍符合最新AP统计学考试要求的、可从数据集中得出的有效结论。

**先修:** [基础算术与图形解读能力](https://www.owlsprep.com/zh/study/ap-statistics-pre-requisite-numeracy-skills/)

## 学习目标

- 区分轶事证据与严格收集的统计数据
- 定义核心术语，包括总体、样本、参数和统计量
- 区分描述性和推断性统计方法
- 识别从不同研究设计中可得出的有效和无效结论

## 什么是统计学，以及它为何不只是数学

很多刚接触AP统计学的学生认为这门课只需要计算公式，但统计学首先是一门研究现实世界数据变异性的推理学科。统计学的核心目标是将原始、零散的观测结果转化为可落地的、基于证据的结论，同时将随机偶然性纳入考量。

**统计学** — 收集、整理、分析和解读数据的科学，用于解释观测结果中天然存在的变异性和不确定性。

> **info**
>
> 与纯数学不同，统计结论永远无法达到100%的确定性，在AP考试中，有效推理的优先级往往高于精确计算。

**例题:** 一名学生声称「我学校所有11年级学生每晚睡眠都不足6小时，因为我的三个朋友都是这样」。解释为什么这不是一个有效的统计结论。

1. 首先，识别该说法的来源：该学生仅使用了3条个人观测结果，这只是完整群体中极小的非随机子集。
2. 这属于轶事证据，而非系统收集的数据集，因此无法支撑关于所有11年级学生的普遍性结论。
3. 有效的统计研究需要从11年级学生的代表性样本中收集数据，以覆盖不同的睡眠习惯差异。

**概念自测**

测试你对轶事证据与统计证据差异的理解

1. 以下哪一项属于统计证据？

   - A) 我表哥的车坏了，所以该型号的所有车都有缺陷
   - B) 对200名随机选取的车主进行的调查发现，该型号车辆有12%会在第一年出现故障
   - C) 我在高速上看到一辆该型号的车抛锚了
   - D) 一名机修工说他们每个月都会看到10辆该型号的车出故障

   *解析:* 对大量代表性群体进行随机抽样可以消除个人轶事带来的偏差，因此这属于正式的统计证据。

## 核心区分：总体与样本、参数与统计量

AP考试中最常考察的基础配对概念就是总体/样本和参数/统计量。在FRQ（自由问答题）中混淆这两组概念会导致失分，因此你需要做到在任何场景下都能立刻识别它们。

**参数** — 描述整个总体特征的数值，在实际研究中几乎总是未知的。

*记法:* 通常用希腊字母表示

**统计量** — 从样本数据计算得到的数值，用于估计未知的总体参数。

*记法:* 通常用罗马字母表示，常带有帽号或上划线

> **mnemonic**
>
> 记忆口诀：P（总体Population）对应P（参数Parameter），S（样本Sample）对应S（统计量Statistic）。这个1秒就能回忆的小技巧可以帮你在考试当天避免混淆。

**例题:** 某学区从8000名高中生中随机抽取500名学生进行调查，发现他们的平均每周屏幕使用时间为7.2小时。请指出该场景中的总体、样本、参数和统计量。

1. 总体：所有目标关注的群体，即该学区内的全部8000名高中生。
2. 样本：实际接受调查的总体子集，即500名随机选取的学生。
3. 参数：该学区所有8000名高中生真实的、未知的平均每周屏幕使用时间。
4. 统计量：从样本计算得到的7.2小时，用于估计总体参数。

**考试命令词**

AP考试题目经常使用特定措辞来测试你区分参数和统计量的能力

- **Describe the population of interest** — 你必须写出完整的全部群体，而不只是你收集数据的样本 *(不要写「接受调查的500名学生」，要写「学区内的所有高中生」。)*

- **Identify the value that estimates the population characteristic** — 题目要求你给出样本统计量，而不是未知的参数。

## 描述性统计与推断性统计

收集完样本数据后，你可以使用两大类统计方法：描述性统计用于汇总你已有的数据，推断性统计则可以让你将样本结论推广到更大的总体。

| 类别 | 核心目标 | 是否计算参数？ | AP考试示例 |
| --- | --- | --- | --- |
| 描述性统计 | 汇总已观测样本数据的特征 | 否，它仅描述你已收集的数据 | 计算样本均值，绘制样本响应的直方图 |
| 推断性统计 | 从样本数据中得出关于更大总体的可推广结论 | 是，它估计未知的总体参数 | 运行置信区间估计真实总体均值，执行假设检验 |

**例题:** 一名研究人员计算了300名受访者的收入中位数，然后用该值估计该州所有全职工作者的收入中位数。请将每一步标记为描述性或推断性统计。

1. 计算300名受访者的收入中位数属于描述性统计：它仅汇总了你已观测到的数据。
2. 使用该样本中位数估计全州所有全职工作者的收入中位数属于推断性统计：它将结论从观测样本推广到了更大的总体。

## 统计结论的局限性

AP考试的一项关键技能是识别你无法从给定数据集中得出的结论。如果你的数据收集方法存在偏差，或者实验没有使用随机分配，你就不能得出因果关系主张。

> **warning**
>
> 即使相关性非常强，如果你从观察性研究中声称存在因果关系，College Board也会在FRQ中扣分。

**例题:** 一项观察性研究发现，每天喝2杯咖啡的人患2型糖尿病的风险低15%。研究人员能否得出喝咖啡会降低糖尿病风险的结论？解释你的答案。

1. 首先注意这是一项观察性研究，而非随机对照实验。
2. 存在可以解释该关系的混淆变量：例如，经常喝咖啡的人可能也会进行更多锻炼，或者拥有更健康的饮食习惯。
3. 因此，研究人员不能得出喝咖啡会降低糖尿病风险的结论。他们只能说明咖啡摄入量与更低的糖尿病风险之间存在关联。

## 常见错误

- **错误做法:** 在FRQ中将样本值称为参数
  - 原因: 参数描述的是完整总体，在AP研究场景中几乎从不直接测量
  - 正确做法: 在写出答案之前，使用「P对应总体/S对应样本」的记忆口诀正确标记数值类型。
- **错误做法:** 将轶事证据推广到大型总体
  - 原因: 轶事观测结果是非随机的极小子集，无法代表完整群体
  - 正确做法: 只有当你的数据来自目标总体的代表性随机样本时，才能做出可推广的主张。
- **错误做法:** 从观察性研究中声称因果关系
  - 原因: 即使不存在因果联系，混淆变量也可以在两个变量之间制造出相关性
  - 正确做法: 只有当研究对受试者使用了处理的随机分配时，才能得出因果结论。
- **错误做法:** 将总体定义为你收集数据的样本
  - 原因: 总体永远是你想要了解的更大的完整群体，而不是你调查的子集
  - 正确做法: 在描述总体时，明确列出目标关注的完整群体的每一个成员。
- **错误做法:** 将统计学视为纯数学计算学科
  - 原因: AP考试60%的分数来自推理和表述，而非算术
  - 正确做法: 练习为每一个结论写出完整的论证，而不只是计算数值。

## 速查表

| 术语 | 定义 | 符号表示 |
| --- | --- | --- |
| 总体 | 目标关注的完整群体 | N（总体容量） |
| 样本 | 被测量的总体子集 | n（样本容量） |
| 参数 | 描述总体的数值 | 希腊字母，例如 \mu |
| 统计量 | 描述样本的数值 | 罗马字母，例如 \bar{x} |
| 描述性统计 | 汇总观测数据 | 无 |
| 推断性统计 | 推广到总体 | 无 |

## 下一步

现在你已经掌握了统计学的基础词汇，可以继续探索不同类型的数据，包括分类变量和数值变量，以及适用于每种数据类型的图形展示方式。这些基础定义会在AP统计学课程的后续所有单元（从概率到推断）中被反复引用，因此在继续学习之前，请确保你可以立刻区分参数和统计量。掌握这些基础内容将帮助你在整场考试的选择题和FRQ评分标准中避免丢失简单分数。

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ap-statistics-u10-introducing-statistics-what-can-we/
