# 统计与概率

> IB 数学应用与解释 HL · IB AI HL
> 来源: https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-overview/
> 占比: 占考试总分的15-20%

本单元涵盖IB AI HL所有核心描述性统计、推断统计、概率以及离散图论内容。这些知识点在两张试卷中都占很大比重，是应用数据分析的基础。

**先修:** [IB AI HL 代数与函数](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u2-overview/)

## 学习目标

- 对现实数据集进行数据类型分类，并识别抽样方法中的偏差来源
- 计算并解释双变量数据的描述性统计、相关性和回归模型
- 应用核心概率法则和常见概率分布对现实世界随机过程建模
- 构建置信区间并进行假设检验，对总体参数进行统计推断
- 使用图论概念和算法解决离散网络优化问题

## 单元概览

本单元遵循逻辑学习顺序：从数据收集和汇总统计的基础概念开始，然后进入双变量分析、概率、概率分布，最后是推断统计和图论。所有知识点都强调现实应用，符合IB AI HL大纲的核心定位。

统计知识点循序渐进：你将先学习如何收集和描述数据，再对随机过程建模，最后利用样本数据对总体进行假设检验。最后的图论部分介绍了广泛应用于运筹学和数据科学的离散优化工具。

以下是本单元所有子主题，按照官方大纲顺序排列：
- [数据类型、抽样、偏差](https://www.owlsprep.com/study/ib-math-ai-hl-u5-data-types-sampling-bias/) — 学习对数据类型分类，识别抽样偏差的常见来源。
- [描述性统计：中心趋势与离散程度度量](https://www.owlsprep.com/study/ib-math-ai-hl-u5-descriptive-statistics-measures-of-center/) — 计算并解释中心趋势、离散程度度量，可视化数据分布。
- [相关性与线性回归](https://www.owlsprep.com/study/ib-math-ai-hl-u5-correlation-and-linear-regression/) — 探究双变量数据之间的线性关系，拟合简单线性回归模型。
- [概率概念、条件概率、独立事件](https://www.owlsprep.com/study/ib-math-ai-hl-u5-probability-concepts-conditional-probability-independent/) — 掌握核心概率法则、条件概率和独立事件检验方法。
- [概率分布：期望与方差](https://www.owlsprep.com/study/ib-math-ai-hl-u5-probability-distributions-expected-value-and/) — 计算离散和连续概率分布的期望与方差。
- [二项分布、泊松分布与正态分布](https://www.owlsprep.com/study/ib-math-ai-hl-u5-binomial-poisson-and-normal-distributions/) — 应用三种常见概率分布对现实世界随机过程建模。
- [非线性回归模型](https://www.owlsprep.com/study/ib-math-ai-hl-u5-non-linear-regression-models/) — 变换非线性关系，为双变量数据拟合线性模型。
- [卡方检验：拟合优度与独立性](https://www.owlsprep.com/study/ib-math-ai-hl-u5-chi-squared-tests-goodness-of/) — 对分类变量进行拟合优度卡方检验和关联性卡方检验。
- [均值的t检验与置信区间](https://www.owlsprep.com/study/ib-math-ai-hl-u5-t-tests-and-confidence-intervals/) — 构建置信区间，对总体均值进行t检验。
- [斯皮尔曼等级相关系数](https://www.owlsprep.com/study/ib-math-ai-hl-u5-spearman-s-rank-correlation-coefficient/) — 计算并解释等级双变量数据的斯皮尔曼rho系数。
- [图论：基础概念](https://www.owlsprep.com/study/ib-math-ai-hl-u5-graph-theory-basic-concepts/) — 学习图与网络的核心术语和表示方法。
- [图论：邻接矩阵、路径与环](https://www.owlsprep.com/study/ib-math-ai-hl-u5-graph-theory-adjacency-matrices-paths/) — 使用邻接矩阵计数图中的路径，识别图中的环。
- [生成树与最小生成树算法](https://www.owlsprep.com/study/ib-math-ai-hl-u5-spanning-trees-and-minimum-spanning/) — 应用普里姆算法和克鲁斯卡尔算法寻找最小生成树。
- [图论应用：CPP与TSP](https://www.owlsprep.com/study/ib-math-ai-hl-u5-graph-theory-applications-cpp-and/) — 使用图论方法求解中国邮路问题和旅行商问题。

## 常见错误

- **错误做法:** 回归分析中混淆相关性与因果关系
  - 原因: 强相关性不能证明一个变量的变化会导致另一个变量的变化
  - 正确做法: 始终结合上下文解读相关性，并考虑可能存在的混杂变量
- **错误做法:** 进行假设检验前忘记验证前提条件
  - 原因: 大多数假设检验需要满足特定条件才能得出有效结果
  - 正确做法: 解读检验结果前，务必验证前提条件（期望频数>5、正态性、独立性）
- **错误做法:** 图论中混淆节点度和邻接矩阵元素
  - 原因: 邻接矩阵元素记录节点之间的边数，不是节点度
  - 正确做法: 记住节点的度数等于邻接矩阵中对应行/列所有元素的和

## 速查表

| 概念 | 核心公式/结论 |
| --- | --- |
| 皮尔逊相关系数 | $r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}$ |
| 线性回归直线 | $\hat{y} = ax + b$, where $a$ = slope, $b$ = y-intercept |
| 期望（离散分布） | $E(X) = \sum x_i P(X=x_i)$ |
| 随机变量的方差 | $Var(X) = E(X^2) - [E(X)]^2$ |
| 卡方检验统计量 | $\chi^2 = \sum \frac{(O_i - E_i)^2}{E_i}$ |
| 斯皮尔曼等级相关系数 | $r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)}$ |
| 握手引理 | 所有节点度数之和 = $2 \times$ 边的总数 |

## 下一步

从本单元第一个子主题开始学习，建立数据收集和偏差的基础知识，这是后续所有统计知识点的基础。完成本单元所有子主题后，进入下一个微积分单元，继续按照IB AI HL大纲推进学习。

- [数据类型、抽样、偏差](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-data-types-sampling-bias/)
- [描述统计：集中趋势与离散程度度量](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-descriptive-statistics-measures-of-center/)
- [相关性与线性回归](https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-correlation-and-linear-regression/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/ib-math-ai-hl-u5-overview/
