# 模式识别

> CIE A-Level 计算机科学 · 9618 (2022-2024)
> 来源: https://www.owlsprep.com/zh/study/cie-9618-u13-pattern-recognition/

本模块讲解CIE A-Level 9618的核心模式识别概念，包括主要类型、常见算法和人工智能应用。你将学习解答分类和聚类的标准考试风格题目。

**先修:** [基础计算思维概念](https://www.owlsprep.com/zh/study/cie-9618-u13-intro-to-computational-thinking/); [人工智能基础](https://www.owlsprep.com/zh/study/cie-9618-u13-intro-to-ai/)

## 学习目标

- 区分监督式和无监督式模式识别问题
- 将k-NN和k-Means算法应用于简单的考试风格题目
- 识别人工智能中模式识别的适用场景
- 解答关于模式识别核心概念的常见考题

## 模式识别核心概念

**模式识别** — 利用计算机系统自动识别原始输入数据中的规律、模式或特征，对输入进行分类或分组的过程

*例:* 从扫描的文档图像中识别手写数字

所有模式识别流程都遵循标准结构。第一步也是最关键的一步是**特征提取**：仅从原始输入数据中选择相关属性，以降低复杂度并提高准确率。无关数据（例如按尺寸分类杯子时的杯子颜色）会被丢弃。

- 常见输入类型：图像、文本、音频、传感器测量值、交易数据
- 输出类型：标记类别（监督式）或自然分组（无监督式）

**例题:** 一家工厂希望使用激光传感器自动按容量（250ml、500ml、1L）对瓶子进行分类。请描述该任务的模式识别系统步骤。

1. 1. 从原始传感器数据中提取相关特征：测量得到的瓶子高度，该高度与容量直接相关。丢弃瓶子颜色、标签文字等无关数据。
2. 2. 将提取的高度与每个容量类别的预定义阈值进行比较。
3. 3. 将瓶子分配到匹配的预定义容量类别，作为最终输出。

> **考试提示:** 在任何模式识别流程的题目中，始终要将特征提取作为第一步提及，以获得满分。

## 模式识别的类型：监督式 vs 无监督式

**分类** — 监督式模式识别，将输入分配到一组预定义的标记类别之一。系统使用已标记的训练数据进行训练。

*例:* 将收到的邮件分类为「垃圾邮件」和「非垃圾邮件」类别

**聚类** — 无监督式模式识别，在没有预定义类别标签和训练数据的情况下，识别相似输入的自然分组（聚类）。

*例:* 对客户购买数据进行分组，以识别隐藏的细分市场

**方法对比**

分类和聚类的主要区别：

- **分类** — 监督式学习，使用标记训练数据，输出类别预定义
  - 优点: 输出可预测，易于衡量准确率
  - 缺点: 需要大量标记数据集，无法发现新分组

- **聚类** — 无监督式学习，无需标记训练数据，输出分组由算法发现
  - 优点: 无需标记数据，可发现隐藏模式
  - 缺点: 输出分组无标记，更难评估准确率

**例题:** 一位生物学家获得了100个新甲虫样本的测量值，没有关于存在多少物种的预先信息。这是分类问题还是聚类问题？解释你的答案。

1. 1. 检查是否存在预定义标记类别：生物学家没有关于现有物种的预先信息，因此没有提供标签。
2. 2. 目标是识别相似甲虫测量值的自然分组，而非分配到已知类别。
3. 3. 结论：这是一个无监督聚类问题。

## 考试要求掌握的常见算法

CIE 9618要求你能够将两种简单常见的模式识别算法应用于小型数据集：用于分类的k近邻（k-NN），和用于聚类的k-Means。

**k近邻** — 一种简单的分类算法，将新的未标记输入分配给其k个最近（最相似）标记训练点中最常见的类别。

*记法:* k-NN

*例:* 根据测量空间中3个最近邻居的物种对新花进行分类

**k均值** — 一种聚类算法，通过最小化每个数据点与聚类平均质心之间的距离，将输入数据划分为k个预先指定的不同聚类。

*记法:* k-Means

*例:* 将100个客户数据点划分为5个不同的消费群体

**例题:** 使用$k=3$的k-NN对特征为$(2, 3)$的新数据点进行分类。现有标记点：A(1,2) = 红色，B(1,4) = 红色，C(3,2) = 蓝色，D(4,3) = 蓝色。

1. 计算新点与每个现有点之间的欧几里得距离：
2. $$d = \sqrt{(x_2 - x_1)^2 + (y_2 - y_1)^2}$$
3. 到A的距离：$\approx 1.41$，到B：$\approx 1.41$，到C：$\approx 1.41$，到D：$2$。三个最近邻居是A、B、C。
4. 统计类别：2个红色，1个蓝色。多数类别是红色。
5. 最终分类：红色

> **考试提示:** 在解答k-NN题目时，始终要展示你的距离计算和多数投票步骤，以获得满分。

## 常见错误

- **错误做法:** 将分类和聚类混淆为同一种模式识别。
  - 原因: 考官经常考察监督式和无监督式学习的区别，混淆二者会丢分。
  - 正确做法: 记住分类使用预定义标记类别（监督式），而聚类寻找无标记自然分组（无监督式）。
- **错误做法:** 忘记将特征提取作为模式识别流程的第一步提及。
  - 原因: 很多考生跳过这一步，但考试评分标准要求提及该步骤才能拿满分。
  - 正确做法: 始终明确将特征提取陈述为任何模式识别过程的初始步骤。
- **错误做法:** 在k-NN计算中不对平局投票进行处理。
  - 原因: 考生经常在k为偶数出现平局时停止作答，从而丢分。
  - 正确做法: 通过将k减1或使用加权距离优先考虑更近的邻居来打破平局。
- **错误做法:** 假设k-Means会自动检测聚类数量。
  - 原因: 这是选择题和问答题中常考的常见误解。
  - 正确做法: 运行k-Means之前，聚类数量k必须始终由用户指定。

## 速查表

| 概念 | 学习类型 | 核心特征 |
| --- | --- | --- |
| 模式识别 | 任意 | 提取特征 → 识别模式 |
| 分类 | 监督式 | 将输入分配到预定义标记类别 |
| 聚类 | 无监督式 | 在未标记数据中寻找自然分组 |
| k-NN | 分类 | k个最近邻居的多数投票 |
| k-Means | 聚类 | 用户指定k，最小化到质心的距离 |

## 下一步

模式识别是CIE 9618中所有高级人工智能和机器学习主题的基础概念。掌握监督式和无监督式模式识别的区别将帮助你理解决策树和神经网络等更复杂的算法。模式识别题目经常出现在试卷1中，因此练习将k-NN和k-Means应用于小型数据集将帮助你在考试中轻松拿分。接下来你可以更深入地探索特定类型的机器学习，在核心知识的基础上继续学习。

- [面向对象问题求解](https://www.owlsprep.com/zh/study/cie-9618-u13-object-oriented-problem-solving/)
- [陈述式问题求解](https://www.owlsprep.com/zh/study/cie-9618-u13-declarative-problem-solving/)
- [人工智能基础](https://www.owlsprep.com/zh/study/cie-9618-u13-artificial-intelligence-fundamentals/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/cie-9618-u13-pattern-recognition/
