# 声音的二进制表示

> 计算机科学 · CIE A-Level 9618
> 来源: https://www.owlsprep.com/zh/study/cie-9618-u1-binary-representation-of-sound/

本模块讲解连续模拟声波如何转换为二进制以进行数字存储。你将学习计算声音文件大小，并理解采样参数如何影响音质和存储需求，这是CIE 9618试卷1的核心考点。

**先修:** [二进制数系统](https://www.owlsprep.com/zh/study/cie-9618-u1-binary-number-systems/); [数字信息单位](https://www.owlsprep.com/zh/study/cie-9618-u1-units-of-information/)

## 学习目标

- 解释模拟声音转换为数字二进制的过程
- 定义采样率和位深度，并说明它们对音质和文件大小的影响
- 计算未压缩数字声音的文件大小
- 比较单声道和立体声声音的表示

## 模数转换过程

**模数转换（ADC）** — 将连续模拟声波转换为离散二进制值以进行数字存储的过程

*例:* 在智能手机上录制语音时会使用ADC

声音最初是连续的压力波，被麦克风捕获后变为连续电信号。要在计算机中存储声音，必须通过三个核心阶段转换为离散二进制值：

1. 采样：按固定时间间隔测量波的振幅
2. 量化：将每个测量得到的振幅舍入到最近的允许离散电平
3. 编码：将每个量化电平转换为定长二进制值

**例题:** 简述ADC将1秒声音片段转换为二进制的步骤

1. 1. 根据所选采样率将1秒的连续波划分为固定时间间隔，例如每秒10个样本 = 10个间隔。
2. 2. 测量每个间隔处波的振幅。
3. 3. 将每个测量得到的振幅分配到固定集合中最近的可用量化电平。
4. 4. 将每个量化电平编码为二进制数，然后将所有二进制值存储在内存中。

> **考试提示:** 如果要求列出ADC阶段，请记住S-Q-E：采样（Sampling）、量化（Quantization）、编码（Encoding）。

## 关键参数：采样率与位深度

**采样率** — 每秒采集的振幅样本数，单位为Hz或kHz

*记法:* $f_s$

*例:* 44.1 kHz = 每秒44100个样本

**位深度** — 存储单个样本振幅值所用的位数

*例:* 16位深度可提供$2^{16} = 65536$种可能的振幅电平

这两个参数都会直接影响音质和文件大小。更高的采样率可以捕获更多高频细节，减少混叠失真。更高的位深度可以捕获更细微的音量变化，减少量化噪声。

> **info**
>
> 奈奎斯特定理指出，要准确重建原始声音，采样率必须至少是原始声音最高频率的两倍。人类听觉的上限约为20 kHz，因此44.1 kHz是音频CD的标准采样率。

**例题:** 在其他参数不变的情况下，将采样率从22 kHz提高到44 kHz会对音质和文件大小产生什么影响？

1. 1. 采样率翻倍意味着每秒采集的样本数增加一倍。
2. 对音质的影响：更多样本可以捕获原始连续波的更多细节，尤其是高频细节，从而获得更好的音质，失真更少。
3. 对文件大小的影响：样本数增加一倍意味着总文件大小也会翻倍。

## 计算未压缩声音文件大小

要计算未压缩声音文件的总大小，将四个核心参数相乘即可：

$$\text{Total size (bits)} = \text{channels} \times \text{duration (seconds)} \times \text{sampling rate (Hz)} \times \text{bit depth}$$

计算出总比特数后，转换为题目要求的单位。除非另有说明，CIE 9618采用SI十进制标准（1 kB = 1000字节，1 MB = 1000 kB）。

**例题:** 计算一个时长2分钟、采样率32 kHz、位深度16位的单声道声音文件的大小，结果以MB为单位给出。

1. 1. 将时长转换为秒：$2 \times 60 = 120$ 秒
2. 2. 单声道 = 1个声道，代入公式：
3. $$\text{Total bits} = 1 \times 120 \times 32000 \times 16 = 61440000 \text{ bits}$$
4. 3. 将比特转换为字节：除以8：$61440000 / 8 = 7680000$ 字节
5. 4. 转换为MB：除以$10^6$：$7680000 / 1000000 = 7.68$ MB

> **考试提示:** 始终检查最终答案要求的单位。一个常见错误是当题目要求MB时，答案仍保留为比特。

## 单声道 vs 立体声

单声道声音使用单个音频通道，通过所有扬声器录制和播放。立体声声音使用两个独立通道，左扬声器和右扬声器各一个，以营造空间3D效果。在其他参数相同的情况下，立体声声音的大小正好是单声道的两倍。

**例题:** 一个立体声声音文件大小为12 MB。在其他参数不变的情况下，同一录音保存为单声道的大小是多少？

1. 1. 立体声 = 2个声道，单声道 = 1个声道。文件大小与声道数成正比。
2. 2. 单声道大小 = 立体声大小 / 2 = 12 / 2 = 6 MB

## 常见错误

- **错误做法:** 忘记将时长从分钟/小时转换为秒
  - 原因: 采样率的单位是每秒样本数，直接使用分钟会使结果小60倍
  - 正确做法: 始终先将时长转换为秒：分钟乘以60，小时乘以3600
- **错误做法:** 混淆采样率和位深度对音质的影响
  - 原因: 学生经常搞混哪个参数影响频率细节，哪个影响音量细节
  - 正确做法: 采样率 = 测量的频率（影响高频细节），位深度 = 每次测量的精度（影响音量动态范围）
- **错误做法:** 在CIE考试中单位转换使用1024而非1000
  - 原因: 除非明确说明，否则CIE 9618遵循文件大小前缀的SI十进制标准
  - 正确做法: 对于所有标准题目，使用1 kB = 1000字节，1 MB = 1000000字节
- **错误做法:** 计算立体声文件大小时忘记乘以声道数
  - 原因: 即使题目明确说明是立体声，很多学生仍然只按1个声道计算
  - 正确做法: 始终先检查声道数，立体声乘以2，5.1环绕声乘以6，依此类推

## 速查表

| 参数 | 定义 | 对文件大小的影响 | 对音质的影响 |
| --- | --- | --- | --- |
| 采样率 | 每秒样本数（Hz） | 成正比：越高 = 越大 | 越高 = 高频细节越多 |
| 位深度 | 每个样本的位数 | 成正比：越高 = 越大 | 越高 = 可用音量等级越多，噪声越少 |
| 声道数 | 独立音频轨道数 | 成正比：越多 = 越大 | 相比单声道，立体声增加空间效果 |
| 文件大小公式 | $C \times D \times f_s \times b$ 比特 | C = 声道数，D = 时长（秒） | $f_s$ = 采样率，b = 位深度 |

## 下一步

理解声音的二进制表示为你处理所有类型的数字多媒体和数据压缩打下基础。你在这里学到的文件大小和音质之间的权衡，对于流媒体、音乐制作和移动音频等实际应用至关重要。所有压缩音频格式（如MP3）都建立在本主题涵盖的基础编码概念之上，因此掌握这些基础知识将有助于你接下来理解压缩技术。

- [图像的二进制表示](https://www.owlsprep.com/zh/study/cie-9618-u1-binary-representation-of-images/)
- [有损和无损数据压缩](https://www.owlsprep.com/zh/study/cie-9618-u1-data-compression/)
- [通信](https://www.owlsprep.com/zh/study/cie-9618-u2-overview/)

---

来自 [OwlsPrep](https://www.owlsprep.com) —— A-Level / IB / AP / IGCSE 免费学习指南，依据官方考纲编写。原页面：https://www.owlsprep.com/zh/study/cie-9618-u1-binary-representation-of-sound/
