01声音本来是什么?
我们听到的声音,本来不是数字。 它来自物体振动,并让周围空气产生不断变化的压力。
这些压力变化会向四周传播,形成声波。 我们的耳朵接收到声波,就会产生听觉。
物体振动
例如琴弦、人的声带
空气压力变化
形成连续变化的声波
耳朵听见
把声波变成听觉
02麦克风先做了什么?
麦克风的任务不是“直接把声音变成 0 和 1”。 它通常会先把空气振动转换成一个连续变化的电信号。
声波
空气压力不断变化
麦克风
把声波转换成电信号
模拟电信号
仍然是连续变化的
03什么叫“采样”?
模拟声音信号是连续变化的。 数字系统不能无限细地记录每一个瞬间,所以会按照固定时间间隔去“看一眼”当前信号有多高。
这个过程叫作采样(Sampling)。
连续信号
在固定时间点取样
04一秒钟要采多少次?
一秒钟采样多少次,叫作采样率(Sample Rate)。 单位通常是 Hz(赫兹)。
每秒 8,000 次
语音通信中曾很常见
每秒 44,100 次
CD 音频使用的标准采样率
每秒 48,000 次
视频、影视和数字音频中很常见
采样率越高,理论上能记录的最高频率范围也越高。 按采样理论,要想可靠表示最高频率为 f 的信号, 采样率必须高于 2f,而且实际系统还需要留出滤波余量。
05连续的高低怎样变成整数?
采样只解决了“什么时候记录”。 但每次测到的信号强度本来仍然可以是连续值。
数字系统还要把它映射到有限个可以表示的等级, 这个过程叫作量化(Quantization)。
连续信号可能落在任意位置
变成可记录的离散数值
06位深越大意味着什么?
每个采样值用多少 Bit 来保存,叫作位深(Bit Depth)。
256 个可能的数字等级
可以表示更多等级
常见于专业录音与音频制作
位深越高,量化可以分得越细, 通常意味着更大的动态范围和更低的量化噪声。
07数字声音保存下来以后是什么?
完成采样和量化以后, 声音就可以表示成一串按时间排列的数字。
1032
2875
4201
3980
2102
850
一串采样值
这些数字按照时间顺序排列,就能描述声音波形
这种直接记录采样值的思想常见于 PCM(Pulse-Code Modulation,脉冲编码调制)。
PCM / WAV
可以保存未压缩或近似原始的 PCM 音频数据
FLAC
无损压缩,解码后可以恢复原始音频数据
MP3 / AAC
常用有损压缩,舍弃部分不重要的信息来减小文件
08播放时又怎样变回声音?
播放数字音频时,过程大致反过来: 程序读取音频数据,再把数字采样值转换成连续电信号,最后驱动扬声器振动。
读取音频数据
必要时先解码
DAC 转换
把数字信号变成模拟电信号
扬声器振动
产生空气压力变化
我们听见声音
重新回到真实世界的声波
你已经知道了什么
- 声音本来是空气中连续变化的压力波,不是数字。
- 麦克风通常先把声波转换成连续变化的模拟电信号。
- ADC 通过采样和量化,把模拟信号转换成数字数据。
- 采样率表示每秒采样多少次,例如 44.1 kHz 表示每秒 44,100 次。
- 量化把连续的信号幅度映射成有限个数字等级,因此会产生量化误差。
- 位深决定每个采样值能使用多少个等级;常见有 16 Bit、24 Bit 等。
- PCM 可以直接记录按时间排列的采样值,FLAC、MP3、AAC 等格式会进一步编码或压缩。
- 播放时,DAC 会把数字数据转换回模拟电信号,再由扬声器产生声波。
下一个问题: 图片和声音都能变成数字, 那为什么照片和视频常常特别占存储空间? 下一篇:为什么照片和视频那么占空间?