
一起动脑筋 · 先看一个小故事
女孩说“明天三点”,机器人把声音写成文字。检查记录时,她发现“三”可能被听成“四”。
把过程摊开来看
- 音频输入录下语音
- 识别计算估计文字序列
- 文本输出形成记录
- 人工校对数字与专名
语音转文字用模型把音频映射成文本。
系统可能结合声音线索和语言模式,遇到同音词、名字或噪声时仍会出错。
时间、金额和姓名等关键内容最好回听核对;标点也可能是模型根据上下文补出的。
轮到你来试一试
把“三点”转成“四点”,只是无关紧要的错别字吗?
想好了吗?点开看解释
不是,含义和安排都改变了。数字等关键字段尤其需要复核。
带走一个发现
语音转文字用模型把音频映射成文本。
试着遮住上面的图,把每一步讲给家人听。如果某一步说不清楚,就回到那张卡片再看一遍。