语音识别原理五分钟就能弄懂 _生活百科

文章插图
1、首先，我们知道声音实际上是一种波。常见的mp3、wmv等格式都是压缩格式，必须转成非压缩的纯波形文件来处理，比如Windows PCM文件，也就是俗称的wav文件。wav文件里存储的除了一个文件头以外，就是声音波形的一个个点了。
2、在开始语音识别之前，有时需要把首尾端的静音切除，降低对后续步骤造成的干扰。这个静音切除的操作一般称为VAD，需要用到信号处理的一些技术。
3、每帧的长度为25毫秒，每两帧之间有25-10=15毫秒的交叠。我们称为以帧长25ms、帧移10ms分帧。每帧的长度为25毫秒，每两帧之间有25-10=15毫秒的交叠。我们称为以帧长25ms、帧移10ms分帧。
4、分帧后，语音就变成了很多小段。但波形在时域上几乎没有描述能力，因此必须将波形作变换。常见的一种变换方法是提取MFCC特征。
5、至此，声音就成了一个12行（假设声学特征是12维）、N列的一个矩阵，称之为观察序列，这里N为总帧数。观察序列如下图所示，图中，每一帧都用一个12维的向量表示，色块的颜色深浅表示向量值的大小。
6、接下来就要介绍怎样把这个矩阵变成文本了。首先要介绍两个概念：音素：单词的发音由音素构成。对英语，一种常用的音素集是卡内基梅隆大学的一套由39个音素构成的音素集，参见The CMU Pronouncing Dictionary 。
【语音识别原理五分钟就能弄懂】7、语音识别是怎么工作的呢？实际上一点都不神秘，无非是：第一步，把帧识别成状态（难点）；第二步，把状态组合成音素；第三步，把音素组合成单词。

语音识别原理五分钟就能弄懂

推荐阅读

快手怎么解除禁言

中国石油大学分数线中国石油大学研究生分数线

最可爱的女生网名最可爱的女生网名二字

孩子学习不好如何和老师沟通

刀下一壶酒指是什么酒

东张西望到处看优柔寡断难成事东张西望到处看优柔寡断难成事打一肖

由柑指的是什么关于由柑的介绍

只恋爱不结婚是哪个星座的爱情宗旨？

京东618红包在哪里领取的京东618红包在哪里领取

2020年11月05日白羊座事业爱情运势

不落地的折纸滑翔机怎么折不落地的折纸滑翔机

红旗汽车生产基地在哪里

我是处女座女孩真的很讨厌很讨厌双子男

丁香花需要天天浇水吗

清凉油怎么打开盖子

猪年本命年给女生买什么礼物好女生送猪铃铛说明什么

小男孩的乳名大全2022，小男孩的乳名大全2020

网易亲时光可以添加两个相册吗

安居电视剧马倩大结局电视剧里的拆迁你还记得么？

奔驰车用什么机油奔驰车用什么机油保养好

语音识别原理 五分钟就能弄懂

推荐阅读

语音识别原理五分钟就能弄懂