add README

96ad1c7c · shihm · 96ad1c7c
Commit 96ad1c7c authored Mar 04, 2026 by shihm
Show whitespace changes
Inline Side-by-side

Showing with 11 additions and 0 deletions

README.md README.md +11 -0

No files found.
--- a/README.md
+++ b/README.md
+speech_fsmn_vad_zh-cn-16k-common-pytorch
+
+模型简介
+
+FSMN-Monophone VAD是达摩院语音团队提出的高效语音端点检测模型，用于检测输入音频中有效语音的起止时间点信息，并将检测出来的有效音频片段输入识别引擎进行识别，减少无效语音带来的识别错误.
+
+模型原理介绍
+FSMN-Monophone VAD是达摩院语音团队提出的高效语音端点检测模型，用于检测输入音频中有效语音的起止时间点信息，并将检测出来的有效音频片段输入识别引擎进行识别，减少无效语音带来的识别错误。
+
+
+FSMN-Monophone VAD模型结构如上图所示：模型结构层面，FSMN模型结构建模时可考虑上下文信息，训练和推理速度快，且时延可控；同时根据VAD模型size以及低时延的要求，对FSMN的网络结构、右看帧数进行了适配。在建模单元层面，speech信息比较丰富，仅用单类来表征学习能力有限，我们将单一speech类升级为Monophone。建模单元细分，可以避免参数平均，抽象学习能力增强，区分性更好。