vad系列

最新推荐文章于 2024-12-26 09:51:03 发布

转载最新推荐文章于 2024-12-26 09:51:03 发布

· 362 阅读

·

0

·

版权

原文链接：http://t.zoukankan.com/yunhgu-p-14925412.html

文章标签：

vad 专栏收录该内容

2 篇文章

订阅专栏

以后会将webrtc原理及应用详细解决
简介
Google开源的用于人声识别，输入支持10ms,20ms,30ms的音频段，采样率支持8000, 16000, 32000 or 48000 Hz
github 地址：https://github.com/wiseman/py-webrtcvad
python中安装以及使用
直接pip进行安装
pip install webrtcvad
使用

创建一个 Vad 对象：

import webrtcvad
vad = webrtcvad.Vad()

可选地，设置它的攻击性模式，它是一个介于 0 和 3 之间的整数。0 是过滤非语音的最不积极的，3 是最积极的。（您也可以在创建 VAD 时设置模式，例如 vad = webrtcvad.Vad(3)）：

vad.set_mode(1)

给它一小段（“帧”）的音频。 WebRTC VAD 仅接受 16 位单声道 PCM 音频，采样频率为 8000、16000、32000 或 48000 Hz。帧的持续时间必须为 10、20 或 30 毫秒：

在 10 毫秒的静默状态下运行 VAD。结果应该是False。

sample_rate = 16000
frame_duration = 10 # 毫秒
frame = b’x00x00’ * int(sample_rate * frame_duration / 1000)
prtin(‘Contains speech：%s’ % (vad.is_speech(frame, sample_rate) )

参考：http://t.zoukankan.com/yunhgu-p-14925412.html

博客等级

码龄6年

69
原创

270
点赞

809
收藏

128
粉丝

关注

私信

热门文章

分类专栏

展开全部收起

上一篇：: kaldi源码解析实践

下一篇：: 交叉熵损失函数（Cross Entropy Loss）、散度（KL）

最新评论

AI-疑难杂题
优快云-Ada助手: 不知道 Python入门技能树是否可以帮到你：https://edu.youkuaiyun.com/skill/python?utm_source=AI_act_python
VLLM本地部署Qwen2-7B-Instruce
zx超: 可以使用qwen的swift部署
VLLM本地部署Qwen2-7B-Instruce
qq_34964218: 大佬你好，想请教一下如何在无GPU的Linux上通过vllm部署qwen2模型啊，跪谢了
python的logger日志
北风之神c: 总结的很全面，写得赞，博主用心了。此国产日志 https://nb-log-doc.readthedocs.io/zh_CN/latest 使用原生 loggng封装，兼容性和替换性100%,大幅简化logging的使用。 1、日志能根据级别能够自动变彩色。 1 2、print自动变彩色。 3、日志和print在pycahrm控制台的输出都自动可以点击跳转到文件和行号。 4、多进程日志切割安全，文件日志写入性能高。 5、入参简单，能一键自动记录到多种地方。 6、 nb_log 兼容包含loguru色彩模式,loguru只是nb_log的子集之一. 相比 loguru 有10胜。 pip install nb_log 。
阿里-paraformer论文详解
2401_82881085: funasr的特征提取就是funasr的特征提取嘛老师

大家在看

最新文章

目录

展开全部

收起

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。