VS语音信号处理(3) sonic变速不变调调试记录(二)

2023-10-07 12:50

本文主要是介绍VS语音信号处理(3) sonic变速不变调调试记录(二),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

VS语音信号处理(3)sonic变速不变调调试记录(二)

  • 前言
  • 一. main函数
  • 二. 生成编译
  • 三. 小结

前言

语音识别相关算法一般在MATLAB上进行仿真验证与实验,在工程上一般还是在VS中进行实现落地,本系列将介绍语音信号处理在C语言中的一系列应用,后期将以此为基础,再落地移植到嵌入式平台。

今天介绍sonic语音变速不变调算法的工程应用。libsonic是一个支持音频倍速播放的开源库。支持大于2倍速的播放。有ANSI C的版本,也有纯Java的版本。无外部依赖能够方便的集成进自己的应用中。

具体工程以及sonic.cpp与sonic.h文件见第一篇文章:VS语音信号处理(3) C语言调用sonic进行变速不变调工程实例
第一次调试记录见sonic的第二篇文章:VS语音信号处理(3) sonic变速不变调调试记录(一)

上述文章直接用的例程中的main函数,输入输入均为PCM语音文件,经过几天的摸索,发现也可以对WAV语音文件进行直接处理,同时发现之所以生成语音的长度不一就是因为帧数与帧长度参数的设置问题,上次调试的遗留问题加速时自适应语音长度,找到了一个比较粗糙的方法,就是首先读取语音的数据长度,再根据总长度调整帧数与帧长度,目前测试得到的数据显示是帧长度与帧数时相关的,语音较长时,帧长度过短,生成的加速语音长度也会比较短,所以讲帧长度与帧数调整为相同,这样生成的加速语音基本上可以保证语音得到加速,并且时长正好是源语音的一半,但这样可能导致语音帧长度较长,以本实例中语音为例,帧长度为90,显然唱过常用的帧长度20~30,而生成的减速语音则完成了语音的减速,但语音长度无法拉长,导致只能得到一半的减速语音,这里还需要进一步学习理解。直接对main函数进行调整如下:

一. main函数

// main.cpp
// sonic进行变速不变调处理
// date:2022-5-16 23:04:19
// author : C.S#include <time.h>
#include <cstring>
#include <iostream>
#include <memory>
#include <queue>
#include <set>
#include <vector>#include "sonic.h"//#define DROP_FRAMEconst int MAXN = 1e6 + 7;const int FRAMESIZE = 8000 / (1000 / 20) * 2;typedef std::pair<int, int> pii;std::set<pii> jitterLine;typedef long long ll;bool isInLine(int pos) 
{for (auto x : jitterLine) {if (x.first <= pos && x.second >= pos) {return true;}}return false;
}void dumpLine() {for (auto x : jitterLine){printf("begin:%d, len:%d beginTime:%lf\n", x.first, x.second - x.first,x.first * 20.0 / 1000);}
}ll calLvl(uint16_t *buffer, int len) {ll sum = 0;for (int i = 0; i < len; ++i) {sum += (buffer[i] * buffer[i]);}return sum;
}void spedUp(uint16_t *outBuf, uint16_t *inBuf1, uint16_t *inBuf2) {int p = 0;for (int i = 0; i < FRAMESIZE; ++i) {if (i & 1) {outBuf[p++] = inBuf1[i];}}for (int i = 0; i < FRAMESIZE; ++i) {if (i & 1) {outBuf[p++] = inBuf2[i];}}
}const double eps = 1e-6;int main(int argc, char *argv[]) 
{FILE *file1 = fopen("xinwenlianbo.wav", "rb");FILE *out_file = fopen("outSped.wav", "wb");fseek(file1, 0, SEEK_END);//文件指针从0挪到尾部long filesize;filesize = ftell(file1);//ftell求文件指针相对于0的字节数,就求出了文件字节数rewind(file1);//还原指针位置int processFrameCount = sqrt((filesize-44)/ FRAMESIZE)+1;  //关键参数:语音帧数 int maxJitterSize = processFrameCount;                     //关键参数:帧长度?double speed = 2.0;                                        //关键参数:调整倍速uint8_t *inBuf = new uint8_t[MAXN];uint8_t *it = inBuf;uint8_t addBuf[MAXN] = { 0 };srand(time(0));/* generate jitter */int begin = 1;int len = maxJitterSize;jitterLine.insert(std::make_pair(begin, begin + len));/* dump jitter */
#ifdef DROP_FRAMEprintf("this frame will be frop!\n");
#elseprintf("this frame will be set mute!\n");
#endifdumpLine();/* if p is in jitter range then repalce it into mute frame */for (int p = 0; p < processFrameCount; ++p){if (isInLine(p)){it = inBuf;for (int i = 0; i < maxJitterSize; ++i) {fread(it, 1, FRAMESIZE, file1);it += FRAMESIZE;}sonicChangeShortSpeed((short int *)inBuf, maxJitterSize * FRAMESIZE,speed, 1.0f, 1.0f, 1.0f, 0, 8000, 1);fwrite(inBuf, 1, (1.0 * maxJitterSize / speed + eps) * FRAMESIZE, out_file);}else if(p==0){fread(inBuf, 1, FRAMESIZE, file1);fwrite(inBuf, 1, FRAMESIZE, out_file);}}return 0;
}

代码添加完毕,准备好一个语音文件:xinwenlianbo.pcm,放在源文件目录下
在这里插入图片描述

二. 生成编译

点击目录栏“生成”中“生成解决方案”,生成成功后,调试运行,生成一个outSped.wav文件,调用成功。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

speed = 2.0时原语音与变速语音波形(Cool Edit打开查看)
在这里插入图片描述
speed = 0.5时变速语音波形(Cool Edit打开查看)
在这里插入图片描述

三. 小结

加速减速试听效果都不错,但仍存在以下问题:
(1)减速时,语音长度无法加长,即有一半减速语音未生成;
(2)自适应语音帧数与帧长度的计算有待进一步验证;

后期根据学习了解,还需要进行相应的调整,并在工程中进行语音的变速不变调,完成调试后再进行具体的介绍。

这篇关于VS语音信号处理(3) sonic变速不变调调试记录(二)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/157850

相关文章

JavaScript中的高级调试方法全攻略指南

《JavaScript中的高级调试方法全攻略指南》什么是高级JavaScript调试技巧,它比console.log有何优势,如何使用断点调试定位问题,通过本文,我们将深入解答这些问题,带您从理论到实... 目录观点与案例结合观点1观点2观点3观点4观点5高级调试技巧详解实战案例断点调试:定位变量错误性能分

Go语言网络故障诊断与调试技巧

《Go语言网络故障诊断与调试技巧》在分布式系统和微服务架构的浪潮中,网络编程成为系统性能和可靠性的核心支柱,从高并发的API服务到实时通信应用,网络的稳定性直接影响用户体验,本文面向熟悉Go基本语法和... 目录1. 引言2. Go 语言网络编程的优势与特色2.1 简洁高效的标准库2.2 强大的并发模型2.

基于Spring Boot 的小区人脸识别与出入记录管理系统功能

《基于SpringBoot的小区人脸识别与出入记录管理系统功能》文章介绍基于SpringBoot框架与百度AI人脸识别API的小区出入管理系统,实现自动识别、记录及查询功能,涵盖技术选型、数据模型... 目录系统功能概述技术栈选择核心依赖配置数据模型设计出入记录实体类出入记录查询表单出入记录 VO 类(用于

java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)

《java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)》:本文主要介绍java中pdf模版填充表单踩坑的相关资料,OpenPDF、iText、PDFBox是三... 目录准备Pdf模版方法1:itextpdf7填充表单(1)加入依赖(2)代码(3)遇到的问题方法2:pd

在IntelliJ IDEA中高效运行与调试Spring Boot项目的实战步骤

《在IntelliJIDEA中高效运行与调试SpringBoot项目的实战步骤》本章详解SpringBoot项目导入IntelliJIDEA的流程,教授运行与调试技巧,包括断点设置与变量查看,奠定... 目录引言:为良驹配上好鞍一、为何选择IntelliJ IDEA?二、实战:导入并运行你的第一个项目步骤1

Zabbix在MySQL性能监控方面的运用及最佳实践记录

《Zabbix在MySQL性能监控方面的运用及最佳实践记录》Zabbix通过自定义脚本和内置模板监控MySQL核心指标(连接、查询、资源、复制),支持自动发现多实例及告警通知,结合可视化仪表盘,可有效... 目录一、核心监控指标及配置1. 关键监控指标示例2. 配置方法二、自动发现与多实例管理1. 实践步骤

在Spring Boot中集成RabbitMQ的实战记录

《在SpringBoot中集成RabbitMQ的实战记录》本文介绍SpringBoot集成RabbitMQ的步骤,涵盖配置连接、消息发送与接收,并对比两种定义Exchange与队列的方式:手动声明(... 目录前言准备工作1. 安装 RabbitMQ2. 消息发送者(Producer)配置1. 创建 Spr

k8s上运行的mysql、mariadb数据库的备份记录(支持x86和arm两种架构)

《k8s上运行的mysql、mariadb数据库的备份记录(支持x86和arm两种架构)》本文记录在K8s上运行的MySQL/MariaDB备份方案,通过工具容器执行mysqldump,结合定时任务实... 目录前言一、获取需要备份的数据库的信息二、备份步骤1.准备工作(X86)1.准备工作(arm)2.手

SpringBoot3应用中集成和使用Spring Retry的实践记录

《SpringBoot3应用中集成和使用SpringRetry的实践记录》SpringRetry为SpringBoot3提供重试机制,支持注解和编程式两种方式,可配置重试策略与监听器,适用于临时性故... 目录1. 简介2. 环境准备3. 使用方式3.1 注解方式 基础使用自定义重试策略失败恢复机制注意事项

Python UV安装、升级、卸载详细步骤记录

《PythonUV安装、升级、卸载详细步骤记录》:本文主要介绍PythonUV安装、升级、卸载的详细步骤,uv是Astral推出的下一代Python包与项目管理器,主打单一可执行文件、极致性能... 目录安装检查升级设置自动补全卸载UV 命令总结 官方文档详见:https://docs.astral.sh/