期末小论文:基于MATLAB的自然过渡配音处理方案探究

TsinghuaJoking 2022-06-26 10:43

简 介: 摘要:本文从修改视频配音的背景开始,提出自然整合修改音频的目标;通过分析环境音产生的因素,确定了录制冲激响应并与音频相卷积的处理方案;接下来通过实际测试和MATLAB处理探究了卷积方案的可行性,经过改进后效果尚可;最后提出了一套可行的流程方案并对实验中的问题进行了补充说明。
关键词 卷积音频处理冲激响应

自动化 02 2020011071孙博文

一、问题的背景与目标

1.问题提出的背景

  笔者在学习之余,在 B站( Bilibili)运营个人账号,发布一些数码产品开箱评测的视频。在视频的制作过程中,偶尔需要对原素材的音频进行修改,例如弥补口误、改正错别字和添加一些内容等。对于在宿舍以外的场景录制的素材,如果直接在宿舍为其重新配音,由于录制场景的不同,画面和声音之间会产生强烈的违和感,过渡不自然。

  2021年 12月,笔者参与了班级班剧的后期剪辑工作。在其中一幕外景中,女主的声音明显小于男主,需要进行后期配音。由于当时缺少室外拍摄的条件,后期配音的工作是在宿舍里进行的,虽然录制效果很好,但没有了室外的背景音,整合进视频后效果反而很差。

▲ 图1.1 需要后期处理的班剧片段

2.要实现的目标

  通过基于 MATLAB的音频处理,使得在宿舍等安静、没有回声的条件下录制的音频,能

  够比较自然地整合进其他环境中。这样既减轻了后期修改的工作量,也能提升最终成品视频

  的整体观感。

二、理论方案分析

1.环境音产生的因素

  在室外进行拍摄时,环境会对音频的录制产生很大的影响。麦克风接收到的声音除了视频中人物发出的直达声,还有墙壁、地面的反射声,路过机动车产生的噪音,甚至还有空气流动、麦克风自身杂音等本底噪声。

▲ 图2.1 外径拍摄时麦克风接收声音示意图

  这些声音会对最终的录制效果产生相当大的影响,是不可以忽略的。所以,麦克风接收到的声音相当于目标声音经过特定环境系统处理后的声音。如果要实现安静环境下模拟外景录音的目标,就要想办法对该系统进行描述。

2.冲激响应

  冲激响应的定义为:一个被测系统在一个脉冲激励信号输入时,所得到的时域响应特性。在声学分析中,认为冲激响应是一个系统的声学签名,包含了关于系统非常丰富的信息,包括到达时间、频率成分、混响衰减特性以及整体频率响应等。所以,通过测定冲激响应就可以得到一个系统的描述方案。

▲ 图2.2 冲激响应的构成示意图(来源网络)

3.利用卷积实现音频处理

  刚刚提到,麦克风接收到的声音相当于原声经过特定环境系统处理后的声音。设 Y为麦克风接收到的声音, X为原声, H为系统传递函数,在 s域有:

  由于系统传递函数等于该系统的冲激响应,所以 H(s)可以通过实际测定冲激响应获得。由 s域和时域的运算关系,有:

  所以,将安静环境下录制的音频与特定环境下录制的冲激响应相卷积,理论上就可以获得与在该环境下录制效果相近的音频,进而可以较和谐地整合进需要更改的素材中。

三、测试实践

1.测试方案制定

(1) 测试场景的选择

  综合实际条件与操作难易程度,将安静的录制环境选定为宿舍内部,特定的录制环境选定为浴室。由于浴室十分狭小、密闭性强,所以录制时会产生很强的回音混响,便于实验。

▲ 图3.1 特定的录制环境选定为浴室

(2) 录制设备的选择

  录制设备选择为电容式 USB麦克风。相比手机,该麦克风带有一定的降噪效果,录制出的音频为单声道,便于后续的实验操作。

▲ 图3.2 实验使用的USB麦克风

(3)测试音频的选择

  在浴室录制的音频文本为“清华大学自 02班”,在宿舍录制的音频文本为“自动化系”,目的是将其整合为“清华大学自动化系自 02班”。对于冲激信号,在测试了一系列的触发方式后,选定效果最好的打响指为信号来录制浴室的冲激响应。

2.实际测试流程

(1)在浴室录制音频

  在浴室录制“清华大学自 02班”音频,命名为“ bathvoice”。

(2)测定浴室的冲激响应

  在浴室打响指,测定浴室环境下的冲激响应,命名为“ pulse”。

(3)在宿舍录制音频

  在宿舍录制“自动化系”音频,命名为“ roomvoice”。

(4)音频波形检查

  用 GoldWave音乐软件检查音频是否为单声道,结果无异常,如下图所示:

▲ 图3.3 各音频文件的波形图,均为单声道

  其中,各声音下方较窄的一栏为整体进度条,并非第二个声道,三个音频均为单声道。

(5) MATLAB卷积

  将各音频文件导入 MATLAB,如下图:

▲ 图3.4 导入MATLAB后音频文件,采样率fs为48000

  将 roomvoice与 pulse进行卷积,命名为 ans1,即为卷积结果:

>> ans1 = conv(roomvoice,pulse)

四、测试结果分析

1.ans1效果分析

  试听 ans1,发现卷积结果杂音较重,且回响时间很长,效果并不完美。

>> sound(ans1, fs)
>> audiowrite('ans1.wav', ans1, 48000

  分析原因,用 plot命令绘制 roomvoice、pulse和 ans1的图象如下:

▲ 图4.1 RoomVoice,Pulse,Ans1波形

  观察图象,可以发现 roomvoice音频大约在 3.8秒处衰减到接近 0,ans1的波形则是在接近 4秒时才开始衰减;而且 ans1的前 4秒波形比 roomvoice要紧密很多,在弱音处也不接近 0,造成了杂音重和混响长的后果。为了解决问题,观察冲激响应 pulse,发现冲激开始时间不为零导致传输延迟,以及混响衰减斜率较小、本底噪声大导致卷积结果不理想。所以,接下来应对冲激响应 pulse进行改进。

2.冲激响应的截取

  将冲激响应 pulse的波形放大,如图:

▲ 图4.2 冲激响应放大后的图像

  对照图 3-冲激响应构成示意图,观察到从直达声到达到早期衰减结束只占冲激响应中的一小部分,剩下的部分是混响建立和混响衰减。考虑到浴室系统对声音的影响主要在于一次反射、墙壁吸附和混响,以及录音设备本身的限制,对于冲激响应,应保留直达声到达 ~混响建立部分,将其余部分舍去。这样可以保证浴室环境系统本身对于声音的处理占大部分,尽可能减弱其他因素对声音的影响。

  处理方式为:首先重新导入 pulse.m4a并命名为 pulse2,双击打开 pulse2,将开头所有的 0值删去,如图:

▲ 图4.3 删去pulse2开够的所有0值

  然后找到冲激响应开始大规模出现较小值的区域,将其之后的部分删去,例如下图的 22290~74304部分,为了达到最佳卷积效果,可能需要进行多次调节:

▲ 图4.4 删去pulse2后半段的较小值

  用 plot命令得到处理后的冲激响应如下图:

▲ 图4.5 处理后的pulse2的前半部分放大波形

3.ans2效果分析

  将 roomvoice与 pulse2进行卷积,命名为 ans2,导出为 wav文件并试听。

>> ans2 = conv(voomvoice,pulse2)
>> audiowrite('ans2.wav', ans2, 48000)
>> sound(ans2,fs)

  卷积效果非常好,接近在浴室中直接录制的 bathvoice的效果。plot命令绘制波形图如下,可见混响长度得到了很好改善,杂音问题也得到了一定程度上的解决:

▲ 图4.6 ans2的波形

  接下来利用 Adobe Premiere Pro软件,对 bathvoice和 ans2音频进行拼接,模拟实际应用中对音频的修改替换,并导出为 final.mp3。另外将 bathvoice和未经处理的音频 roomvoice进行同样的拼接,导出为 normal.mp3作为对比。final.mp3和 normal.mp3以及 Adobe Premiere Pro工程文件音频编辑 .prproj都已附在论文压缩包中。

▲ 图4.7 模拟实际应用中的拼接替换

4.处理后的音频和未处理的音频拼接对比

  试听 final.mp3和 normal.mp3,虽然处理后的音频也很容易听出来是拼接的,但相比未经处理的音频,处理后的拼接部分加入了模拟浴室环境的混响,给人一种“补充的部分也在浴室录制”的感觉,而未经处理的音频则没有这种效果。

  通过音频的对比,证明本文基于 MATLAB对音频进行的处理是有效的,能够减轻后期配音的违和感,达成自然过渡的效果。

五、实际应用和改进补充

1.一套可行的流程方案

  在外景的视频录制过程中,可以在每一个场景中都录制一个或多个冲激响应。如果后期需要修改配音,只要重新录好正确的音频,与对应场景处理过的冲激响应进行卷积,最后选择与原音频效果最接近的进行拼接,就可以实现自然过渡的效果。

2.实验中问题的补充说明

  对于本次论文中缺少实现条件的部分以及需要注意的部分总结如下:

(1) 尽量选择质量较高的录音设备

  本文的重点部分是信号的卷积,如果冲激响应接收不准,或是后期配音时的杂音过大,可能会严重影响卷积后音频的精度。本次实验中用的是 100元价位的电容麦克风,在尽量降低噪音(关门关窗)的前提下,于浴室和宿舍内部录制完成,虽然存在些底噪,但效果还算理想。如果能够采用更高级别的麦克风,在专业的录音室内录制,应该会有更好的效果。

(2) 后期配音时应注意麦克风距离

  根据笔者平日为视频配音的经验,配音时嘴部离麦克风的距离会在很大程度上影响录制

  的效果。在后期配音时,应尽量保证和麦克风间的距离与录制时一致,如果条件允许的话角度和相对位置也应尽量保持一致,这样才能达到最好的还原效果。本次实验中录制 roomvoice时受限于宿舍条件,麦克风的距离过近,导致处理后依然有较大的违和感。

(3) 完整读完一句话实现语气的还原

  冲激响应卷积能够处理音频,但不能够影响语气。所以在后期配音时尽量不要读单个的词语,而应将整句话完整读完,与原素材保证语气、音调一致,这样整合后的效果更好。本次实验中 roomvoice只录制了“自动化系”四个字,语气和原句“清华大学自 02班”差距较大,难以整合,实际应用中应避免。

(4) 借助其他软件调整响度等参数

  卷积会对音频的响度造成影响,通常表现为响度略微增大。在整合拼接时,可以用 MATLAB来调整卷积后音频的幅度,尽量与原音频吻合。也可以用 Adobe Premiere Pro等音视频处理软件来调整响度,本次实验中的 final.mp3中,三段音频分别增益为:+3.8dB、-3.3dB和+5.9dB。

▲ 图5.1 调整响度来达到更好的整合效果

参考文献:

[1] 信号与系统 2022春季学期第四次作业, https://zhuoqing.blog.csdn.net/article/details/123550045. [2]  26班剧-Video-Export,https://www.bilibili.com/video/BV1da411r7uM. [3] 声学概念解释——图解什么是脉冲响应, https://blog.csdn.net/qq_28350219/article/details/114096751. [4] 变声原理:卷积和传递函数, https://www.csdn.net/tags/MtTaAgzsNTgzNTM1LWJsb2cO0O0O.html. [5]matlab处理音频信号 33, https://www.csdn.net/tags/OtTaAgysODM2MDUtYmxvZwO0O0OO0O0O.html.



TsinghuaJoking 这是一个公众号,它不端、不装,与你同游在课下、课上。 卓晴博士,清华大学中央主楼 626A。010-62773349, 13501115467,zhuoqing@tsinghua.edu.cn
评论
  • 物联网(IoT)的快速发展彻底改变了从智能家居到工业自动化等各个行业。由于物联网系统需要高效、可靠且紧凑的组件来处理众多传感器、执行器和通信设备,国产固态继电器(SSR)已成为满足中国这些需求的关键解决方案。本文探讨了国产SSR如何满足物联网应用的需求,重点介绍了它们的优势、技术能力以及在现实场景中的应用。了解物联网中的固态继电器固态继电器是一种电子开关设备,它使用半导体而不是机械触点来控制负载。与传统的机械继电器不同,固态继电器具有以下优势:快速切换:确保精确快速的响应,这对于实时物联网系统至
    克里雅半导体科技 2025-01-03 16:11 164浏览
  • 车身域是指负责管理和控制汽车车身相关功能的一个功能域,在汽车域控系统中起着至关重要的作用。它涵盖了车门、车窗、车灯、雨刮器等各种与车身相关的功能模块。与汽车电子电气架构升级相一致,车身域发展亦可以划分为三个阶段,功能集成愈加丰富:第一阶段为分布式架构:对应BCM车身控制模块,包含灯光、雨刮、门窗等传统车身控制功能。第二阶段为域集中架构:对应BDC/CEM域控制器,在BCM基础上集成网关、PEPS等。第三阶段为SOA理念下的中央集中架构:VIU/ZCU区域控制器,在BDC/CEM基础上集成VCU、
    北汇信息 2025-01-03 16:01 173浏览
  • 国际标准IPC 标准:IPC-A-600:规定了印刷电路板制造过程中的质量要求和验收标准,涵盖材料、外观、尺寸、焊接、表面处理等方面。IPC-2221/2222:IPC-2221 提供了用于设计印刷电路板的一般原则和要求,IPC-2222 则针对高可靠性电子产品的设计提供了进一步的指导。IPC-6012:详细定义了刚性基板和柔性基板的要求,包括材料、工艺、尺寸、层次结构、特征等。IPC-4101:定义了印刷电路板的基板材料的物理和电气特性。IPC-7351:提供了元件封装的设计规范,包括封装尺寸
    Jeffreyzhang123 2025-01-02 16:50 198浏览
  • 在快速发展的能源领域,发电厂是发电的支柱,效率和安全性至关重要。在这种背景下,国产数字隔离器已成为现代化和优化发电厂运营的重要组成部分。本文探讨了这些设备在提高性能方面的重要性,同时展示了中国在生产可靠且具有成本效益的数字隔离器方面的进步。什么是数字隔离器?数字隔离器充当屏障,在电气上将系统的不同部分隔离开来,同时允许无缝数据传输。在发电厂中,它们保护敏感的控制电路免受高压尖峰的影响,确保准确的信号处理,并在恶劣条件下保持系统完整性。中国国产数字隔离器经历了重大创新,在许多方面达到甚至超过了全球
    克里雅半导体科技 2025-01-03 16:10 121浏览
  • Matter加持:新世代串流装置如何改变智能家居体验?随着现在智能家庭快速成长,串流装置(Streaming Device,以下简称Streaming Device)除了提供更卓越的影音体验,越来越多厂商开始推出支持Matter标准的串流产品,使其能作为智能家庭中枢,连结多种智能家电。消费者可以透过Matter的功能执行多样化功能,例如:开关灯、控制窗帘、对讲机开门,以及操作所有支持Matter的智能家电。此外,再搭配语音遥控器与语音助理,打造出一个更加智能、便捷的居家生活。支持Matter协议
    百佳泰测试实验室 2025-01-03 10:29 143浏览
  • 在测试XTS时会遇到修改产品属性、SElinux权限、等一些内容,修改源码再编译很费时。今天为大家介绍一个便捷的方法,让OpenHarmony通过挂载镜像来修改镜像内容!触觉智能Purple Pi OH鸿蒙开发板演示。搭载了瑞芯微RK3566四核处理器,树莓派卡片电脑设计,支持开源鸿蒙OpenHarmony3.2-5.0系统,适合鸿蒙开发入门学习。挂载镜像首先,将要修改内容的镜像传入虚拟机当中,并创建一个要挂载镜像的文件夹,如下图:之后通过挂载命令将system.img镜像挂载到sys
    Industio_触觉智能 2025-01-03 11:39 113浏览
  • 从无到有:智能手机的早期探索无线电话装置的诞生:1902 年,美国人内森・斯塔布菲尔德在肯塔基州制成了第一个无线电话装置,这是人类对 “手机” 技术最早的探索。第一部移动手机问世:1938 年,美国贝尔实验室为美国军方制成了世界上第一部 “移动” 手机。民用手机的出现:1973 年 4 月 3 日,摩托罗拉工程师马丁・库珀在纽约曼哈顿街头手持世界上第一台民用手机摩托罗拉 DynaTAC 8000X 的原型机,给竞争对手 AT&T 公司的朋友打了一个电话。这款手机重 2 磅,通话时间仅能支持半小时
    Jeffreyzhang123 2025-01-02 16:41 167浏览
  • 【工程师故事】+半年的经历依然忧伤,带着焦虑和绝望  对于一个企业来说,赚钱才是第一位的,对于一个人来说,赚钱也是第一位的。因为企业要活下去,因为个人也要活下去。企业打不了倒闭。个人还是要吃饭的。企业倒闭了,打不了从头再来。个人失业了,面对的不仅是房贷车贷和教育,还有找工作的焦虑。企业说,一个公司倒闭了,说明不了什么,这是正常的一个现象。个人说,一个中年男人失业了,面对的压力太大了,焦虑会摧毁你的一切。企业说,是个公司倒闭了,也不是什么大的问题,只不过是这些公司经营有问题吧。
    curton 2025-01-02 23:08 290浏览
  • 本文继续介绍Linux系统查看硬件配置及常用调试命令,方便开发者快速了解开发板硬件信息及进行相关调试。触觉智能RK3562开发板演示,搭载4核A53处理器,主频高达2.0GHz;内置独立1Tops算力NPU,可应用于物联网网关、平板电脑、智能家居、教育电子、工业显示与控制等行业。查看系统版本信息查看操作系统版本信息root@ido:/# cat /etc/*releaseDISTRIB_ID=UbuntuDISTRIB_RELEASE=20.04DISTRIB_CODENAME=focalDIS
    Industio_触觉智能 2025-01-03 11:37 138浏览
  •     为控制片内设备并且查询其工作状态,MCU内部总是有一组特殊功能寄存器(SFR,Special Function Register)。    使用Eclipse环境调试MCU程序时,可以利用 Peripheral Registers Viewer来查看SFR。这个小工具是怎样知道某个型号的MCU有怎样的寄存器定义呢?它使用一种描述性的文本文件——SVD文件。这个文件存储在下面红色字体的路径下。    例:南京沁恒  &n
    电子知识打边炉 2025-01-04 20:04 2浏览
  • 影像质量应用于多个不同领域,无论是在娱乐、医疗或工业应用中,高质量的影像都是决策的关键基础。清晰的影像不仅能提升观看体验,还能保证关键细节的准确传达,例如:在医学影像中,它对诊断结果有着直接的影响!不仅如此,影像质量还影响了:▶ 压缩技术▶ 存储需求▶ 传输效率随着技术进步,影像质量的标准不断提高,对于研究与开发领域,理解并提升影像质量已成为不可忽视的重要课题。在图像处理的过程中,硬件与软件除了各自扮演着不可或缺的基础角色,有效地协作能够确保图像处理过程既高效又具有优异的质量。软硬件各扮演了什么
    百佳泰测试实验室 2025-01-03 10:39 137浏览
  • 前言近年来,随着汽车工业的快速发展,尤其是新能源汽车与智能汽车领域的崛起,汽车安全标准和认证要求日益严格,应用范围愈加广泛。ISO 26262和ISO 21448作为两个重要的汽车安全标准,它们在“系统安全”中扮演的角色各自不同,但又有一定交集。在智能网联汽车的高级辅助驾驶系统(ADAS)应用中,理解这两个标准的区别及其相互关系,对于保障车辆的安全性至关重要。ISO 26262:汽车功能安全的基石如图2.1所示,ISO 26262对“功能安全”的定义解释为:不存在由于电子/电气系统失效引起的危害
    广电计量 2025-01-02 17:18 218浏览
  • 光耦合器,也称为光隔离器,是一种利用光在两个隔离电路之间传输电信号的组件。在医疗领域,确保患者安全和设备可靠性至关重要。在众多有助于医疗设备安全性和效率的组件中,光耦合器起着至关重要的作用。这些紧凑型设备经常被忽视,但对于隔离高压和防止敏感医疗设备中的电气危害却是必不可少的。本文深入探讨了光耦合器的功能、其在医疗应用中的重要性以及其实际使用示例。什么是光耦合器?它通常由以下部分组成:LED(发光二极管):将电信号转换为光。光电探测器(例如光电晶体管):检测光并将其转换回电信号。这种布置确保输入和
    腾恩科技-彭工 2025-01-03 16:27 155浏览
  • 自动化已成为现代制造业的基石,而驱动隔离器作为关键组件,在提升效率、精度和可靠性方面起到了不可或缺的作用。随着工业技术不断革新,驱动隔离器正助力自动化生产设备适应新兴趋势,并推动行业未来的发展。本文将探讨自动化的核心趋势及驱动隔离器在其中的重要角色。自动化领域的新兴趋势智能工厂的崛起智能工厂已成为自动化生产的新标杆。通过结合物联网(IoT)、人工智能(AI)和机器学习(ML),智能工厂实现了实时监控和动态决策。驱动隔离器在其中至关重要,它确保了传感器、执行器和控制单元之间的信号完整性,同时提供高
    腾恩科技-彭工 2025-01-03 16:28 161浏览
我要评论
0
点击右上角,分享到朋友圈 我知道啦
请使用浏览器分享功能 我知道啦