RTC(实时音视频通信)技术的快速发展,助力了直播、短视频等互动娱乐形式的普及;在全球疫情持续蔓延的态势下,云会议需求呈现爆发式增长,进一步推动了 RTC 行业的快速发展。为了给客户提供稳定可靠的服务,网络系统方面需要不断提升频道连通率,降低会议过程中的断流率,增强抗弱网能力;视频方面需要提升视频清晰度,降低视频卡顿率等,音频方面在追求端到端 MOS 的同时,也要重点关注音频 3A 算法的效果,这些都是各厂家必须修炼的 “内功”,也是最终沉淀下来的核心竞争力。本文将重点阐述硬件设备采集的音频质量对 RTC 端到端音频体验的重要性。
在 RTC 架构中,端到端的音频信号处理流程大致如下图,上行分别经过了音频信号的采集,音频 3A(AEC: 回声消除、ANS: 自适应降噪和 AGC: 自动增益控制)和编码;下行分别经过丢包恢复,解码,混音和播放。
端到端的音频信号处理流程
不难看出,音频信号经过模数转换,再经过设备集成的音频信号处理芯片,最后才传递给 RTC SDK。由于硬件厂商的不同,音频采集解决方案参差不齐,因此采集到的音频质量的好坏直接影响着 3A 算法拿到的生产资料的可用性,同时也决定这最终用户接收到音频信号质量的上限。根据实际工作中遇到的音频问题,因为设备采集引起的问题基本可以归纳为如下几类:
举几个例子:
采集异常主要体现在频谱 “模糊”,严重的会导致无法听懂语义,影响正常交流。如下语谱图。
另外,采集异常后,播放的信号被麦克风采集后也会表现出异常,从而引起严重的非线性失真,影响回声消除效果,如下图。
常见的就是采集丢数据,听感上会听到有很多高频噪点(下图为上图中噪点放大后的局部图),严重的会影响 AEC 算法中对延时估计准确性和远近端非因果问题,严重的会导致漏回声。
采集爆音问题主要发生在 PC,也是 PC 端设备最应该避免的问题,影响较大,除了截顶导致的频谱失真之外,严重的非线性失真会影响回声消除效果。爆音问题需要 AGC 算法通过自适应调节 PC 端模拟增益以及麦克风加强解决。
频谱缺失主要是硬件回调的音频采样率与实际的频谱分布不一致,即使编码器给到很高的编码码率,听感上也没有高音质的效果,如下图,采集信号采样率为 48kHz,但是频谱上限却只有 8k。
具备 RTC 能力的硬件设备早已渗透我们生活的方方面面,常见的如移动端手机和 PC,现在甚至连儿童电话手表,天猫精灵以及各种高端的指纹密码锁等设备都支持了 RTC。然而,设备的多样性直接决定这采集能力的差异性,抛开声学元器件设计差异这一因素,就 Android 端而言,芯片和软件系统的差异使得同一品牌的手机,也没办法用同一种配置适配所有型号的手机。
另外,现在绝大多数的移动端设备都自带硬件音频信号处理(后称硬件 3A)能力,不同芯片效果方面也是千差万别的同时,更严重的是经过硬件处理的音频信号频谱往往会有缺失,如开启硬件 3A 后回调到 RTC SDK 的音频信号频谱上限仅支持到 8k,相当于 16kHz 采样的音频信号,尤其在娱乐方面根本无法满足我们对高音质的追求。因此,做好硬件层的适配工作,是保障 RTC 高质量音频体验的基础。
(1)需要搞清楚 javaaudioclass 和 opensles 这两种模式的差异,以及各自需要适配的参数,掌握关闭硬件 3A 的配置。
(2)采集抖动或音频音量异常,可以试试更改请求的采样率,通常设置的 48k 采样不会适用于所有的 android 设备。
(1)当前很多Windows设备会在屏幕上形成一个画面,提供这个音频增强功能,触发方式如下图。内第一语音,“隔离”的拾音区域以外的“噪音”,其主要的技巧端就可以开启此功能,只有支持8k,而且各厂家增强肌力存在差异,也不会齐。因此,效果软件需要具备能够绕过硬件自带音频增强功能的能力,为高音质做保障。
Windows设备自带的双麦阵列(图片来源于网络)
音频设置中的增强功能开关
开启音频增强后,带来的极限
(2)全景方面PC端设备都支持模拟增益,还有很多辅助功能的Windows 设备额外的增强(如下图)软件软件说明(3A中的AGC)需要具备能力调节他们的保证,音频采集的爆发以控制收集底建立。初值设置或调整方法导致的小音等问题,严重的会影响回声删除和能力的效果,带来影响可用性的风险。
模拟收益与发展壮大
(1)ios端适配工作智能,需要熟悉硬件3A的配置,因为ios设备自带的硬件3A 自拍也只能支持到10k-12k。
(2)Mac 笔记本电脑比较,只是提供了模拟增益。简单但有需要注意,RTC 在支持双播放时一点,因为会与某一特定对象在同一时间,导致播放音频时附近的拍摄采集爆音问题,普通优化软件AEC算法解决。
当 48k 高音质刚好需要,为了保护采集的现金,需要及时去掌握参数的标准,同时出现的 Android 设备(手表,智能电视)等),也需要先确定好配置;参数加上硬件设备自带的音频处理功能,可以让RTC自带的纯软 3A算法也是一种趋势,假设是要优化好软件的3A算法整体效果以及控制好试机,各厂商的主播体验也必测,也是各厂家的核心装备这一项。
「视频云技术」你最值得关注的视频技术公众号,每周一次的来自阿里云一线的技术文章,带来音与视频领域现场工程师交流切磋。大众号后台回复【技术】可加入阿里云视频云产品技术交流群,和大咖信息一起探讨语音视频,获取更多行业最新消息。