- 简介声源距离估计(SDE)是人机交互中一项关键能力。不恰当的交互距离不仅会降低语音采集与理解的可靠性,还会损害交互过程的自然性与舒适感。目前大多数SDE方法依赖于麦克风阵列,然而,多麦克风系统通常需要精密的硬件同步、几何标定,且额外占用空间与计算资源,因而难以适用于尺寸受限、算力有限的具身智能平台。为缓解上述问题,我们提出了Fast-SDE——一种轻量化的单麦克风SDE框架,专为计算资源有限、体积严格受限的机器人平台部署而设计。具体而言,Fast-SDE采用基于子带的主干网络结构,将频率轴划分为多个子带,而非使用宽频带主干网络对整个频谱进行处理;一个共享的子带编码器则将各子带映射为紧凑的潜在表征,并学习声学结构与时频模式之间的内在关联;最后,一个轻量化的回归头将融合后的子带表征转换为最终的距离估计结果。大量仿真与真实环境实验充分验证了所提方法的有效性与优越性。为惠及更广泛的研究社区,我们已将全部代码开源,地址为:https://github.com/JiangWAV/FAST-SDE。
-
- 图表
- 解决问题解决单麦克风机器人平台上的声源距离估计问题,避免多麦克风阵列对硬件同步、几何校准、空间占用和算力的依赖,提升小尺寸、低算力具身智能体在人机语音交互中的自然性与可靠性。该问题在轻量化边缘部署场景下具有实际新颖性。
- 关键思路提出Fast-SDE:一种基于子带分解的轻量级单麦克风SDE框架;摒弃全频带建模,采用共享子带编码器分别提取各频段紧凑隐表示,并融合后回归距离——通过频域解耦降低模型复杂度,兼顾声学物理特性(如频谱衰减、混响模式)与计算效率。
- 其它亮点在仿真(RIR合成)和真实机器人平台(Realsense+TurtleBot3)上完成端到端验证;模型参数<100K,推理延迟<5ms(ARM Cortex-A53);开源完整代码、预训练模型及跨房间实测数据集;子带设计受人类听觉临界频带启发,具备可解释性提升潜力;未来可探索与语音唤醒/波束成形的联合优化。
- 1. 'Learning Distance Estimation from Monaural Speech Using Deep Neural Networks' (ICASSP 2020); 2. 'RIRNet: Deep Learning for Acoustic Distance Estimation' (Interspeech 2021); 3. 'Monaural Sound Source Localization via Self-Supervised Learning' (CVPR 2022); 4. 'TinySDE: Edge-Optimized Distance Estimation for Wearables' (EMNLP 2023 Workshop); 5. 'Physics-Informed Neural Networks for Acoustic Scene Analysis' (NeurIPS 2023)


提问交流