核心领域:语音信号处理与机器学习、语音编码与增强、汽车听觉系统、自主驾驶感知AI、多模态语音识别。
主要技术方向:
语音编码与增强:软判决信源解码与错误隐藏、人工带宽扩展(HMM/DNN)、深度噪声抑制(FCRN、LSTM、自注意力)、声学回声消除(经典/神经Kalman滤波、DNN方法)、联合回声与噪声抑制;
汽车语音与听觉系统:免提通信与车载通话系统、多通道声学回声控制、车内声学事件检测与诊断、麦克风阵列波束形成与后滤波;
自主驾驶感知AI:语义分割与单目深度估计、对抗攻击与防御、无监督域适应与连续学习、角落案例检测、神经网络性能预测、模型压缩与量化、多任务学习;
多模态语音识别:端到端自动语音识别(Transformer)、音视频融合与Turbo ASR、视听语音识别、语言迁移学习。
关键能力:具备从语音信号处理算法设计、机器学习模型开发到车载与嵌入式系统部署的完整研发链条,贯通“算法理论→标准化贡献→工业应用”的全流程。其30余年工业与学术经验(西门子、大众、GN/Jabra等合作)深度结合,形成了涵盖语音通信、自主驾驶感知与安全AI的综合技术创新体系,在ITU-T语音质量评估标准制定中发挥了重要作用。
专家详情:
【重要履历】拥有亚琛工业大学电气工程博士学位(获优异等级)。曾在西门子(Siemens AG)担任技术主管与部门副负责人,积累了丰富的语音信号处理与标准化经验。曾获IEEE Fellow、VDE ITG Fellow及AAIA Fellow等殊荣。
【技术能力】涵盖语音信号处理与机器学习的全谱系。核心方向包括:语音编码与增强(软判决解码、人工带宽扩展、深度噪声抑制、声学回声消除);汽车语音与听觉系统(免提通信、车载诊断、多通道声学回声控制);自主驾驶感知AI(语义分割、单目深度估计、对抗攻击与防御、无监督域适应、连续学习、角落案例检测);多模态语音识别(端到端ASR、Transformer、音视频融合)。他在语音质量评估标准化(ITU-T P.1100/P.1110/P.1130)方面亦有重要贡献。
【标志性成果】在IEEE T-ASLP发表多篇经典论文(其中两篇获ITG奖),获得CVPR Workshops多次最佳论文奖】,并与大众、GN/Jabra等企业长期合作。其作为主编出版《Deep Neural Networks and Data for Automated Driving》专著(Springer, 2022),Google Scholar h-index达37。主持的科研项目总经费超760万欧元,涵盖DFG、BMBF、BMWi等国家级项目,指导13名博士生,在语音增强与自动驾驶感知交叉领域形成了深远影响。
