医院智能语音助手
上海术源信息科技有限公司
面向医院场景下语音交互延迟高、医疗术语识别困难及复杂业务流程难以稳定执行等问题,设计并实现命令驱动、流程可配置的智能语音助手。

- 搭建语音交互链路,包含唤醒词检测、语音活动检测、语音识别与语音合成,其中语音活动检测使用 FSMN、语音识别使用 FUN-ASR-NANO、语音合成使用 CosyVoice、唤醒词检测基于 OpenWakeWord 框架训练,使用 Qwen、Sherpa、Kokoro、LibriTTS 四类 TTS 引擎构建多说话人、跨语言口音数据集,生成正负样本共 30 万条;设计音频增强策略,引入真实背景噪声、RIR 房间混响、变调、EQ、失真及带阻滤波,提升模型在远场、强噪声和复杂声学环境下的鲁棒性。
- 流式设计:语音通过切片传输,在用户边说话边产生语音识别结果,减少用户体感延迟,大模型的回复通过标点符号切分送入语音合成节点,减少了最终回复的延迟。
