医院智能语音助手
上海术源信息科技有限公司
面向医院场景下语音交互延迟高、医疗术语识别困难及复杂业务流程难以稳定执行等问题,设计并实现命令驱动、流程可配置的智能语音助手。

- 搭建语音交互链路,包含唤醒词检测、语音活动检测、语音识别与语音合成,其中语音活动检测使用 FSMN、语音识别使用 FUN-ASR-NANO、语音合成使用 CosyVoice、唤醒词检测基于 OpenWakeWord 框架训练,使用 Qwen、Sherpa、Kokoro、LibriTTS 四类 TTS 引擎构建多说话人、跨语言口音数据集,生成正负样本共 30 万条;设计音频增强策略,引入真实背景噪声、RIR 房间混响、变调、EQ、失真及带阻滤波,提升模型在远场、强噪声和复杂声学环境下的鲁棒性。
- 流式设计:语音通过切片传输,在用户边说话边产生语音识别结果,减少用户体感延迟,大模型的回复通过标点符号切分送入语音合成节点,减少了最终回复的延迟。
- 设计医疗热词增强机制:将手术器械、术式、医生、患者和手术名称注入 ASR,使专有名词转写准确率提升至 93.6%。
- 提供任务型对话:根据预设流程进行对话,通过多轮对话交互帮助医生完成特定任务,如排班排台、库存、护工工单等业务流程。
- 基于 LangGraph 设计命令驱动的多轮对话架构:将对话流程编排为 understand、policy、action、guard、response 五类节点;由大模型结合当前上下文生成结构化命令,系统按策略解析并循环执行,实现复杂业务流程的可靠编排,避免大模型直接控制业务逻辑。
- 设计 Tracker 与 YAML Flow 配置体系:统一管理槽位、对话历史和流程栈,支持任务中断恢复、嵌套调用、条件分支及动态跳转;通过插件化 Action 对接数据库与外部 API,实现业务流程的低代码扩展。
- 系统性能:意图识别准确率 92.4%,槽位抽取 F1 达到 89.7%,Flow 完成率 91.3%,查询平均响应时间控制在 3s 内。