Skip to main content

PROJECT EXPERIENCE

项目经历

医院智能语音助手

上海术源信息科技有限公司

面向医院场景下语音交互延迟高、医疗术语识别困难及复杂业务流程难以稳定执行等问题,设计并实现命令驱动、流程可配置的智能语音助手。

Rasa Pro 框架
打开大图
Rasa Pro 框架介绍图
  • 搭建语音交互链路,包含唤醒词检测、语音活动检测、语音识别与语音合成,其中语音活动检测使用 FSMN、语音识别使用 FUN-ASR-NANO、语音合成使用 CosyVoice、唤醒词检测基于 OpenWakeWord 框架训练,使用 Qwen、Sherpa、Kokoro、LibriTTS 四类 TTS 引擎构建多说话人、跨语言口音数据集,生成正负样本共 30 万条;设计音频增强策略,引入真实背景噪声、RIR 房间混响、变调、EQ、失真及带阻滤波,提升模型在远场、强噪声和复杂声学环境下的鲁棒性。
  • 流式设计:语音通过切片传输,在用户边说话边产生语音识别结果,减少用户体感延迟,大模型的回复通过标点符号切分送入语音合成节点,减少了最终回复的延迟。
  • 设计医疗热词增强机制:将手术器械、术式、医生、患者和手术名称注入 ASR,使专有名词转写准确率提升至 93.6%。
  • 提供任务型对话:根据预设流程进行对话,通过多轮对话交互帮助医生完成特定任务,如排班排台、库存、护工工单等业务流程。
  • 基于 LangGraph 设计命令驱动的多轮对话架构:将对话流程编排为 understand、policy、action、guard、response 五类节点;由大模型结合当前上下文生成结构化命令,系统按策略解析并循环执行,实现复杂业务流程的可靠编排,避免大模型直接控制业务逻辑。
  • 设计 Tracker 与 YAML Flow 配置体系:统一管理槽位、对话历史和流程栈,支持任务中断恢复、嵌套调用、条件分支及动态跳转;通过插件化 Action 对接数据库与外部 API,实现业务流程的低代码扩展。
  • 系统性能:意图识别准确率 92.4%,槽位抽取 F1 达到 89.7%,Flow 完成率 91.3%,查询平均响应时间控制在 3s 内。

医疗助手 Agent 系统

上海术源信息科技有限公司

传统单 Agent 医疗问答存在响应慢、复杂问题分析不全面、缺乏上下文记忆等问题,多症状问题回答质量不稳定,多轮对话上下文理解准确率偏低等问题。

  • Skills-Agent 两层架构:底层构建 7 个原子 Skills(知识检索、风险评估、症状分析、麻醉建议、ICD-10 编码、临床指南、深度研究)供 Agent 使用,上层 3 个专业 Agent(风险提示、症状诊断、医学研究)根据任务需求自主选择调用,Skills 和 Agent 完全解耦。
  • Agent Loop 执行机制:基于 ReAct 框架实现 Think-Act-Observe 循环,LLM 自主决策工具调用并观察结果,设置硬性限制最多调用 3 次工具防止过度调用,单 Agent 平均响应时间控制在 15 秒以内。
  • 双层记忆机制:短期记忆管理会话级对话历史(单例模式确保所有 Agent 共享会话上下文,集成熵管理器自动去重压缩消息 35%,加载最近 5 轮对话),长期记忆通过 Mem0 云服务向量化存储会话总结支持跨会话相似案例检索。
  • Harness Engineering 约束系统:通过 YAML 文件显式定义 Agent 能力边界并运行时自动验证,实现输出自动修复机制(缺少免责声明自动添加、检测到高危症状自动添加就医警告)。
  • 底层 VLM 模型训练:基于 Qwen3.5-9B 训练医疗问答 VLM 模型作为 3 个 Agent 的推理引擎,采用两阶段训练(SFT 阶段用 40 万条医疗 VQA 数据全参数微调,RL 阶段用 GSPO 算法训练 10 万条数据,采用多维度复合奖励机制)。
  • 系统性能:智能路由准确率从 88% 提升至 95%,知识库检索准确率 87%,单 Agent 响应时间 5-15 秒,Swarm 响应时间 20-30 秒,多轮对话上下文理解准确率从 60% 提升至 92%。
  • 回答质量:医学专业人员三维度盲评打分,系统回答质量 4.5 分 vs doubao-seed-2.0-pro 3.9 分。
  • 模型能力:VLM 模型平均得分从基座 0.58 提升至 0.78,AB test 得分 0.78 vs DeepSeek-V4-flash 0.72 / GLM-5 0.75,部署后 LLM 单次推理 2-5 秒、服务可用性 99.8%。

医疗知识图谱

上海术源信息科技有限公司

面向互联网医疗场景下医学知识分散、非结构化数据难以利用及传统关键词检索语义理解能力不足等问题,设计并实现基于 Neo4j 的医疗知识图谱,为智能问答、医疗客服等上层 AI 应用提供结构化知识与检索能力。

项目架构
打开大图
互联网医疗知识图谱项目架构图
  • 参与医疗知识图谱整体架构设计与数据建模,围绕疾病、症状、科室、诱因、并发症、药物、食物及传播途径等医学实体设计图谱 Schema,并基于 Neo4j 完成实体、属性及多类型关系的图结构存储与管理。
  • 搭建多源医疗数据处理管道,整合开源医疗知识图谱、医学标注数据集以及医学书籍、期刊等非结构化数据;针对英文医学文献增加翻译预处理流程,并对不同来源数据进行清洗、标准化、实体对齐与统一入库。
  • 基于百度 UIE 通用信息抽取模型实现医学实体与关系抽取,构建疾病、症状、诱因、并发症等实体及关系的 Schema Prompt;针对原始模型在医疗垂直场景下抽取效果不足的问题,人工构建约 3 万条标注数据进行微调,使实体关系抽取 F1 提升至 88%。
  • 设计“模型抽取 + 人工审核”的知识入库机制,对模型生成的医学实体、关系及属性进行人工校验后写入 Neo4j,降低自动抽取错误造成的知识污染,保证图谱数据质量与医学知识可靠性。
  • 基于 Neo4j 构建全文检索与向量检索双路查询能力:全文索引用于疾病、症状、药物等医学术语的关键词匹配;向量检索采用 BAAI/bge-small-zh-v1.5 生成 512 维 Embedding,并基于 Neo4j HNSW 向量索引实现医学知识的语义相似度检索。
  • 面向上层智能问答与医疗客服应用封装图谱查询能力,通过实体检索、关系查询及语义召回实现疾病相关症状、诱因、并发症、药物等关联知识查询,为后续医疗 RAG 与智能问答系统提供知识层数据支撑。

保持联系

正在寻找 AI 应用、大模型与智能 Agent 方向的算法工程师机会,欢迎联系交流。

2026 © 周烨伟

AI 算法工程师作品集