医疗业务结合 AI 大模型推理业务发展,原有单机部署模式稳定性不足,资源利用率低下,同时业务需要完成国产化信创改造。本项目建设混合云基础设施平台,解决业务高可用、GPU 资源调度、数据库国产化迁移、运维监控缺失等痛点,支撑医疗业务与 AI 推理服务稳定运行。
点击空白处退出提示
医疗业务结合 AI 大模型推理业务发展,原有单机部署模式稳定性不足,资源利用率低下,同时业务需要完成国产化信创改造。本项目建设混合云基础设施平台,解决业务高可用、GPU 资源调度、数据库国产化迁移、运维监控缺失等痛点,支撑医疗业务与 AI 推理服务稳定运行。
平台包含 K8s 容器集群管理、GPU 推理服务运维、统一监控告警、自动化运维、信创数据库适配五大模块。实现业务容器化编排调度,对 GPU 算力资源做管控监控;统一采集服务器、容器、数据库各项指标,配置告警通知;通过自动化脚本完成环境批量部署,同时支持业务数据库国产化迁移适配,保障医疗及 AI 业务稳定交付。
基于 Linux 环境搭建 TKE/ACK 混合 Kubernetes 集群,部署 vLLM 大模型推理服务;使用 Prometheus、Grafana 构建监控体系,Ansible 实现自动化运维;完成 MySQL 到达梦 DM8 数据库迁移调优,处理集群各类故障,输出运维 SOP 文档,保障整套基础设施稳定运转。



评论