面向企业内部AI业务,为内部业务系统和第三方应用提供统一的大模型推理服务。平台基于Kubernetes和Docker构建,通过GPU资源管理部署vLLM推理服务,并配套监控、日志、镜像仓库和自动化发布能力,用于保障AI模型服务稳定运行和快速发布。
点击空白处退出提示
面向企业内部AI业务,为内部业务系统和第三方应用提供统一的大模型推理服务。平台基于Kubernetes和Docker构建,通过GPU资源管理部署vLLM推理服务,并配套监控、日志、镜像仓库和自动化发布能力,用于保障AI模型服务稳定运行和快速发布。
平台主要提供大模型推理服务部署、GPU资源管理、模型服务发布、运行状态监控和故障排查等功能。通过Kubernetes管理推理服务,通过vLLM提供模型推理能力,通过Prometheus和Grafana监控GPU、节点及Pod运行状态,并使用Jenkins和Harbor实现模型服务的自动化发布和镜像管理。
1、负责Kubernetes集群的部署和日常维护,使用GPU Operator实现GPU资源纳管,并部署vLLM推理服务。
2、负责Prometheus和Grafana监控配置,对GPU利用率、显存、节点及Pod运行状态进行监控和告警;使用Jenkins完成模型服务自动化发布,使用Harbor进行镜像管理。
3、实际运维过程中处理过推理服务异常重启问题,通过查看Pod状态和日志定位到ConfigMap配置错误,修复配置后重新发布并恢复服务。



评论