智能运维中台产品系统

我要开发同款
后端AI开发2026年08月09日
5阅读

技术信息

语言技术
Python
系统类型
WebWindowsMacOS
行业分类
企业服务云计算

作品详情

行业场景

在云原生和微服务架构普及的今天,一个中型互联网公司的在线服务数量可能超过 200 个,每天产生 TB 级的监控指标、日志和告警。运维团队面临三大核心痛点:
告警风暴:一个底层故障会引发数百条上游告警,导致关键问题被淹没,平均故障定位时间(MTTD)长达 30 分钟以上。
知识孤岛:历史故障处理经验散落在工单系统、Wiki 和聊天记录中,无法被系统自动复用,重复问题反复排查。
被动响应:缺乏基于历史数据的异常预测能力,通常是在用户投诉后才开始排查,影响业务 SLA。
智能运维平台正是为解决上述问题而生,旨在将运维从“人肉救火”升级为“数据驱动的智能决策”

功能介绍

数据管道:接入 Prometheus/ELK 数据,经 Kafka 削峰,Faust 流计算做窗口聚合(1/5 分钟),存入 ClickHouse(时序)和 PostgreSQL(元数据)。
异常检测:多模型融合(Isolation Forest + 季节性分解 + LSTM),每周自动重训,MLflow 管理版本。实时推理输出异常概率,触发 Incident 并去重(指纹机制)。
RAG 诊断:上传 PDF/Word/Markdown 历史工单,BGE 向量化存 ChromaDB。异常时混合检索(向量+BM25)+ Cross-Encoder 重排,调用本地 Qwen2.5-7B 生成诊断报告(原因、步骤、案例),支持反馈闭环。
看板与告警:全局健康度评分、服务拓扑图(颜色表示状态)、异常详情页(时序图+诊断+操作),告警规则支持阈值/环比,钉钉/邮件/电话通知。
基础支撑:RBAC 权限、JWT 认证、Celery 异步处理(文档解析/模型训练)。

项目实现

架构:数据源 → Kafka → Faust 流处理 → 混合存储(ClickHouse/PostgreSQL/ChromaDB/Redis)→ FastAPI 微服务 → React 前端(WebSocket 实时推送)。
关键流程:指标突增 → Prometheus 抓取 → Kafka → 流计算聚合 → ML 推理(异常概率>0.8)→ 写 Incident → RAG 检索生成诊断 → 推送前端 + 钉钉。
选型理由:FastAPI(异步+自动文档)、Kafka(高吞吐)、Faust(Python 原生)、ClickHouse(快速聚合)、ChromaDB(轻量向量)、Ollama(本地隐私)、MLflow(模型管理)、K8s(弹性部署)。
数据模型:services、incidents(含 fingerprint 去重和 rag_diagnosis JSON)、knowledge_docs、alert_rules。
API:RESTful(概览、指标、异常、诊断、上传)+ WebSocket 告警。
高可用:K8s 多副本,Kafka/ClickHouse/PostgreSQL 集群,敏感配置用 Secret,HTTPS+mTLS,日志脱敏,数据保留 7/30 天。

示例图片

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论