在服务器CPU、内存、磁盘异常、服务不可用或响应变慢时,值班人员通常需要在日志平台、监控系统和运维手册之间反复切换,排查步骤高度依赖个人经验,新人容易遗漏关键证据。本项目面向智能运维与OnCall场景,将知识库检索、日志查询和多步骤Agent工作流结合,为值班人员生成结构化排查计划、展示工具执行过程,并根据查询结果动态调整诊断方向,帮助快速定位故障原因、降低排障门槛并提升告警响应效率。
点击空白处退出提示
在服务器CPU、内存、磁盘异常、服务不可用或响应变慢时,值班人员通常需要在日志平台、监控系统和运维手册之间反复切换,排查步骤高度依赖个人经验,新人容易遗漏关键证据。本项目面向智能运维与OnCall场景,将知识库检索、日志查询和多步骤Agent工作流结合,为值班人员生成结构化排查计划、展示工具执行过程,并根据查询结果动态调整诊断方向,帮助快速定位故障原因、降低排障门槛并提升告警响应效率。
系统提供普通问答、流式对话和智能运维诊断三类核心能力。用户可以上传Markdown运维文档,系统自动完成文本切分、向量化并写入Milvus知识库;对话时通过RAG检索相关处理方案,并返回带知识来源的回答。系统支持基于会话ID的多轮上下文记忆,以及知识库检索、当前时间查询等本地工具。运维诊断采用Plan-Execute-Replan工作流,由Planner生成排查计划,Executor通过Function Calling和MCP调用工具执行步骤,Replanner根据执行结果决定继续、调整计划或输出报告。系统已接入腾讯云CLS MCP,可查询日志集、日志主题和日志内容,并通过SSE实时推送计划、工具调用、执行状态和最终诊断结果。
本项目在AI助手协作下完成需求分析、架构设计、后端接口、Agent工作流、知识库和前端交互实现。后端采用Python 3.11、FastAPI、Pydantic Settings和uv构建,使用DashScope Embedding模型生成1024维向量,并通过Milvus完成文档索引和相似度检索;使用DeepSeek模型负责问答、结构化计划生成和工具决策。对话Agent和AIOps工作流基于LangGraph实现,包含状态传递、条件路由、会话记忆、ReAct工具循环和Plan-Execute-Replan动态重规划。外部工具通过MCP统一接入腾讯云CLS,前端使用HTML、CSS和JavaScript,并通过Fetch与SSE展示流式结果。实现过程中重点处理了模型JSON输出截断、工具重复调用、MCP连接与鉴权错误、日志主题ID错误、外部服务超时和SSE异常关闭等问题,并增加参数校验、调用轮数限制、错误反馈、解析重试和降级处理。




评论