企业内部多条业务线各自上报运行日志与异常码,存在口径不统一、告警分散、异常定位效率低的问题:同一类问题在不同接入方的错误码含义不同,无法横向比对与快速定位。本系统统一接入各业务线日志数据,提供批量采集、分类聚合、阈值告警与按接入方维度的异常定位能力。
点击空白处退出提示
企业内部多条业务线各自上报运行日志与异常码,存在口径不统一、告警分散、异常定位效率低的问题:同一类问题在不同接入方的错误码含义不同,无法横向比对与快速定位。本系统统一接入各业务线日志数据,提供批量采集、分类聚合、阈值告警与按接入方维度的异常定位能力。
项目包含以下功能模块:①日志批量接入,基于 RocketMQ 批量消费与削峰;②批量写入数据管道,基于 Redis Pipeline 合并请求、批量提交;③异常码分类聚合与统计分析;④阈值告警引擎,告警规则可配置化、按级别路由通知渠道;⑤错误码段位与分类口径管理,统一 3 个接入方的上报口径;⑥按业务线维度的查询与异常定位。
本人作为 3 人开发小组负责人,负责需求分析与核心功能实现。关键优化:通过 RocketMQ 批量消费与 Redis Pipeline 批量提交,将单条日志的存储请求次数由 10+ 次降至 2 次,显著减少网络往返开销。难点在高频写入下的批量聚合窗口设计,以及 3 个接入方错误码口径不一致的治理——需在不动对方系统代码的前提下完成口径映射与统一。



评论