随着业务稳定性要求提升,传统应急演练往往依赖人工组织、人工出题、人工观察和人工评分,存在场景覆盖不全、演练过程不可控、结果难量化等问题。共享出行/出行服务链路涉及客户端、服务端、数据库、缓存、消息队列、RPC、监控告警等多类系统,一旦出现慢查询、缓存异常、消息积压、服务调用异常等问题,容易影响用户叫车、派单、支付、履约等核心体验。本项目面向稳定性建设和应急能力提升,提供一套可配置、可自动化、可量化的考察与实操演练平台,帮助团队持续验证人员处置能力、系统可观测能力和故障恢复能力。
项目主要包含场景管理、考察管理、定时/自动下发、实操故障注入、监控观察、AI 评分与复盘分析、大盘统计等模块。管理员可以维护理论考察和实操演练场景,配置 SOP、评分点、故障模板、目标应用、机器分组、Sunfire 监控链接和告警规则。平台支持手动下发、定时下发、自动规则轮转下发,并能在实操场景中自动启动正常流量、触发故障注入、订阅告警、采集监控数据、判断注入效果和恢复情况。考察结束后,系统会沉淀分数、过程记录、薄弱点分析和团队/人员维度统计,为后续培训、复盘和稳定性改进提供依据
项目采用前后端分离和分层架构实现。后端基于 Spring Boot 与 COLA 分层,按client、domain、infrastructure、app、adapter、start 模块组织代码,使用 MyBatis/TDDL 访问数据库,集成Redis/Tair、HSF、Diamond、ScheduleX、Sunfire、故障注入平台和 AI 能力。考察、定时任务、批次、人员、场景、评分记录等数据统一持久化,并通过 data_mode 实现预发/线上共享库下的数据隔离,避免测试数据污染线上列表和大盘。前端基于 React + Ant Design 实现场景配置、考察列表、大盘和实操配置页面。项目重点难点包括多环境数据隔离、定时任务跨环境互不消费、故障注入与正常流量联动、监控链接解析、告警订阅/退订闭环,以及 AI 评分和实操判稳判效链路的可靠性。
声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!

下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态
评论