01
发现故障太晚
设备掉线、链路抖动、CPU 飙升往往等业务投诉后才被发现。
秒级告警 + 风险排序
路由器、交换机、防火墙、服务器统一接入。状态、拓扑、告警、配置变更和趋势数据集中展示,让值班人员更早发现问题、更快定位影响面。
运维痛点
集中查看设备状态、故障影响与待处理告警。
设备掉线、链路抖动、CPU 飙升往往等业务投诉后才被发现。
线路改过、设备换过,网络结构在文档里和真实环境里对不上。
同一个问题连续推送几十条,真正要处理的信息被淹没。
出了故障才发现配置被改过,但不知道哪台设备、哪个接口、什么时候改的。
核心能力
从设备监控到配置审计,覆盖日常网络运维。
在线状态、CPU、内存、端口流量、采集成功率集中展示,风险设备优先露出。
拓扑不只是图,而是能反映在线、离线、告警和链路质量的实时视图。
同设备同类型问题进入去重窗口,减少刷屏,让关键告警更突出。
自动备份设备配置,逐行对比差异,变更后自动生成事件记录。
型号、IP、区域、负责人、端口、标签集中维护,替代分散台账。
按角色开放功能入口,关键配置和告警处理动作保留审计记录。
处理闭环
Worker 定时轮询设备指标,写入时序库并记录采集质量。
阈值、连续次数、链路质量和设备状态共同决定告警级别。
Redis 滑动窗口合并重复告警,只把需要处理的事件推送出去。
关联设备详情、拓扑影响面、历史趋势和配置变更记录。
技术架构
采集、存储、分析与展示,组成完整的数据链路。
负责总览、拓扑、趋势图和告警处理界面
负责认证、权限、数据接口和实时消息推送
负责采集、告警判断、配置备份和周期任务
负责资产、配置、时序指标和高速缓存
可以开通内网演示账号,接入几台测试设备后直接查看采集、告警、拓扑和配置变更链路。