存储故障处理流程演变

最新推荐文章于 2025-06-30 16:28:06 发布

原创

最新推荐文章于 2025-06-30 16:28:06 发布 · 1.4k 阅读

·

17

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#服务器 #数据库 #运维

存储作为存放金融企业数据中心各类生产数据的重要载体，其日常的安全平稳运行至关重要。特别是应对若干存储的大量告警，如何从大量告警中提取关键告警消息并及时处理异常，可谓对存储平台的稳定运行起到保驾护航的作用。

存储告警处理作为常规工作，一方面需要在技术层面上及时发现告警并处理，另一方面还要在制度层面符合ITIL流程管理的规定。

存储告警中硬盘及电池的告警相对较多，此类告警出现时通常需要更换备件解决，且更换操作均属于标准流程。因此，存储硬件类告警的日常处理，如果兼顾流程、实际情况能纳入自动化管理，对于工作效率的提升将十分明显。

一、传统存储故障处理流程

1. 发现存储故障

机房值班人员通过每天定期现场巡检，借助存储物理亮灯可以发现异常情况并告知存储运维人员进行处理。由于人工巡检频率较低，发现异常相对比较滞后，且存在漏检可能。

为了能及时发现存储设备存在的告警，早期通过在各存储管理平台配置SNMP Trap，将告警信息由运行监控中心发送给存储运维人员。

这类告警即时性相当高，有效辅助运维人员在第一时间发现设备异常，但告警消息数目较多且缺乏过滤及压缩，也给运维人员的日常工作带来了一定的困扰。

2. 提交厂商日志确认并安排维修

SNMP Trap类告警消息因缺少设备序列号、机柜位置、部件位置、部件规格等明确信息，无法直接转发给厂商工程师进行设备报修，一般需要单独收集相关日志发送给厂商进一步分析，或者需要运维人员通过命令行或GUI等工具反馈具体信息给厂商。

设备报修要求出具相关部件的准确信息，而基于一定规则定制的告警消息无疑将使报修流程化繁为简，在日常运维中将节省大量的时间。

3. 纳入ITIL流程

存储硬件更换在制度上纳入ITIL流程变更管理，通常需要由存储运维人员在ITIL管理平台申请事件工单和变更工单。

运维人员梳理设备告警情况，并跟厂商确认好部件更换工作，先在ITIL管理平台中提出事件工单，然后关联此事件工单创建变更工单。事件工

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。