• 大数据-之LibrA数据库系统告警处理(ALM-12051 磁盘Inode使用率超过阈值)


    告警解释

    系统每30秒周期性检测磁盘Inode使用率,并把实际Inode使用率和阈值(系统默认阈值80%)进行比较,当检测到Inode使用率连续多次(默认值为5)超过阈值时产生该告警。

    用户可通过“系统设置 > 阈值配置 > 设备 > 主机 > 磁盘 > 磁盘inode使用率 > 磁盘inode使用率”修改阈值。

    平滑次数为1,磁盘Inode使用率小于或等于阈值时,告警恢复;平滑次数大于1,磁盘Inode使用率小于或等于阈值的90%时,告警恢复。

    告警属性

    告警ID

    告警级别

    可自动清除

    12051

    严重

    告警参数

    参数名称

    参数含义

    ServiceName

    产生告警的服务名称。

    RoleName

    产生告警的角色名称。

    HostName

    产生告警的主机名。

    PartitionName

    产生告警的磁盘分区。

    Trigger Condition

    系统当前指标取值满足自定义的告警设置条件。

    对系统的影响

    文件系统无法正常写入。

    可能原因
    • 磁盘小文件过多。
    • 系统环境异常。
    处理步骤

    磁盘小文件过多。

    1. 打开FusionInsight Manager页面,在实时告警列表中,单击此告警。在“告警详情”区域,获取告警所在主机地址和磁盘分区。
    2. 使用PuTTY工具,以root用户登录告警所在主机。
    3. 执行命令df -i | grep -iE "分区名称|Filesystem",查看磁盘当前Inode使用率。
       
    4. 若Inode使用率超过阈值,手工排查该分区存在的小文件,确认是否能够删除这些文件。

      说明:

      可使用命令for i in /*; do echo $i; find $i|wc -l; done查看分区下的文件个数,使用时请替换“/*”为需要检查的分区。

       
        
      • 是,删除文件,执行步骤 5
      • 否,参考《容量调整指导书》进行容量调整。执行步骤 5

    5. 等待5分钟,检查该告警是否恢复。

      • 是,处理完毕。
      • 否,执行步骤 6

    检查系统环境是否异常。

    1. 联系操作系统维护人员,检查操作系统是否存在异常。

    2. 等待5分钟,检查该告警是否恢复。

      • 是,处理完毕。
      • 否,执行步骤 8

    收集故障信息。

    1. 在主集群的FusionInsight Manager界面,单击“系统设置 > 日志下载”。
    2. 在“服务”下拉框中勾选“Manager”,单击“确定”。
    3. 设置“主机”为告警所在节点和主OMS节点。
    4. 设置日志收集的“开始时间”和“结束时间”分别为告警产生时间的前后30分钟,单击“下载”。
  • 相关阅读:
    SSMP整合案例第六步 在前端页面上利用axios和element-ui与后端交互实现增删改
    我为博客园生商业化运营献计
    LeetCode 2251. 花期内花的数目:排序 + 二分
    达梦数据库如何查看历史sql
    Redis6搭建高可用的多主多从集群
    Django路由层和视图层
    下面哪些情况可能导致神经网络训练失败
    fluent使用DPM模型计算出的颗粒沉积(trap)数据(.dpm格式)后处理python实现
    iOS16 中的 3 种新字体宽度样式
    GIS 与BIM 融合的应用领域 探索和研究
  • 原文地址:https://blog.csdn.net/weixin_42874480/article/details/134465249