活动

天翼云最新优惠活动,涵盖免费试用,产品折扣等,助您降本增效!
热门活动
  • 818算力跃迁·礼遇盛夏 NEW 爆款云主机2核2G限时秒杀,28.8元/年起!
  • 免费体验DeepSeek,上天翼云息壤 NEW 新老用户均可免费体验2500万Tokens,限时两周
  • 云上钜惠 HOT 爆款云主机全场特惠,更有万元锦鲤券等你来领!
  • 算力套餐 HOT 让算力触手可及
  • 天翼云AI产品特惠 NEW 8折特惠,新老同享不限购
  • 中小企业服务商合作专区 国家云助力中小企业腾飞,高额上云补贴重磅上线
  • 出海产品促销专区 NEW 爆款云主机低至2折,高性价比,不限新老速来抢购!
  • 天翼云电脑专场 HOT 移动办公新选择,爆款4核8G畅享1年3.5折起,快来抢购!
  • 天翼云奖励推广计划 加入成为云推官,推荐新用户注册下单得现金奖励
免费活动
  • 免费试用中心 HOT 多款云产品免费试用,快来开启云上之旅
  • 天翼云用户体验官 NEW 您的洞察,重塑科技边界

智算服务

打造统一的产品能力,实现算网调度、训练推理、技术架构、资源管理一体化智算服务
智算云(DeepSeek专区)
算力互联调度平台
  • 裸金属
训推服务
  • 模型开发
  • 训练任务
  • 服务部署
模型推理服务
  • 模型广场
  • 体验中心
  • 服务接入
应用托管
  • 应用实例
科研助手
  • 科研智能体
  • 科研服务
  • 开发机
  • 并行计算
大模型
  • DeepSeek-V3.1
  • DeepSeek-R1-0528
  • DeepSeek-V3-0324
  • Qwen3-235B-A22B
  • Qwen3-32B
  • Qwen2.5-VL-72B-Instruct
  • StableDiffusion-V2.1
智算一体机
  • 智算一体机
模型适配专家服务
  • 模型适配专家服务

应用商城

天翼云精选行业优秀合作伙伴及千余款商品,提供一站式云上应用服务
进入甄选商城进入云市场创新解决方案
AI应用
  • 泛微合同管理解决方案
  • 泛微数智大脑Xiaoe.AI解决方案
  • MaxKB知识库解决方案
  • 天翼AI文创
AI服务
  • 昆仑AI训推服务解决方案
  • 国信模型服务解决方案
企业应用
  • 翼电子签约解决方案
  • 翼协同解决方案
  • 翼电签-契约锁解决方案
  • 翼视频云归档解决方案
教育应用
  • 翼电子教室
  • 潜在AI教育解决方案
建站工具
  • SSL证书
  • 翼定制建站解决方案
  • 翼多端小程序解决方案
办公协同
  • 天翼云企业云盘
  • 安全邮箱
灾备迁移
  • 云管家2.0
资源管理
  • 全栈混合云敏捷版(软件)
  • 全栈混合云敏捷版(一体机)

定价

协助您快速了解云产品计费模式、价格详情,轻松预估上云成本
价格计算器
  • 动态测算产品价格
定价策略
  • 快速了解计费模式

合作伙伴

天翼云携手合作伙伴,共创云上生态,合作共赢
天翼云生态合作中心
  • 天翼云生态合作中心
天翼云渠道合作伙伴
  • 天翼云代理渠道合作伙伴
天翼云服务合作伙伴
  • 天翼云集成商交付能力认证
天翼云应用合作伙伴
  • 天翼云云市场合作伙伴
  • 天翼云甄选商城合作伙伴
天翼云技术合作伙伴
  • 天翼云OpenAPI中心
  • 天翼云EasyCoding平台
天翼云培训认证
  • 天翼云学堂
  • 天翼云市场商学院
天翼云合作计划
  • 云汇计划
天翼云东升计划
  • 适配中心
  • 东升计划
  • 适配互认证

开发者

开发者相关功能入口汇聚
技术社区
  • 专栏文章
  • 互动问答
  • 技术视频
资源与工具
  • OpenAPI中心
开放能力
  • EasyCoding敏捷开发平台
培训与认证
  • 天翼云学堂
  • 天翼云认证
魔乐社区
  • 魔乐社区

支持与服务

为您提供全方位支持与服务,全流程技术保障,助您轻松上云,安全无忧
文档与工具
  • 文档中心
  • 新手上云
  • 自助服务
  • OpenAPI中心
定价
  • 价格计算器
  • 定价策略
基础服务
  • 售前咨询
  • 在线支持
  • 在线支持
  • 工单服务
  • 建议与反馈
  • 用户体验官
  • 服务保障
  • 客户公告
  • 会员中心
增值服务
  • 红心服务
  • 首保服务
  • 客户支持计划
  • 专家技术服务
  • 备案管家

了解天翼云

天翼云秉承央企使命,致力于成为数字经济主力军,投身科技强国伟大事业,为用户提供安全、普惠云服务
品牌介绍
  • 关于天翼云
  • 智算云
  • 天翼云4.0
  • 新闻资讯
  • 天翼云APP
基础设施
  • 全球基础设施
  • 信任中心
最佳实践
  • 精选案例
  • 超级探访
  • 云杂志
  • 分析师和白皮书
  • 天翼云·创新直播间
市场活动
  • 2025智能云生态大会
  • 2024智算云生态大会
  • 2023云生态大会
  • 2022云生态大会
  • 天翼云中国行
天翼云
  • 活动
  • 智算服务
  • 产品
  • 解决方案
  • 应用商城
  • 定价
  • 合作伙伴
  • 开发者
  • 支持与服务
  • 了解天翼云
      • 文档
      • 控制中心
      • 备案
      • 管理中心
      文档中心

      云监控服务

      云监控服务

      • 云监控服务

      无数据

        • 产品动态
        • 产品简介
        • 什么是云监控服务?
        • 产品优势
        • 应用场景
        • 云监控服务相关概念
        • 约束与限制
        • 区域与可用区
        • 计费说明
        • 产品价格
        • 快速入门
        • 查看监控总览
        • 查看云服务监控指标
        • 使用主机监控
        • 使用自定义监控
        • 使用事件监控
        • 使用资源分组
        • 用户指南
        • 使用监控面板
        • 监控面板简介
        • 创建监控面板
        • 添加监控视图
        • 查看监控视图
        • 配置监控视图
        • 删除监控视图
        • 删除监控面板
        • 资源分组
        • 资源分组简介
        • 创建资源分组
        • 查看资源分组
        • 查看分组列表
        • 资源概览
        • 不健康资源
        • 告警规则
        • 告警记录
        • 管理资源分组
        • 修改资源分组
        • 删除资源分组
        • 使用告警功能
        • 告警功能简介
        • 创建告警通知主题
        • 创建告警规则和告警通知
        • 查看告警记录
        • 告警规则管理
        • 告警模板
        • 主机监控
        • 主机监控简介
        • Agent安装配置方式说明
        • Agent版本特性
        • 在弹性云主机(ECS)或物理机(BMS)中安装配置Agent(Linux)
        • 修改DNS与添加安全组(Linux)
        • 安装Agent(Linux)
        • 修复插件配置(Linux)
        • 手动配置Agent(Linux,可选)
        • 在ECS中安装配置Agent(Windows)
        • 修改DNS与添加安全组(Windows)
        • 安装配置Agent(Windows)
        • 手动配置Agent(Windows,可选)
        • 在ECS中批量安装Agent(Linux)
        • 管理Agent
        • 内网DNS与安全组配置
        • 管理Agent(Linux)
        • 管理Agent(Windows)
        • 安装GPU指标与RAID指标采集插件(Linux)
        • 进程监控
        • 查看进程监控
        • 查看TOP CPU进程的运行数据
        • 查看主机监控的监控指标
        • 创建主机监控的告警通知
        • 自定义监控
        • 事件监控
        • 事件监控简介
        • 查看事件监控数据
        • 创建事件监控的告警通知
        • 事件监控支持的事件说明
        • 弹性云主机ECS支持的事件列表
        • 物理机支持的事件列表
        • EIP支持的事件列表
        • 虚拟私有云VPC支持的事件列表
        • 弹性负载均衡ELB支持的事件列表
        • 云服务备份CBR支持的事件列表
        • 关系型数据库RDS支持的事件列表
        • 文档数据库DDS支持的事件列表
        • 云数据库GaussDB NoSQL支持的事件列表
        • 云数据库GaussDB(for MySQL)支持的事件列表
        • 云数据库GaussDB支持的事件列表
        • 分布式关系型数据库DRDS支持的事件列表
        • 云硬盘EVS支持的事件列表
        • 秘钥管理服务KMS支持的事件列表
        • 对象存储OBS支持的事件列表
        • 企业交换机ESW支持的事件列表
        • 分布式缓存服务DCS支持的事件列表
        • 翼MapReduce MRS支持的事件列表
        • 云服务监控
        • 云服务监控简介
        • 查看监控指标
        • 审计云监控服务操作记录
        • 云审计服务支持的CES的操作列表
        • 查看云监控服务日志
        • 配额调整
        • 支持监控的服务列表
        • 常见问题
        • 产品咨询
        • 主机监控类
        • 主机监控
        • 执行命令安装Agent报错该如何处理?
        • Agent支持的操作系统有哪些?
        • 告警通知或误告警
        • 监控数据异常
        • 用户权限
        • 文档下载
        • 操作手册
        • 相关协议
        • 云监控服务等级协议
          无相关产品

          本页目录

          帮助中心云监控服务用户指南事件监控事件监控支持的事件说明弹性云主机ECS支持的事件列表
          弹性云主机ECS支持的事件列表
          更新时间 2024-12-09 17:26:27
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接
          最近更新时间: 2024-12-09 17:26:27
          分享文章
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接

          弹性云主机

          事件名称 事件ID 事件级别 事件说明 处理建议 事件影响
          删除虚拟机 deleteServer 重要 删除云服务器。
          包括:
          1. 在管理控制台进行删除操作。
          2. 通过API接口下发删除指令。
          确认删除操作是否为主动执行。 业务中断。
          重启虚拟机 rebootServer 次要 云服务器重启。
          包括:
          1. 在管理控制台进行重启操作。
          2. 通过API接口下发重启指令。
          1. 确认操作是否为主动执行。
          2. 业务应用做成高可用。
          3. 云主机开机后,确认业务是否自动恢复。
          业务中断。
          关闭虚拟机 stopServer 次要 云服务器关机。
          包括:
          1. 在管理控制台进行关机操作。
          2. 通过API接口下发关机指令。
          1. 确认操作是否为主动执行。
          2. 业务应用做成高可用。
          3. 云主机开机后,确认业务是否自动恢复。
          业务中断。
          删除网卡 deleteNic 重要 云服务器删除网卡。
          包括:
          1. 在管理控制台删除网卡。
          2. 通过API接口下发删除网卡指令。
          1. 确认操作是否为主动执行。
          2. 业务应用做成高可用。
          3. 删除网卡后,确认业务是否自动恢复。
          网卡被删除,存在业务中断的可能。
          变更规格 resizeServer 次要 云服务器规格变更。
          包括:
          1. 在管理控制台进行变更规格。
          2. 通过API接口下发变更规格指令。
          1. 确认操作是否为主动执行。
          2. 业务应用做成高可用。
          3. 变更规格后,确认业务是否自动恢复。
          业务中断。
          因硬件故障触发重启 startAutoRecovery 重要 弹性云主机所在的主机出现故障时,系统会自动将弹性云主机迁移至正常的物理机,
          迁移过程中系统会自动重启云主机。
          等待恢复成功,观察业务是否受到影响。 业务存在中断的可能。
          因硬件故障重启已完成 endAutoRecovery 重要 当自动迁移完成后,弹性云主机已恢复正常。 当收到“恢复成功”时,云服务器已正常工作,可继续使用。 业务恢复正常。
          恢复超时(后台处理中) faultAutoRecovery 重要 迁移弹性云主机至正常的物理机操作超时。 迁移业务至其他云服务器。 业务中断。
          开机失败 faultPowerOn 重要 云主机开机失败。 重试开机,若仍开机失败,联系运维人员处理。 云服务器无法开机。
          GPU链路故障 GPULinkFault 紧急 弹性云主机所在的主机上GPU卡故障。
          包括:
          1. GPU卡故障。
          2. GPU卡故障恢复中。
          业务应用做成高可用。GPU卡故障恢复后,确认业务是否自动恢复。 业务中断。
          主机进程异常导致虚拟机故障 VMFaultsByHostProcessExceptions 紧急 云服务器所在宿主机服务进程异常,导致云服务器故障。 联系运维人员处理 云服务器故障。
          GuestOS系统层重启告警 RestartGuestOS 一般 GuestOS内部重启。 联系运维人员处理。 在系统重启场景下,可能导致业务中断。
          实例计划规格变更等待执行 instance_resize_scheduled 重要 实例在计划时间规格变更,任务等待执行。 确认执行窗口对业务的影响。 实例等待执行规格变更操作。
          实例计划迁移等待执行 instance_migrate_scheduled 重要 由于底层硬件、系统运维等影响,实例在计划时间迁移,任务等待执行。 确认执行窗口对业务的影响。 实例等待执行迁移操作。
          实例计划停止等待执行 instance_stop_scheduled 重要 由于底层硬件、系统运维等影响,实例在计划时间停止,任务等待执行。 确认执行窗口对业务的影响。 实例中止等待。
          实例计划重启等待执行 instance_reboot_scheduled 重要 由于底层硬件、系统运维等影响,实例在计划时间重启,任务等待执行。 确认执行窗口对业务的影响。 实例等待执行重启。
          实例计划重新部署等待执行 instance_redeploy_scheduled 重要 由于底层硬件、系统运维等影响,实例在计划时间重新部署到新主机,任务等待执行。 确认执行窗口对业务的影响。 实例等待执行重部署。
          GPU SRAM存在
          Uncorrectable ECC告警
          SRAMUncorrectableEccError 重要 GPU卡SRAM出现Uncorrectable ECC Error硬件故障。 如果业务受损,请提交工单。 可能GPU硬件问题导致SRAM故障,导致业务异常退出。
          GPU存在infoROM告警 gpuInfoROMAlarm 重要 GPU可能存在硬件问题,导致驱动读取不到inforom信息。 非敏感业务可以继续使用该GPU卡,敏感业务请提交工单。 对业务暂时没有影响,当GPU硬件出现ECC故障时,可能无法自动完成故障页隔离,导致业务受损。
          GPU发生double bit ECC告警 doubleBitEccError 重要 GPU硬件存在double bit ECC故障。 如果业务受损停止,建议尝试重启虚拟机恢复业务。
          如果业务仍然无法恢复,请提交工单。
          可能会造成业务中断,故障页隔离后业务可继续正常使用GPU。
          GPU隔离页过多告警 gpuTooManyRetiredPagesAlarm 重要 GPU硬件存在过多ECC隔离页。 如果业务受损,请提交工单。 GPU硬件存在过多ECC故障,可能频繁影响业务正常运行。
          GPU A100 硬件发生ECC告警 gpuA100EccAlarm 重要 GPU卡出现ECC硬件故障。 如果业务受损停止,建议尝试重启虚拟机恢复业务。
          如果业务仍然无法恢复,请提交工单。
          可能会造成业务中断,故障页隔离后业务可继续正常使用GPU。
          GPU ECC内存页隔离失败告警 eccPageRetirementRecordingFailure 重要 GPU硬件存在ECC故障,驱动自动隔离内存页时失败。 如果业务受损,请提交工单。 可能会造成业务中断,故障页隔离隔离失败,可能导致业务无法使用GPU。
          GPU ECC页隔离告警 eccPageRetirementRecordingEvent 一般 存在ECC硬件错误,发生内存页自动隔离。 如果业务受损停止,建议尝试重启虚拟机恢复业务。
          如果业务仍然无法恢复,请提交工单。
          一般随ECC故障告警出现,单独出现不影响业务。
          GPU single bit ECC过多告警 highSingleBitEccErrorRate 重要 ECC硬件存在过高ECC single bit错误。 如果业务受损停止,建议尝试重启虚拟机恢复业务。
          如果业务仍然无法恢复,请提交工单。
          single bit的错误能够自动恢复,一般不影响GPU相关应用程序。
          GPU驱动掉卡告警 gpuDriverLinkFailureAlarm 重要 GPU链路正常,NVIDIA驱动找不到GPU硬件 建议尝试重启虚拟机恢复业务。如果业务仍然无法恢复,请提交工单。 一般驱动问题导致找不到对应位置的GPU。
          GPU卡链路故障告警 gpuPcieLinkFailureAlarm 重要 GPU链路异常,通过lspci查看GPU硬件出现故障。 如果业务受损,请提交工单。 硬件问题导致GPU链路异常,驱动无法使用GPU。
          虚拟机GPU丢卡告警 vmLostGpuAlarm 重要 虚拟机实际有的GPU卡数量比规格里应分配的GPU卡数量少。 如果业务受损,请提交工单。 虚拟机GPU卡丢失。
          GPU显存页告警 gpuMemoryPageFault 重要 GPU内存页发生故障,故障可能由应用、驱动或硬件引起 如果业务受损,请提交工单。 可能GPU硬件问题导致显存故障,导致业务异常退出。
          GPU图像引擎异常告警 graphicsEngineException 重要 GPU图像引擎发生故障,可能由应用、驱动或硬件引起。 如果业务受损,请提交工单。 可能GPU硬件问题导致图像引擎故障,导致业务异常退出。
          GPU温度过高告警 highTemperatureEvent 重要 GPU硬件温度过高。 如果业务受损,请提交工单。 GPU温度超过温度阈值,可能会引起GPU卡性能下降。
          GPU NVLINK链路错误告警 nvlinkError 重要 NVLINK的链路出现硬件故障 如果业务受损,请提交工单。 NVLINK链路故障,影响业务使用GPU NVLINK能力。
          nvidia-smi命令卡住 nvidiaSmiHangEvent 重要 nvidia-smi命令超时,该命令可能卡住 如果业务受损,请提交工单。 可能是命令执行过程中,触发驱动问题,导致命令卡住,同时可能出现业务使用驱动报错问题。
          开始热迁移 liveMigrationStarted 重要 弹性云主机所在的主机可能出现故障,提前对虚拟机进行热迁移,避免宕机后导致业务中断。 等待虚拟机迁移成功,状态恢复正常。 实例热迁移开始。
          结束热迁移 liveMigrationCompleted 重要 热迁移已经结束,弹性云主机已恢复正常。 确认业务是否受到影响。 实例热迁移结束。
          热迁移失败 liveMigrationFailed 重要 弹性云主机热迁移出现问题,未热迁移成功。 确认应用集群业务是否受损。 实例热迁移失败。
          宿主机存在宕机风险 hostMayCrash 重要 弹性云主机所在的宿主机存在宕机风险,且由于一些原因,无法通过热迁移手段规避该风险。 确认应用集群业务是否受损。 实例有重启风险。
          说明

          自动恢复:弹性云主机所在的硬件出现故障时,系统会自动将弹性云主机迁移至正常的物理机,该过程会导致云主机重启。

          文档反馈

          建议您登录后反馈,可在建议与反馈里查看问题处理进度

          鼠标选中文档,精准反馈问题

          选中存在疑惑的内容,即可快速反馈问题,我们会跟进处理

          知道了

          上一篇 :  事件监控支持的事件说明
          下一篇 :  物理机支持的事件列表
          搜索 关闭
          ©2025 天翼云科技有限公司版权所有 增值电信业务经营许可证A2.B1.B2-20090001
          公司地址:北京市东城区青龙胡同甲1号、3号2幢2层205-32室
          备案 京公网安备11010802043424号 京ICP备 2021034386号
          ©2025天翼云科技有限公司版权所有
          京ICP备 2021034386号
          备案 京公网安备11010802043424号
          增值电信业务经营许可证A2.B1.B2-20090001
          用户协议 隐私政策 法律声明