活动

天翼云最新优惠活动,涵盖免费试用,产品折扣等,助您降本增效!
热门活动
  • 12.12年度钜惠 NEW 爆款云主机2核2G仅需28.8元/年,X实例35.1元/半年起! 8代机+XSSD新客专享2.5折!
  • 免费体验DeepSeek,上天翼云息壤 NEW 新老用户均可免费体验2500万Tokens,限时两周
  • 云上钜惠 HOT 爆款云主机全场特惠,更有万元锦鲤券等你来领!
  • 算力套餐 HOT 让算力触手可及
  • 天翼云AI产品特惠 NEW 人脸识别+文字识别焕新,新用户免费试用
  • 中小企业服务商合作专区 国家云助力中小企业腾飞,高额上云补贴重磅上线
  • 出海产品促销专区 NEW 爆款云主机低至2折,高性价比,不限新老速来抢购!
  • 天翼云电脑专场 HOT 移动办公新选择,爆款4核8G畅享1年3.5折起,快来抢购!
  • 天翼云奖励推广计划 加入成为云推官,推荐新用户注册下单得现金奖励
免费活动
  • 免费试用中心 HOT 多款云产品免费试用,快来开启云上之旅
  • 天翼云用户体验官 NEW 您的洞察,重塑科技边界

息壤智算

领先开放的智算服务平台,提供算力、平台、数据、模型、应用“五位一体”智算服务体系,构建全流程的AI基础设施能力
智算云(DeepSeek专区)
AI Store
  • 算力市场
  • 模型市场
  • 应用市场
  • MCP市场
算力互联调度平台
  • 裸金属
  • 定制裸金属
训推服务
  • 模型开发
  • 训练任务
  • 服务部署
模型推理服务
  • 模型广场
  • 体验中心
  • 服务接入
应用托管
  • 应用实例
科研助手
  • 科研智能体
  • 科研服务
  • 开发机
  • 并行计算
大模型
  • DeepSeek-V3.1
  • DeepSeek-R1-0528
  • DeepSeek-V3-0324
  • Qwen3-235B-A22B
  • Qwen3-32B
智算一体机
  • 智算一体机
模型适配专家服务
  • 模型适配专家服务
算力服务商
  • 入驻算力服务商

应用商城

天翼云精选行业优秀合作伙伴及千余款商品,提供一站式云上应用服务
进入甄选商城进入云市场进入AI Store创新解决方案智云上海应用生态专区
AI应用
  • 泛微合同管理解决方案
  • 泛微数智大脑Xiaoe.AI解决方案
  • MaxKB知识库解决方案
  • 天翼AI文创
AI服务
  • 昆仑AI训推服务解决方案
  • 国信模型服务解决方案
企业应用
  • 翼电子签约解决方案
  • 翼协同解决方案
  • 翼电签-契约锁解决方案
  • 翼视频云归档解决方案
教育应用
  • 翼电子教室
  • 潜在AI教育解决方案
建站工具
  • SSL证书
  • 翼定制建站解决方案
  • 翼多端小程序解决方案
办公协同
  • 天翼云企业云盘
  • 安全邮箱
灾备迁移
  • 云管家2.0
资源管理
  • 全栈混合云敏捷版(软件)
  • 全栈混合云敏捷版(一体机)

定价

协助您快速了解云产品计费模式、价格详情,轻松预估上云成本
价格计算器
  • 动态测算产品价格
定价策略
  • 快速了解计费模式

合作伙伴

天翼云携手合作伙伴,共创云上生态,合作共赢
天翼云生态合作中心
  • 天翼云生态合作中心
天翼云渠道合作伙伴
  • 天翼云代理渠道合作伙伴
天翼云服务合作伙伴
  • 天翼云集成商交付能力认证
天翼云应用合作伙伴
  • 天翼云云市场合作伙伴
  • 天翼云甄选商城合作伙伴
天翼云技术合作伙伴
  • 天翼云OpenAPI中心
天翼云培训认证
  • 天翼云学堂
  • 天翼云市场商学院
天翼云合作计划
  • 云汇计划
天翼信创云专区
  • 信创云专区
  • 适配互认证

开发者

开发者相关功能入口汇聚
技术社区
  • 专栏文章
  • 互动问答
  • 技术视频
资源与工具
  • OpenAPI中心
培训与认证
  • 天翼云学堂
  • 天翼云认证
魔乐社区
  • 魔乐社区

支持与服务

为您提供全方位支持与服务,全流程技术保障,助您轻松上云,安全无忧
文档与工具
  • 文档中心
  • 新手上云
  • 自助服务
  • OpenAPI中心
定价
  • 价格计算器
  • 定价策略
基础服务
  • 售前咨询
  • 在线支持
  • 在线支持
  • 工单服务
  • 服务保障
  • 会员中心
增值服务
  • 红心服务
  • 首保服务
  • 客户支持计划
  • 专家技术服务
  • 备案管家
我要反馈
  • 建议与反馈
  • 用户体验官
信息公告
  • 客户公告

了解天翼云

天翼云秉承央企使命,致力于成为数字经济主力军,投身科技强国伟大事业,为用户提供安全、普惠云服务
品牌介绍
  • 关于天翼云
  • 智算云
  • 天翼云4.0
  • 新闻资讯
  • 天翼云APP
基础设施
  • 全球基础设施
  • 信任中心
最佳实践
  • 精选案例
  • 超级探访
  • 云杂志
  • 分析师和白皮书
  • 天翼云·创新直播间
市场活动
  • 2025智能云生态大会
  • 2024智算云生态大会
  • 2023云生态大会
  • 2022云生态大会
  • 天翼云中国行
天翼云
  • 活动
  • 息壤智算
  • 产品
  • 解决方案
  • 应用商城
  • 定价
  • 合作伙伴
  • 开发者
  • 支持与服务
  • 了解天翼云
      • 文档
      • 控制中心
      • 备案
      • 管理中心
      文档中心

      训推服务

      训推服务

      • 训推服务

      无数据

        • 产品动态
        • 产品介绍
        • 产品定义
        • 产品优势
        • 功能特性
        • 应用场景
        • 术语解释
        • 使用限制
        • 与其他服务的关系
        • 计费说明
        • 包周期计费模式
        • 按需计费模式-卡时
        • 产品退订
        • 快速入门
        • 准备工作
        • 用户使用流程
        • 用户指南
        • 数据工具
        • 数据处理
        • 模型定制
        • 模型精调
        • 模型精调功能介绍
        • 模型精调功能使用
        • 模型开发
        • 训练任务
        • 断点续训
        • 模型服务
        • 服务部署
        • 模型工具
        • 模型评估
        • 模型压缩
        • 训推加速
        • CTCCL优化套件
        • CTCCL简介
        • 安装、升级与使用CTCCL库
        • CTCCL环境变量设置
        • 慢节点检测工具套件 CTCCL-Slowdetect
        • CTCCL-Slowdetect简介
        • 使用CTCCL-Slowdetect
        • CTCCL-Slowdetect最佳实践
        • 训练性能加速
        • 模型适配与性能加速
        • 断点续训加速
        • Snapckpt加速
        • 智算资产
        • 我的模型
        • 我的数据集
        • 基础数据集
        • 标注数据集
        • 我的镜像
        • 我的代码包
        • 运维观测
        • 监控大盘
        • 集群监控大盘
        • 工作空间监控大盘
        • 用量统计
        • 调度中心
        • 资源总览
        • 操作审计
        • 管理中心
        • 成员管理
        • 队列管理
        • 设置
        • 资源配额
        • 工作空间管理
        • 创建工作空间
        • 工作空间关联资源
        • 工作空间成员管理
        • 进入工作空间
        • 工作空间角色权限
        • 常见问题
        • 计费类
        • 操作类
        • 最佳实践
        • 基于昇腾通用推理镜像的自定义部署
        • 基于昇腾通用推理镜像的自定义部署BGE模型
        • 多模态模型训练
        • 专业模型训练-昇腾环境
        • 专业模型训练-英伟达环境
        • 图像分类模型训练
        • NLP大模型快速微调
        • 保密数据集最佳实践
        • 多层级资源管理最佳实践
        • API参考
        • 推理服务API
        • 如何调用API
        • 错误处理
        • 接口类型列表
        • API列表
        • API
        • Chat对话API
        • Image文本生图API
        • Embeddings文本向量化API
        • 模型列表API
        • 模型简介
        • DeepSeek-R1
        • DeepSeek-V3
        • Baichuan2-Turbo
        • Llama3-70B-Instruct
        • Qwen2.5-72B-Instruct
        • Qwen2-72B-Instruct
        • Qwen-VL-Chat
        • TeleChat-12B
        • InternLM2-Chat-7B
        • Baichuan2-7B
        • Qwen-7B-Chat
        • Llama2-Chinese-13B-Chat
        • CodeLlama-34B-Instruct
        • Chinese-Alpaca-2-13B
        • 平台OpenAPI
        • 平台功能API使用说明
        • 文档下载
        • 相关协议
        • 训推智算服务平台服务协议
        • 训推服务用户信息处理规则
          无相关产品

          本页目录

          帮助中心训推服务用户指南运维观测监控大盘集群监控大盘
          集群监控大盘
          更新时间 2025-11-27 10:05:26
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接
          最近更新时间: 2025-11-27 10:05:26
          分享文章
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接
          监控大盘可以让您以全局的视角查看集群与工作空间的资源使用情况,通过此功能,您可从多个角度了解资源的利用情况以便更加合理地分配。

          前置条件

          • 资源限制:您已开通专属集群(专属集群需联系客户经理开通),该功能仅统计专属集群相应用量。

          • 用户权限:账号为主账号,或者角色为IAM管理员。

          功能介绍

          集群监控大盘展现了专属集群下的集群资源概览、存储资源使用情况、集群整体与集群下节点的基础指标监控。进入“运维观测”>“监控大盘”菜单,上方点击“集群”Tab,在顶部栏切换需要查看的专属集群,即可查看该集群的监控,该功能仅对主账号以及IAM管理员用户开放。

          集群资源概览

          1.  统计说明及名词解释:

            1. 该模块数据仅统计专属集群相关数据及展示专属集群监控。

            2. 分配:是指分配到工作空间,即相关资源创建配额,该配额绑定工作空间的状态。被分配意味着该资源可以被任务使用:在本平台,建立专属集群后,您需要先创建配额,并在相应的工作空间里绑定配额,才可以在任务中选择配额运行任务,分配是专属集群资源可用的必要步骤。

            3. 占用:占用是指被任务中的pod占用,这意味着分配的资源真正被任务使用;

            4. 节点:即物理机实例,节点是集群的组成单元,每个节点对应一台物理机。

          2. 各指标含义说明:

            1. 分配率指标:

              指标项

              解释

              节点健康度

              • 健康节点数:指您所选的专属集群中,状态为Ready‌的节点数。在K8S集群中,Ready表示该节点健康且可接收Pod调度;

              • 节点总数:您所选专属集群下的节点总数;

              • 节点健康度:即健康节点数与总数的比值,反映了集群下可用节点数占比。

              CPU分配率

              • 已分配:您所选集群下,已被分配的CPU量;

              • 总核数:您所选集群下的CPU总核数,是所有节点的CPU核数总和;

              • CPU分配率:即已分配数与总核数的比值。

              内存分配率

              • 已分配:您所选集群下,已被分配的内存量;

              • 总和数:您所选集群下的内存总量,是所有节点的内存量总和;

              • CPU分配率:即已分配量与总量的比值。

              显卡分配率

              • 显卡分配数:您所选集群下,已被分配的显卡数;

              • 显卡总数:您所选集群下的显卡总数,是所有节点的显卡数总和;

              • 显卡分配率:即显卡分配数与显卡总数的比值。

              显存分配率

              • 显存分配量:您所选集群下,已被分配的显存量;

              • 显存总量:您所选集群下的显存总量,是所有节点的显存量总和;

              • 显存分配率:即显存分配量与显存总量的比值。

            2. 显卡分配明细表:

              字段

              解释

              集群名称

              专属集群的名称;

              显卡型号

              专属集群下相应的显卡型号,比如NVIDIA L40S;

              总卡数

              指定专属集群下指定显卡型号的总卡数;

              分配卡数

              在总卡数下,被分配的显卡数;

              实际占用卡数

              在分配卡数下,实际被任务占用的卡数;

              总显存量

              指定专属集群下指定显卡型号的总显存量;

              分配显存量

              在总显存量下,被分配的显存量;

              实际占用显存量

              在分配显存量下,实际被任务占用的显存量。

          存储资源使用情况

          1. 统计说明及名词解释:平台主要支持两类存储-高性价比的ZOS、高性能的HPFS,关于两类存储的解释,可见基础数据集章节。

          2. 指标含义:

          类别

          指标

          解释

          账号自有ZOS

          已使用量

          您租户账号下的同资源池下已开通的对象存储使用量;

          平台共享ZOS

          剩余可用

          您租户账号在本平台共享存储的对象存储剩余可用量;

          已使用量

          您租户账号在本平台共享存储的对象存储使用量;

          账号自有HPFS

          已购买量

          您租户账号下同资源池购买的HPFS总量;

          已使用量

          您租户账号下同资源池的HPFS已使用量;

          平台共享HPFS

          剩余可用

          您租户账号在本集群的HPFS剩余可用量;

          已使用量

          您租户账号在本集群的HPFS使用量。

          集群资源监控

          1. 下拉至集群资源监控模块,点击集群资源监控tab,可查看相应的资源监控。集群维度的资源监控,是所有节点相应指标的聚合值,平台跟据各指标项的具体含义,选取了最能体现资源组整体使用情况的统计方式,例如平均值、最大值等。通过此统计方式,您可以了解该集群的整体使用情况。

          2. 图像展示:

            1. 放大与明细:点击指标右侧“>”箭头,可展开指标大图,大图展示对图像上点的统计细项,包括最大值、最小值、平均值、中位数、75分位数;

            2. 图例:点击图例,可以对线段进行展示/隐藏;

            3. 时间轴:滑动图像下方时间轴,可以在已选定时间的基础上,查看更小范围的监控。

          3. 指标含义:

          类别

          指标

          解释

          CPU、内存与网络监控

          CPU负载

          一段时间内系统等待处理的工作量,包括了正在使用 CPU 的进程和等待 CPU 的进程。

          默认按 平均值(avg) 聚合。

          CPU使用率

          CPU在单位时间内,CPU被任务占用使用的时间占比。

          默认按 平均值(avg) 聚合。

          CPU使用量

          CPU 实际使用的核数。

          默认按 累加值(sum) 聚合。

          内存使用率

          已用内存占总内存的百分比。

          默认按 平均值(avg) 聚合。

          内存使用量

          内存实际使用量。

          默认按 累加值(sum) 聚合。

          普通网络吞吐

          传统以太网的实际数据传输速率,即单位时间内实际传输的数据量。

          默认按 平均值(avg) 聚合。

          本地磁盘使用率

          本地磁盘的使用率。

          默认按 平均值(avg) 聚合。

          显卡基础指标

          显卡使用率

          在单位时间内,显卡被任务占用使用的时间占比。

          默认按 平均值(avg) 聚合。

          显存使用率

          已用显存占总显存的百分比。

          默认按 平均值(avg) 聚合。

          显存使用量

          显存实际使用量。

          默认按 累加值(sum) 聚合。

          节点资源监控

          1. 切换到节点资源监控tab,选择集群下相应的节点,可查看节点资源监控。

          2. 节点指标及含义:

          类别

          指标

          解释

          CPU、内存与网络监控

          CPU负载

          一段时间内系统等待处理的工作量,包括了正在使用 CPU 的进程和等待 CPU 的进程。

          CPU使用率

          CPU在单位时间内,CPU被任务占用使用的时间占比。

          CPU使用量

          CPU 实际使用的核数。

          内存使用率

          已用内存占总内存的百分比。

          内存使用量

          内存实际使用量。

          普通网络吞吐

          传统以太网的实际数据传输速率,即单位时间内实际传输的数据量。

          本地磁盘使用率

          节点本地磁盘的使用率。

           

          本地磁盘读写速率

          节点本地磁盘的读写速率。

          显卡基础指标

          GPU/NPU使用率

          在单位时间内,显卡被任务占用使用的时间占比。

          GPU/NPU显存使用率

          已用显存占总显存的百分比。

          GPU/NPU显存使用量

          显存实际使用量。

          GPU/NPU卡温度

          显卡温度。

          GPU/NPU功耗

          显卡功耗。

          NPU卡健康状态

           

          每张卡的NPU芯片健康状态。

          取值范围:{0,1}

          1:表示在过去一段时间间隔内芯片处于健康状态;

          0:表示在过去一段时间间隔内出现了不健康状态。

           

          文档反馈

          建议您登录后反馈,可在建议与反馈里查看问题处理进度

          鼠标选中文档,精准反馈问题

          选中存在疑惑的内容,即可快速反馈问题,我们会跟进处理

          知道了

          上一篇 :  监控大盘
          下一篇 :  工作空间监控大盘
          搜索 关闭
          ©2025 天翼云科技有限公司版权所有 增值电信业务经营许可证A2.B1.B2-20090001
          公司地址:北京市东城区青龙胡同甲1号、3号2幢2层205-32室
          备案 京公网安备11010802043424号 京ICP备 2021034386号
          ©2025天翼云科技有限公司版权所有
          京ICP备 2021034386号
          备案 京公网安备11010802043424号
          增值电信业务经营许可证A2.B1.B2-20090001
          用户协议 隐私政策 法律声明