searchusermenu
  • 发布文章
  • 消息中心
点赞
收藏
评论
分享
原创

天翼云息壤算力调度:一次大模型训练任务的完整调度之旅

2026-09-09 18:35:17
1
0
 

一、出发之前:读懂几个专业名词

1.1 异构算力:算力世界的“多兵种”

在调度者的眼里,算力并不是单一的资源,而是由不同“兵种”组成的队伍:通用算力擅长支撑日常业务系统,超算面向气象预测、基因测序等极端复杂的科学计算,智算则专门为人工智能的训练与推理而生。它们架构不同、规格各异,统称为异构算力。调度要做的第一件事,就是让这支“多兵种”队伍听从统一指挥。

1.2 任务级调度:把任务当作最小的服务单位

过去,算力资源往往按“整机”“整池”粗放划分,任务只能迁就资源。任务级调度则反了过来:调度系统以一个个具体任务为最小单位,根据任务对算力规模、响应时延、能耗表现的不同要求,逐单匹配资源。这好比点餐外卖时按订单匹配骑手,而不是让所有订单都挤向同一家门店。

1.3 万卡集群与断点续训

当任务规模大到需要上万张加速卡同时工作时,就构成了万卡集群。集群越大,出现故障的概率也随之上升,于是断点续训应运而生:系统周期性保存训练进度,一旦发生异常,任务可从最近的保存点接着推进,而不是从头再来,从而保障有效训练时长。

二、调度之旅:一次训练任务的五个驿站

把一场大模型训练想象成一次长途出行,天翼云息壤算力调度就像全程陪伴的“调度中枢”,一路上设有五个驿站:

2.1 第一站“出发”:提交任务,统一接入

旅程从用户提交任务开始。借助息壤的统一接入与统一封装能力,用户只需说明“要训练什么、需要多少算力”,无须关心资源来自哪家机构、采用何种架构,异构算力已被封装成标准化的服务。这就像打车时只输入目的地,不必了解背后调度了多少种车型、多少支车队。

2.2 第二站“导航”:感知全域,智能择路

任务出发后,调度系统开始“导航”,依次完成三件事:

① 算力感知:实时掌握全域资源的分布、负载与能耗,让算力“看得见”;

② 算力度量:为异构资源建立统一的“度量衡”,让不同规格的算力“量得准、比得了”;

③ 智能择路:综合算效、碳效、时延、安全等策略,为任务挑选最合适的目的地,绿色低碳的算力还能被优先派上用场。

路线规划得当,任务就能少排队、少绕路,资源也各得其所。

2.3 第三站“组队”:万卡级统一编排

大模型训练往往需要“万卡会战”,考验的是把海量加速卡组织成一支高效队伍的能力。息壤依托两百余项监控指标与丰富的故障知识库,在训练启动前开展一键检测、排查隐患;运行中一旦出现异常,能够快速定位、快速恢复,避免个别掉队节点拖慢整个队伍。

2.4 第四站“护航”:断点续训,稳中求进

训练周期可能长达数周甚至更久,意外中断在所难免。断点续训就像视频播放的“续播”功能:任务从最近的进度点继续推进,同时系统主动识别并绕开慢节点,把故障对训练的影响降到最低,让大规模分布式训练的有效时长稳定保持在高位。

2.5 第五站“归位”:弹性伸缩,资源回收

任务完成后,资源并不会闲置浪费:调度系统自动回收算力,支持弹性扩缩容,让资源回到统一资源池,随时响应下一位“乘客”。至此,一次调度旅程形成闭环,新一轮旅程随即开始。

三、旅程之外:调度能力经受的真实检验

3.1 城市算力网先行先试

息壤的调度能力早已走出实验室:在上海,它承载于临港国产万卡算力池之上,盘活区域零散的通算、智算与超算资源;在北京,它支撑算力互联互通验证平台,与多家伙伴实现算力并网;在苏州,它为工业园区打造了集服务门户、算力接入、编排调度、资源运营、监控运维于一体的公共算力服务平台,让园区企业像用水用电一样取用算力。

3.2 跨域协同的“大调度”

跨地域调度更考验功力。息壤积极接应重庆“疆算入渝”工程,将新疆哈密绿色、低时延的算力引入重庆,并成功把京、沪两地的万卡级国产化算力调度入渝,实现超低时延、高效互联——东部需求与西部资源,在调度中完成精准对接。

3.3 不同行业的任务各得其所

行业任务形形色色,调度也各有章法:

① 科研领域,高校团队借助平台训练万亿参数大模型,动态调度让研究成果的产出周期明显缩短;

② 医疗领域,平台支持密文状态下的模型训练,某三甲医院以此将肺部CT影像的病灶识别准确率提升到较高水平,且原始数据始终不出域;

③ 制造领域,企业依托万卡级并行算力大幅压缩碰撞仿真等研发环节的周期,还能同步优化多套结构方案。

四、权威认可:调度实力的“成绩单”

一路走来,息壤的调度能力收获了多方认可:入选“2022年度央企十大超级工程”,荣获中国算力大会“算力中国·年度突破成果”奖,获评第六届数字中国建设峰会“十大硬核科技”,入选国有企业数字化转型论坛“典型数字技术成果”。依托以“息壤”为核心的一体化智算服务体系,天翼云还荣获世界互联网大会“杰出贡献奖”,相关智算基础设施项目获中国电子学会科技进步奖。

在标准与生态层面,天翼云发起息壤算力互联互通及调度管理服务计划,参编《城市算力互联网实践指南》,并携手产学研各界参与算力互联互通国家标准研究,让“调度”有章可循、有规可依。

五、科普小结:旅程有终点,调度无止境

回顾这场调度之旅:出发时统一接入,让异构算力听指挥;导航时智能择路,让任务少走弯路;组队时万卡编排,让集群协同高效;护航时断点续训,让长跑不惧风浪;归位时弹性伸缩,让资源循环不歇。天翼云息壤算力调度的意义,正在于把一次次平凡的任务旅程,组织成一张高效运转的算力网络。当越来越多的大模型任务在这张网上顺畅穿行,算力这一新型基础设施,也将真正像水与电一样,滋养千行百业。

0条评论
0 / 1000
c****q
831文章数
0粉丝数
c****q
831 文章 | 0 粉丝
原创

天翼云息壤算力调度:一次大模型训练任务的完整调度之旅

2026-09-09 18:35:17
1
0
 

一、出发之前:读懂几个专业名词

1.1 异构算力:算力世界的“多兵种”

在调度者的眼里,算力并不是单一的资源,而是由不同“兵种”组成的队伍:通用算力擅长支撑日常业务系统,超算面向气象预测、基因测序等极端复杂的科学计算,智算则专门为人工智能的训练与推理而生。它们架构不同、规格各异,统称为异构算力。调度要做的第一件事,就是让这支“多兵种”队伍听从统一指挥。

1.2 任务级调度:把任务当作最小的服务单位

过去,算力资源往往按“整机”“整池”粗放划分,任务只能迁就资源。任务级调度则反了过来:调度系统以一个个具体任务为最小单位,根据任务对算力规模、响应时延、能耗表现的不同要求,逐单匹配资源。这好比点餐外卖时按订单匹配骑手,而不是让所有订单都挤向同一家门店。

1.3 万卡集群与断点续训

当任务规模大到需要上万张加速卡同时工作时,就构成了万卡集群。集群越大,出现故障的概率也随之上升,于是断点续训应运而生:系统周期性保存训练进度,一旦发生异常,任务可从最近的保存点接着推进,而不是从头再来,从而保障有效训练时长。

二、调度之旅:一次训练任务的五个驿站

把一场大模型训练想象成一次长途出行,天翼云息壤算力调度就像全程陪伴的“调度中枢”,一路上设有五个驿站:

2.1 第一站“出发”:提交任务,统一接入

旅程从用户提交任务开始。借助息壤的统一接入与统一封装能力,用户只需说明“要训练什么、需要多少算力”,无须关心资源来自哪家机构、采用何种架构,异构算力已被封装成标准化的服务。这就像打车时只输入目的地,不必了解背后调度了多少种车型、多少支车队。

2.2 第二站“导航”:感知全域,智能择路

任务出发后,调度系统开始“导航”,依次完成三件事:

① 算力感知:实时掌握全域资源的分布、负载与能耗,让算力“看得见”;

② 算力度量:为异构资源建立统一的“度量衡”,让不同规格的算力“量得准、比得了”;

③ 智能择路:综合算效、碳效、时延、安全等策略,为任务挑选最合适的目的地,绿色低碳的算力还能被优先派上用场。

路线规划得当,任务就能少排队、少绕路,资源也各得其所。

2.3 第三站“组队”:万卡级统一编排

大模型训练往往需要“万卡会战”,考验的是把海量加速卡组织成一支高效队伍的能力。息壤依托两百余项监控指标与丰富的故障知识库,在训练启动前开展一键检测、排查隐患;运行中一旦出现异常,能够快速定位、快速恢复,避免个别掉队节点拖慢整个队伍。

2.4 第四站“护航”:断点续训,稳中求进

训练周期可能长达数周甚至更久,意外中断在所难免。断点续训就像视频播放的“续播”功能:任务从最近的进度点继续推进,同时系统主动识别并绕开慢节点,把故障对训练的影响降到最低,让大规模分布式训练的有效时长稳定保持在高位。

2.5 第五站“归位”:弹性伸缩,资源回收

任务完成后,资源并不会闲置浪费:调度系统自动回收算力,支持弹性扩缩容,让资源回到统一资源池,随时响应下一位“乘客”。至此,一次调度旅程形成闭环,新一轮旅程随即开始。

三、旅程之外:调度能力经受的真实检验

3.1 城市算力网先行先试

息壤的调度能力早已走出实验室:在上海,它承载于临港国产万卡算力池之上,盘活区域零散的通算、智算与超算资源;在北京,它支撑算力互联互通验证平台,与多家伙伴实现算力并网;在苏州,它为工业园区打造了集服务门户、算力接入、编排调度、资源运营、监控运维于一体的公共算力服务平台,让园区企业像用水用电一样取用算力。

3.2 跨域协同的“大调度”

跨地域调度更考验功力。息壤积极接应重庆“疆算入渝”工程,将新疆哈密绿色、低时延的算力引入重庆,并成功把京、沪两地的万卡级国产化算力调度入渝,实现超低时延、高效互联——东部需求与西部资源,在调度中完成精准对接。

3.3 不同行业的任务各得其所

行业任务形形色色,调度也各有章法:

① 科研领域,高校团队借助平台训练万亿参数大模型,动态调度让研究成果的产出周期明显缩短;

② 医疗领域,平台支持密文状态下的模型训练,某三甲医院以此将肺部CT影像的病灶识别准确率提升到较高水平,且原始数据始终不出域;

③ 制造领域,企业依托万卡级并行算力大幅压缩碰撞仿真等研发环节的周期,还能同步优化多套结构方案。

四、权威认可:调度实力的“成绩单”

一路走来,息壤的调度能力收获了多方认可:入选“2022年度央企十大超级工程”,荣获中国算力大会“算力中国·年度突破成果”奖,获评第六届数字中国建设峰会“十大硬核科技”,入选国有企业数字化转型论坛“典型数字技术成果”。依托以“息壤”为核心的一体化智算服务体系,天翼云还荣获世界互联网大会“杰出贡献奖”,相关智算基础设施项目获中国电子学会科技进步奖。

在标准与生态层面,天翼云发起息壤算力互联互通及调度管理服务计划,参编《城市算力互联网实践指南》,并携手产学研各界参与算力互联互通国家标准研究,让“调度”有章可循、有规可依。

五、科普小结:旅程有终点,调度无止境

回顾这场调度之旅:出发时统一接入,让异构算力听指挥;导航时智能择路,让任务少走弯路;组队时万卡编排,让集群协同高效;护航时断点续训,让长跑不惧风浪;归位时弹性伸缩,让资源循环不歇。天翼云息壤算力调度的意义,正在于把一次次平凡的任务旅程,组织成一张高效运转的算力网络。当越来越多的大模型任务在这张网上顺畅穿行,算力这一新型基础设施,也将真正像水与电一样,滋养千行百业。

文章来自个人专栏
文章 | 订阅
0条评论
0 / 1000
请输入你的评论
0
0