当智算集群从几十台扩展到上万张加速卡,调度不再只是“把任务放进空闲机器”那么简单。资源规模越大,组合可能越多,决策越容易陷入爆炸。算力调度平台的价值,正是用一套可扩展的算法,把海量资源与海量任务之间的匹配做得既快又稳。
一、万卡级调度的核心难题
1.1 组合爆炸与决策时延
上万张加速卡、成千上万个并发任务,若逐一穷举匹配方案,计算量远超实时可承受范围。调度一旦变慢,任务排队变长,昂贵的加速资源就会在等待中白白空转。
1.2 调度要兼顾的三件事
一个好的算力调度平台至少要在以下维度取得平衡:
1. 效率:让任务尽快拿到所需资源,减少排队;
2. 公平:不同团队、不同优先级的任务各有其位,避免一方挤占另一方;
3. 稳定:大规模下调度本身不能成为故障源。
二、层级分治映射算法的思路
2.1 把大问题拆成小问题
天翼云息壤算力调度平台采用层级分治映射算法,核心思想是先分层、再分治。系统把庞大的集群按层级抽象,先在较粗的粒度上确定任务落到哪一组资源,再在组内做精细匹配,从而把指数级的复杂度降为可管理的多级决策。
2.1.1 粗粒度定域
粗粒度阶段快速圈定候选资源域,过滤掉明显不匹配的分区,大幅缩小后续搜索范围,让决策在秒级完成。
2.1.2 细粒度精配
在候选域内,平台再综合考虑显存、互联带宽与任务亲和性做精细 placement,使任务落在最合适的具体芯片上,避免“能跑但不优”的浪费。
2.2 算数协同把效率做实
算法之外,平台以算数协同让计算侧与调度侧信息互通:加速器利用率、互联拓扑、任务进度等被实时反馈给调度器,使后续决策建立在真实负载之上,而非陈旧估计。
三、规模与稳定性的统一
3.1 87EFLOPS 调度规模下的从容
在达到 87EFLOPS 量级的调度规模时,层级分治映射算法的优势愈发明显——它让调度开销随规模近似线性增长,而非指数膨胀,使万卡级集群也能保持敏捷响应。
3.2 与异构算力纳管的配合
调度平台与异构算力纳管能力协同,把不同型号的加速芯片统一抽象,调度器无需关心底层差异,只按统一资源视图做决策,进一步降低了系统的整体复杂度。
3.3 调度与纳管的协同红利
层级分治映射算法解决的是“怎么排”,异构算力纳管解决的是“排给谁”。二者协同,使调度器既能在大图上做快决策,又能在小图上做精匹配,把算法优势落到实处。
这种协同把算法效率转化为真实的资源利用率,对科研用户来说最终体现为一句话:提交任务之后,等待更短、运行更稳、结果更可预期,复杂的底层差异被悄然消解于无形。
在实际落地中,调度平台的价值往往通过“看不见”的体验体现:研究者只管提交任务,剩下的 placement、容错与回收都由系统默默完成。
这恰恰是万卡级调度走向成熟的标志——复杂被收敛进平台内部,留给用户的只有简洁与稳定,使用门槛因此被悄悄降低。
万卡级调度的本质,是用算法在规模与效率之间找平衡。以层级分治映射算法与算数协同为支柱,天翼云息壤算力调度平台正把复杂的 placement 问题化繁为简,让分散的加速资源真正拧成支撑科研的绳。