K3(1) 3.管理节点加入计算队列 Slurm 集群默认架构设计中,管理节点常规场景下不纳入计算调度队列。在大模型训推、高性能算力作业场景下,单靠原有计算节点资源难以满足大模型权重加载、容器运行、推理生成的高算力与大内存诉求。 为最大化挖掘整机集群资源利用率、扩充可用算力规模,需将管理节点从纯管理模式,纳入 Slurm 计算调度队列,使其同时承担集群管理 + 大模型算力计算双重角色,统一参与大模型相关作业调度与算力承载。 shell sed i 's/^snoderoles./NodeRoleserver,execute/i' /usr/local/galaxy/cluster/default/galaxylauncher/etc/launcher.conf launcher resource setupscheduler {"success": true, "result": null} master0001为管控节点hostname,按实际修改;batch是队列名,在计算节点下单页可自定义命名,建议用batch launcher resource addnode nodename master0001 queuename batch {"success": true, "result": null} 命令执行成功后,可通过sinfo命令查看计算队列节点 shell 查看计算队列节点 sinfo PARTITION AVAIL TIMELIMIT NODES STATE NODELIST batch up infinite 4 idle compute[00010003],master0001 物料准备 1.模型文件获取 方式一:(极速)使用cthpc一键安装工具,分钟级快速下发模型,当前支持: shell mkdir p /mnt/nvme1n1/model 使用 cthpc 工具极速下发 cthpc model makecache cthpc model install KimiK3w4a8 dir /mnt/nvme1n1/model/ 方式二:(传统方式速度慢)基于modelscope、魔乐社区、huggingface平台,使用对应工具直接下载(不推荐,受限于公网EIP订阅的带宽大小) shell mkdir p /mnt/nvme1n1/model/KimiK3w4a8 modelscope下载依赖python3.8+的环境,若缺失,则需要构建虚拟环境 pip install upgrade pip i pip install modelscope modelscope download model EcoTech/KimiK3w4a8 localdir /mnt/nvme1n1/model/KimiK3w4a8
来自: