Flash(1) 本指南基于天翼云HCC(高性能计算集群)平台,提供从集群开通、环境配置到服务部署的全流程详细操作,帮助用户快速完成GLM5.3Flash 在升腾910B算力上部署,实现稳定、高效的推理服务。 2026年8月26日,GLM5.3Flash 正式开源权重(此前在匿名测试中代号为“Ox Alpha”),作为GLM5系列首个原生多模态模型,以极低成本实现更强智能。模型采用320B总参数、18B激活参数的混合架构,首次在开源前沿模型中融合稀疏注意力与线性注意力,相较GLM5.3,Attention计算开销降低3.01倍,KV Cache降低4.44倍,在百万级长上下文中保持高效推理。同时内置视觉编码能力,将界面观察、渲染反馈与代码执行闭环打通,覆盖前端、游戏、3D场景及BUA/CUA真实操作;并延伸至Office办公、金融研究、文档处理等专业工作流,可自主产出PPTX、PDF、DOCX、XLSX等成品。 资源要求 管理节点:1 台搭载昇腾 910B NPU 的节点(每节点 8 × 64GB 昇腾 910B,HBM2e 显存)。 计算节点:31台搭载昇腾 910B NPU 的节点(每节点 8 × 64GB 昇腾 910B,HBM2e 显存)。 共享存储:根据资源池选择 OceanFS 或 SFS Turbo,容量需满足启动日志及脚本需求(默认500GB)。 网络:节点间使用 RoCE 或高速以太网连接,管理节点绑定 EIP 用于公网访问,EIP 避免直接暴露在公网,具体可参照安全防护。
来自: