一、成本构成:看得见的三笔与看不见的三笔
先建立统一的账目口径。大模型训练的成本大致可以拆成三块显性部分。
第一块是算力成本,也就是加速卡的购置或租用支出,通常占总成本的大头,业界测算普遍落在六成到八成的区间。第二块是能源成本,包括供电与制冷的消耗,占比约在一到两成。第三块是时间成本,训练周期延长带来的人力投入与机会成本,这部分不直接体现在发票上,却真实地拖慢业务节奏。
除此之外,还有三笔容易被忽略的隐性支出。其一是运维人力,集群需要有人负责调度系统、网络、存储、故障处理与升级,这是一份长期固定投入。其二是故障成本,硬件在长时间高负载下会出现异常,没有做好检查点,之前的进度可能全部丢失;即便有检查点,手动恢复也需要时间,而这期间资源仍在消耗。其三是迭代风险,加速卡的更新换代节奏很快,购置的硬件在折旧周期内可能面临性能落后与保值率下降的问题。
把六笔都算进去,两种方案的比较才成立。
二、自建集群的真实账
自建的支出集中在前期,且是刚性的。
一次性投入包括硬件采购、机房与供配电改造、制冷系统、网络互联设备与存储系统。其中网络与存储常常被低估:大规模分布式训练对机间互联带宽的要求很高,互联带宽不足会直接导致卡数增加带来的收益迅速衰减;存储吞吐跟不上,算卡就会反复等待数据。这两项若配置不足,等于花了大价钱却跑不出应有的效率。
持续投入包括电力、运维人力、设备维保与折旧。折旧的年限设定会显著影响每年的账面成本,而加速卡的技术迭代速度往往快于折旧周期,这意味着账面还没折完,硬件的性能优势可能已经不再突出。
自建的优势也很明确:资源完全自主可控,数据不出本地,负载稳定时单位成本可以做到较低,且不受外部资源紧张的影响。对数据合规要求极高、且训练任务长期饱和的机构,自建是有吸引力的。
但自建有一个容易被忽视的前提:利用率。自建集群的成本是固定的,用不用都在那里。如果实际负载长期低于设计容量,闲置的部分就是纯浪费。业界不少自建集群的平均利用率不足四成,这直接把单位成本抬高了一倍有余。
三、租用算力的真实账
租用的支出随用量浮动,按需结算。
它的优势在于把固定成本变成了可变成本:不需要前期的大额投入,不需要承担机房与电力改造,不需要配备专门的硬件运维团队,也规避了硬件折旧与技术迭代的风险。资源池化与智能调度还能把利用率从传统模式的四到五成提升到七成以上,实际计费的算力因此下降。环境的配置可以通过预置镜像与自动化流程压缩到很短的时间,故障恢复依靠自动检查点与迁移机制,对训练进度的影响大幅降低。
公开案例中的测算显示,在同等任务下,借助资源池化、智能调度与自动化运维,整体成本较传统租用模式可降低三到四成。某能源领域央企在息壤平台上开展行业大模型训练,通过分层存储与数据缓存把训练数据读取时延降低四成,通过自动化断点续训把非正常停机时间压缩七成五,整个训练周期较其自建方案缩短约一半——周期缩短本身也是成本的下降。
租用的代价在于:长期高负载时,累计支出的单价通常高于自建的摊薄成本;资源可用性受整体供需影响,高峰期可能需要排队;对数据合规性要求极严的场景,需要选择私有化或专属资源方案。
四、临界点在哪
两种方案的优劣会随几个变量翻转,关键看四点。
第一是负载率。长期的、稳定的、高负载的训练任务,自建的摊薄成本更有优势;间歇性的、脉冲式的、负载波动大的需求,租用明显更划算。科研机构的算力需求往往呈现脉冲特征——实验阶段需要大量算力,分析与写作阶段需求骤降——这类场景下租用几乎总是更优。
第二是时间跨度与规模。任务周期短、规模中等的项目,租用的启动成本优势明显;持续数年、规模稳定在千卡以上的项目,自建的摊薄优势才会显现。
第三是团队能力。自建集群需要掌握调度系统、网络拓扑、存储调优与故障处理的一整套工程能力,缺乏专职运维团队的单位,自建后往往陷入"有了卡却跑不满"的困境。息壤这类服务把调度、运维与工具链做成内置能力,正是为了降低这一门槛。
第四是合规与数据边界。数据必须留在本地、不能外传的场景,需要在私有化形态下解决,此时可选的是自建、一体机或私有化交付的智算服务,而不仅是公有形态的租用。
五、自测方法与决策框架
建议按四步自测。
第一步,铺开历史用量曲线。把过去六到十二个月的算力需求按周铺开,看稳态基线、峰值与谷值。基线高且平稳,倾向自建或预留;基线低、峰谷差大,倾向租用。
第二步,算总拥有成本。自建侧把硬件、机房、电力、运维人力、维保与折旧按三年摊开,得到年度成本;租用侧按实际用量乘以单价,加上环境准备与故障损失的估算,得到年度成本。两者放在同一张表上比较,而不是比单价。
第三步,评估利用率。用小规模任务实测吞吐,算出单位产出的成本。自建方案的利用率若达不到六成以上,单位成本会被显著抬高,此时需要重新审视规模设计。
第四步,评估风险与弹性。问三个问题:业务高峰期能否快速拿到资源?硬件故障时的恢复能力如何?技术换代时现有投入的保值性如何?这三问的答案,往往比成本表更能决定长期体验。
六、混合策略与迁移路径
现实中不必二选一,混合往往是更优解:把稳态的基线负载用自建或预留资源承载,拿低单价;把峰值与实验性需求交给弹性算力,用灵活性换取不积压。这种组合既控住了成本基线,又保留了应对突发的能力。
迁移路径上,建议从租用起步:先用弹性算力跑通流程、积累用量数据、摸清真实负载曲线,再据此判断是否需要自建以及自建多大规模。反过来先建后算,容易出现容量设计与实际需求错配。
对已经自建的团队,也可以把溢出负载导向外部算力,在高峰期借力,避免为一年几次的峰值去扩容整个集群。息壤支持公有云、混合云与轻量化多种交付形态,也为这种混合编排留出了空间。
结语
自建与租用的成本之争,没有放之四海的答案,只有与自己负载曲线匹配的解。把显性成本与隐性成本一并入账,用历史用量曲线判断负载形态,用总拥有成本而非单价做比较,再叠加团队能力与合规边界的考量,结论自然会浮现。负载稳定且饱和的走自建或预留,波动与探索性的走弹性租用,两者并用的混合策略,是多数成长型团队的现实答案。