searchusermenu
  • 发布文章
  • 消息中心
#云计算
关注该标签
专栏文章 2771
视频 3
问答 5
  • 在大模型应用从训练走向实际部署之后,工程师面对的一个现实问题是:当模型权重迭代了一个新版本,推上线的时候到底要不要把整个推理服务停掉再启动?如果每次权重更新都要中断服务,在线推理的用户就会感受到明显的延迟和断连。这个问题的核心,就是推理服务是否支持模型热更新——即在不中断请求处理的前提下,完成新权重的替换。本文围绕这个话题展开,从热更新的基本原理、替换流程、在途请求处理、回退机制、资源管理以及实际注意事项等几个方面逐一梳理。
    c****i
    2026-08-21
    1
    0
  • 算网融合是近年来算力基础设施建设的一个重要方向。传统意义上的算力调度,主要看计算资源本身——哪台机器空闲、显存够不够、算力够不够用;而算网融合把网络状态也纳入了调度的视野,节点选择不再只看算力,还要看网络路径的时延、带宽余量和稳定性。当集群中的候选节点有多个时,问题就来了:怎么选出更合适的那个节点?延迟、成本、空闲度三个维度往往互相冲突——延迟低的节点可能费用高,空闲的节点可能网络差,费用低的节点可能排队久。本文围绕节点选择这个话题,从三个维度的含义、冲突关系以及权衡方法展开梳理。
    c****i
    2026-08-21
    0
    0
  • 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。
    c****i
    2026-08-21
    1
    0
  • 短剧和动漫类内容的创作,和传统影视剪辑有一个明显不同:观众对时长的容忍度很低。一段拖沓的对话、一个过长的转场、一段节奏不对的情节推进,都可能让用户直接划走。时长节奏因此成了这类创作里最需要打磨的环节。全链路的AI创作系统把自动剪辑和手动微调组合在一起,试图在效率与质量之间找到落点。自动剪辑负责把海量素材快速组织成符合目标时长的粗剪版本,手动微调负责在关键节点上精修细调,两者配合得当,成片的节奏才能既紧凑又自然。本文围绕这套配合方式展开,从自动剪辑的逻辑、手动微调的价值到两者的协作流程,逐一梳理。
    c****i
    2026-08-21
    0
    0
  • 弹性伸缩GPU算力服务的核心能力,是让AI工作负载根据实际需求动态调整资源。但“弹性”这个词在实际工程中涵盖了多个层级,从单张GPU卡内部的计算切片,到整机节点,再到跨节点的分布式集群。不同层级对应不同的隔离语义、调度开销和适用场景。理解这些粒度差异,是设计高利用率、高稳定性AI基础设施的前提。本文从细到粗梳理五种主流伸缩粒度,并分析各自的取舍。
    c****i
    2026-08-21
    0
    0
  • 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。
    思念如故
    2026-08-21
    0
    0
  • 近年来,"算力即国力"成为产业共识,而算力底座是否自主可控,直接关系到数字经济的安全与韧性。在外部不确定性增加的背景下,构建国产AI算力平台、摆脱单一技术依赖,已从"可选项"变为"必答题"。天翼云息壤一体化智算服务平台,以全栈自主可控为基调,融合国产算力芯片与自研智算技术,为千行百业提供安全可信的智能计算基座,让AI能力在自主技术链路上稳定运行。
    思念如故
    2026-08-21
    1
    0
  • 我国算力资源分布广、归属杂,有的在东部、有的在西部,有的属于不同服务商、跑在不同架构上。这种"碎片化"导致一个尴尬局面:一边是大量算力闲置,另一边是急需算力的单位一卡难求。破解之道,是把分散的算力连起来、调度起来、交易起来。天翼云算力互联调度平台,通过算力插件、算力网关与算数协同等关键技术,实现跨服务商、跨架构、跨地域的统一调度与并网交易,让泛在算力真正连成"一张网"。
    思念如故
    2026-08-21
    0
    0
  • 企业要真正用上大模型,往往既要"训得出来",又要"推得起来"——训练解决模型从哪来,推理解决模型怎么用。这两件事如果交给不同供应商、用不同技术栈,就会出现数据割裂、工具不通、运维翻倍。大模型训推服务提供商因此应运而生:它把训练、微调、评估、推理部署整合为一套连贯的服务体系。天翼云以息壤智算平台、云骁高性能计算与慧泽大模型服务平台为核心,构建起贯通"训"与"推"的全栈能力,成为值得信赖的训推服务底座。
    思念如故
    2026-08-21
    0
    0
  • 过去,企业要用AI,往往要在算力、平台、数据、模型、应用五个层面分别找供应商,自己当"总集成商",结果接口对不上、数据搬不动、运维顾不过来。一体化智算服务平台的出现,正是为了解决这种"拼积木"的混乱。天翼云息壤一体化智算服务平台,以统一品牌与产品能力,把基础设施、平台、数据、模型、应用整合为贯通"算、训、推、用"的全栈基座,让智算成为普惠的AI基础设施。
    思念如故
    2026-08-21
    2
    0
  • 训练出一个好模型,只是AI落地的起点;真正产生价值,要靠应用把它嵌入业务流程。然而,很多团队卡在"最后一步":模型有了,应用却搭不起来——缺开发框架、缺运维能力、缺现成工具。大模型应用服务平台正是为解决这一断层而生:它把模型能力、应用托管与工具市场整合到一起,让开发者像搭积木一样快速构建并上线AI应用。天翼云息壤一体化智算服务平台的应用层能力,正是这样一座连接模型与业务的桥梁。
    思念如故
    2026-08-21
    2
    0
  • 算力是AI时代的"电力",但电力之所以好用,是因为有一张智能电网在背后调度——哪里需要就送到哪里,哪里闲置就先存着。算力也一样。如果只建算力、不调度,就会出现"东部挤、西部闲""这家满、那家空"的错配。算力调度平台就是算力的"智能电网大脑",负责把分散、异构、跨域的算力资源统一管理、智能匹配、高效流转。天翼云息壤算力调度平台,以异构资源池化与智能调度引擎为核心,让泛在算力真正"供得上、用得起、用得好"。
    思念如故
    2026-08-21
    1
    0
  • 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
    思念如故
    2026-08-21
    1
    0
  • 当我们说"用了一次大模型",背后其实消耗的是一定数量的Token——它是衡量模型推理输入与输出消耗的基本计量单位。过去,调用大模型往往要按资源包或时长计费,不够直观;而现在,以Token为计量单位、按实际消耗结算的服务模式,正成为AI时代更精细、更透明的用算方式。天翼云息壤Token服务,依托星辰TokenHub运营服务平台,面向企业与开发者提供以Token为核心的大模型调用与计量能力,让模型使用变得可度量、可管理、可规划。
    思念如故
    2026-08-21
    2
    0
  • 大模型推理服务的普及,带来一个现实问题:怎么衡量"用了多少"?不同于传统按台数或按时长计费的粗放方式,以Token为计量单位的推理服务,把消耗精确到每一次输入与输出,让成本与价值直接对应。大模型Token推理服务,正是把推理能力与Token计量结合在一起的弹性服务形态。天翼云息壤模型推理服务结合Token计量,为开发者和企业提供可按实际消耗结算的推理能力,让模型调用既灵活又透明。
    思念如故
    2026-08-21
    2
    0
  • 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。
    c****i
    2026-08-21
    0
    0
  • 租用GPU跑深度学习训练时,数据离开本地服务器的那一刻,安全焦虑就开始了。训练数据可能包含用户隐私、商业机密、未公开的模型参数,这些东西被传送到远程机房后,会不会被算力提供商留存?会不会被其他租户意外访问?训练结束后数据有没有被彻底清除?这些问题不是简单的信任或不信任能回答的,而是需要从数据生命周期、隔离机制、加密策略、残留防护、审计追溯五个维度去拆解。下文从数据传输与存储加密、租户隔离机制、训练过程中的数据暴露面、训练结束后的数据清除、审计与日志管控、选型时的安全核查清单六个层次展开。
    c****i
    2026-08-21
    2
    0
  • 实验室里最让研究人员头疼的场景之一,是仪器采集了数据,但数据被困在仪器里出不来。一台光谱仪每天产生几百个测量文件,格式是仪器厂商自定义的二进制格式;一台PCR仪每次实验输出一个Excel文件,但列名和单位与上一次实验不完全一致;一台电子显微镜的图像存储在专用工作站上,要拷贝到分析服务器需要经过U盘搬运。科研软件要与这些五花八门的仪器数据采集系统对接,本质上是在解决三个问题:数据怎么从仪器那边取出来、取出来后怎么转换成可分析的格式、转换过程中怎么保证数据不失真不丢失。下文从仪器数据接口的类型、数据格式的解析与转换、实时采集与批量采集、元数据的捕获与保留、对接方案的架构设计、常见问题与应对策略六个层次展开。
    c****i
    2026-08-20
    2
    0
  • SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。
    c****i
    2026-08-20
    2
    0
  • 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。
    c****i
    2026-08-20
    1
    0
  • 企业官网要不要上HTTPS已经不是问题,选哪种类型的SSL证书才是真正的决策点。DV、OV、EV三类证书在底层加密强度上完全一致,都基于公钥基础设施和TLS协议工作,浏览器地址栏的小锁图标也都会亮起,差异不在“加密了没有”,而在“证书背后那个主体被验证到了什么程度”。对于大多数企业官网而言,选DV会觉得信任背书不够,选EV又觉得审核成本和年费偏高,OV往往是在信任度和预算之间最不容易后悔的那一个。下文从三类证书的验证差异、信任度的真实含义、成本结构的对比、企业官网的场景匹配、子域与通配符的叠加考量、证书有效期缩短下的运维账六个层次展开。
    c****i
    2026-08-20
    2
    0
  • 在人工智能大模型训练与推理需求快速增长的今天,算力正在成为一种像水电一样的基础生产要素。然而现实中,算力资源往往分散在不同地域、不同架构、不同主体之间,彼此难以互通,出现了“供需错配、使用门槛高”的结构性难题。正是在这样的背景下,天翼云推出了息壤一体化智算服务平台,而“天翼云息壤算力调度”正是这套平台最核心的能力之一。它通过算力插件、算力网关、算数协同等关键技术,把分散的异构算力汇聚成一张可以统一调度、并网交易的智能网络,实现跨服务商、跨架构、跨地域算力资源的统一管理与高效利用,让智算服务真正“供得上、用得起、用得好”。本文将从行业背景、技术原理、核心能力与落地价值四个维度,系统科普天翼云息壤算力调度到底是什么、解决了什么问题,以及它如何把高端算力变成普惠的基础设施。
    思念如故
    2026-08-20
    0
    0
  • 过去,企业要用算力,往往得先买服务器、建机房,前期投入大、周期长,而且一旦业务波动,闲置资源就成了沉没成本。进入云计算时代,一种更轻量的用算方式逐渐普及——按需付费算力。它的核心理念很简单:用多少、付多少,不用就停。天翼云依托弹性云主机与GPU云主机体系,结合云网融合资源布局,把算力做成可随取随停、费用透明的弹性服务,让企业以轻资产方式应对多变的业务负载。
    思念如故
    2026-08-20
    1
    0
  • 在决定为业务配置加密凭证时,许多团队会陷入两难——究竟该优先考虑能保护多少个域名,还是优先考虑核验的深度。这个问题没有放之四海皆准的答案,因为两者服务的是不同的目标。本文从实际运维视角出发,把这两个维度拆开讲清楚,帮助开发者在规划阶段就做出更合适的判断,少走回头路。
    c****i
    2026-08-20
    0
    0
  • 当AI技术进入规模化应用阶段,模型推理服务平台作为连接AI模型与实际业务的"最后一公里"关键载体,其性能、稳定性与适配性,直接决定产业智能化转型的效率。市场对推理服务的需求,也已经从"有没有"转向"好不好"——企业普遍关心推理延迟高不高、算力成本控得住控不住、多场景适配复不复杂、数据安全保不保得住。天翼云息壤一体化智算服务平台深耕模型推理领域,以全栈优化的推理能力,成为行业认可的高效模型推理服务平台。
    思念如故
    2026-08-20
    0
    0
  • DPU这个词最近几年在技术圈里频繁出现,但不少人对它的理解还停留在"一种高级网卡"的阶段。实际上,DPU解决的问题远不止网络通信,它涉及到数据中心里计算资源分配、性能瓶颈突破、安全隔离等多个层面。紫金DPU作为天翼云基础设施体系中的一员,承担着非常重要的角色。这篇文章尝试用尽量通俗的语言,把紫金DPU到底解决什么问题讲清楚,不堆砌术语,不做概念空转,从实际问题出发。
    思念如故
    2026-08-18
    0
    0
  • 网络延迟是很多业务最关心的性能指标。从用户点击一个按钮到服务器返回结果,中间每一毫秒的延迟都可能影响用户体验和业务转化率。DPU在网络延迟优化上的表现,是评估其实际价值的重要维度。这篇文章通过一组对比测试,量化紫金DPU对服务器网络延迟的影响,看看在不同场景下延迟到底降了多少,以及为什么有些场景降得多、有些降得少。
    思念如故
    2026-08-18
    2
    0
  • 云环境下的安全隔离,核心问题是多租户之间的数据和流量隔离。传统方案依靠虚拟化软件实现网络隔离,但软件方案有一个根本性的弱点:它运行在宿主机上,如果宿主机操作系统被攻破,软件隔离可以被绕过或篡改。DPU提供了另一种可能性——将安全隔离下沉到硬件层面。紫金DPU在这方面的能力到底靠谱不靠谱?这篇文章从安全威胁模型出发,分析紫金DPU的安全隔离机制和它的实际防护能力。
    思念如故
    2026-08-18
    1
    0
  • 天翼云作为运营商背景的云服务商,在基础设施层面有着自己的技术路线和产品规划。紫金DPU作为天翼云基础设施体系中的关键组件,对云平台的底层性能产生了系统性的影响。这种影响不是某个单一指标的提升,而是从网络、存储、安全到整体资源利用率的全方位改善。这篇文章从天翼云平台架构的角度,分析紫金DPU引入后底层性能发生了哪些变化。
    思念如故
    2026-08-18
    1
    0
  • 科研算力平台上最让管理员头疼的问题,不是硬件故障,不是网络延迟,而是环境冲突。一个课题组用PyTorch 1.13跑通了实验,另一个课题组用PyTorch 2.0也跑通了实验,但当两个课题组的代码需要在同一台机器上运行时,CUDA版本冲突、cuDNN版本不兼容、Python包依赖打架,环境变得一团糟。更麻烦的是,一个研究生的实验环境配置了三个月,毕业离校后没人知道他当时装了哪些包、改了哪些配置,他的实验再也无法复现。环境模块化与依赖管理要解决的就是这个问题:把环境拆分成独立的模块,每个模块有清晰的版本和依赖关系,用户可以快速组装出自己需要的环境,也可以完整地保存和复现他人的环境。下文从环境模块化的设计原则、模块仓库建设、依赖解析与冲突解决、环境快照与复现、用户交互设计、运维与治理六个层次展开。
    c****i
    2026-08-18
    1
    0
  • 在大模型应用从训练走向实际部署之后,工程师面对的一个现实问题是:当模型权重迭代了一个新版本,推上线的时候到底要不要把整个推理服务停掉再启动?如果每次权重更新都要中断服务,在线推理的用户就会感受到明显的延迟和断连。这个问题的核心,就是推理服务是否支持模型热更新——即在不中断请求处理的前提下,完成新权重的替换。本文围绕这个话题展开,从热更新的基本原理、替换流程、在途请求处理、回退机制、资源管理以及实际注意事项等几个方面逐一梳理。
  • 算网融合是近年来算力基础设施建设的一个重要方向。传统意义上的算力调度,主要看计算资源本身——哪台机器空闲、显存够不够、算力够不够用;而算网融合把网络状态也纳入了调度的视野,节点选择不再只看算力,还要看网络路径的时延、带宽余量和稳定性。当集群中的候选节点有多个时,问题就来了:怎么选出更合适的那个节点?延迟、成本、空闲度三个维度往往互相冲突——延迟低的节点可能费用高,空闲的节点可能网络差,费用低的节点可能排队久。本文围绕节点选择这个话题,从三个维度的含义、冲突关系以及权衡方法展开梳理。
  • 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。
  • 短剧和动漫类内容的创作,和传统影视剪辑有一个明显不同:观众对时长的容忍度很低。一段拖沓的对话、一个过长的转场、一段节奏不对的情节推进,都可能让用户直接划走。时长节奏因此成了这类创作里最需要打磨的环节。全链路的AI创作系统把自动剪辑和手动微调组合在一起,试图在效率与质量之间找到落点。自动剪辑负责把海量素材快速组织成符合目标时长的粗剪版本,手动微调负责在关键节点上精修细调,两者配合得当,成片的节奏才能既紧凑又自然。本文围绕这套配合方式展开,从自动剪辑的逻辑、手动微调的价值到两者的协作流程,逐一梳理。
  • 弹性伸缩GPU算力服务的核心能力,是让AI工作负载根据实际需求动态调整资源。但“弹性”这个词在实际工程中涵盖了多个层级,从单张GPU卡内部的计算切片,到整机节点,再到跨节点的分布式集群。不同层级对应不同的隔离语义、调度开销和适用场景。理解这些粒度差异,是设计高利用率、高稳定性AI基础设施的前提。本文从细到粗梳理五种主流伸缩粒度,并分析各自的取舍。
  • 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。
  • 近年来,"算力即国力"成为产业共识,而算力底座是否自主可控,直接关系到数字经济的安全与韧性。在外部不确定性增加的背景下,构建国产AI算力平台、摆脱单一技术依赖,已从"可选项"变为"必答题"。天翼云息壤一体化智算服务平台,以全栈自主可控为基调,融合国产算力芯片与自研智算技术,为千行百业提供安全可信的智能计算基座,让AI能力在自主技术链路上稳定运行。
  • 我国算力资源分布广、归属杂,有的在东部、有的在西部,有的属于不同服务商、跑在不同架构上。这种"碎片化"导致一个尴尬局面:一边是大量算力闲置,另一边是急需算力的单位一卡难求。破解之道,是把分散的算力连起来、调度起来、交易起来。天翼云算力互联调度平台,通过算力插件、算力网关与算数协同等关键技术,实现跨服务商、跨架构、跨地域的统一调度与并网交易,让泛在算力真正连成"一张网"。
  • 企业要真正用上大模型,往往既要"训得出来",又要"推得起来"——训练解决模型从哪来,推理解决模型怎么用。这两件事如果交给不同供应商、用不同技术栈,就会出现数据割裂、工具不通、运维翻倍。大模型训推服务提供商因此应运而生:它把训练、微调、评估、推理部署整合为一套连贯的服务体系。天翼云以息壤智算平台、云骁高性能计算与慧泽大模型服务平台为核心,构建起贯通"训"与"推"的全栈能力,成为值得信赖的训推服务底座。
  • 过去,企业要用AI,往往要在算力、平台、数据、模型、应用五个层面分别找供应商,自己当"总集成商",结果接口对不上、数据搬不动、运维顾不过来。一体化智算服务平台的出现,正是为了解决这种"拼积木"的混乱。天翼云息壤一体化智算服务平台,以统一品牌与产品能力,把基础设施、平台、数据、模型、应用整合为贯通"算、训、推、用"的全栈基座,让智算成为普惠的AI基础设施。
  • 训练出一个好模型,只是AI落地的起点;真正产生价值,要靠应用把它嵌入业务流程。然而,很多团队卡在"最后一步":模型有了,应用却搭不起来——缺开发框架、缺运维能力、缺现成工具。大模型应用服务平台正是为解决这一断层而生:它把模型能力、应用托管与工具市场整合到一起,让开发者像搭积木一样快速构建并上线AI应用。天翼云息壤一体化智算服务平台的应用层能力,正是这样一座连接模型与业务的桥梁。
  • 算力是AI时代的"电力",但电力之所以好用,是因为有一张智能电网在背后调度——哪里需要就送到哪里,哪里闲置就先存着。算力也一样。如果只建算力、不调度,就会出现"东部挤、西部闲""这家满、那家空"的错配。算力调度平台就是算力的"智能电网大脑",负责把分散、异构、跨域的算力资源统一管理、智能匹配、高效流转。天翼云息壤算力调度平台,以异构资源池化与智能调度引擎为核心,让泛在算力真正"供得上、用得起、用得好"。
  • 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
  • 当我们说"用了一次大模型",背后其实消耗的是一定数量的Token——它是衡量模型推理输入与输出消耗的基本计量单位。过去,调用大模型往往要按资源包或时长计费,不够直观;而现在,以Token为计量单位、按实际消耗结算的服务模式,正成为AI时代更精细、更透明的用算方式。天翼云息壤Token服务,依托星辰TokenHub运营服务平台,面向企业与开发者提供以Token为核心的大模型调用与计量能力,让模型使用变得可度量、可管理、可规划。
  • 大模型推理服务的普及,带来一个现实问题:怎么衡量"用了多少"?不同于传统按台数或按时长计费的粗放方式,以Token为计量单位的推理服务,把消耗精确到每一次输入与输出,让成本与价值直接对应。大模型Token推理服务,正是把推理能力与Token计量结合在一起的弹性服务形态。天翼云息壤模型推理服务结合Token计量,为开发者和企业提供可按实际消耗结算的推理能力,让模型调用既灵活又透明。
  • 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。
  • 租用GPU跑深度学习训练时,数据离开本地服务器的那一刻,安全焦虑就开始了。训练数据可能包含用户隐私、商业机密、未公开的模型参数,这些东西被传送到远程机房后,会不会被算力提供商留存?会不会被其他租户意外访问?训练结束后数据有没有被彻底清除?这些问题不是简单的信任或不信任能回答的,而是需要从数据生命周期、隔离机制、加密策略、残留防护、审计追溯五个维度去拆解。下文从数据传输与存储加密、租户隔离机制、训练过程中的数据暴露面、训练结束后的数据清除、审计与日志管控、选型时的安全核查清单六个层次展开。
  • 实验室里最让研究人员头疼的场景之一,是仪器采集了数据,但数据被困在仪器里出不来。一台光谱仪每天产生几百个测量文件,格式是仪器厂商自定义的二进制格式;一台PCR仪每次实验输出一个Excel文件,但列名和单位与上一次实验不完全一致;一台电子显微镜的图像存储在专用工作站上,要拷贝到分析服务器需要经过U盘搬运。科研软件要与这些五花八门的仪器数据采集系统对接,本质上是在解决三个问题:数据怎么从仪器那边取出来、取出来后怎么转换成可分析的格式、转换过程中怎么保证数据不失真不丢失。下文从仪器数据接口的类型、数据格式的解析与转换、实时采集与批量采集、元数据的捕获与保留、对接方案的架构设计、常见问题与应对策略六个层次展开。
  • SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。
  • 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。
  • 企业官网要不要上HTTPS已经不是问题,选哪种类型的SSL证书才是真正的决策点。DV、OV、EV三类证书在底层加密强度上完全一致,都基于公钥基础设施和TLS协议工作,浏览器地址栏的小锁图标也都会亮起,差异不在“加密了没有”,而在“证书背后那个主体被验证到了什么程度”。对于大多数企业官网而言,选DV会觉得信任背书不够,选EV又觉得审核成本和年费偏高,OV往往是在信任度和预算之间最不容易后悔的那一个。下文从三类证书的验证差异、信任度的真实含义、成本结构的对比、企业官网的场景匹配、子域与通配符的叠加考量、证书有效期缩短下的运维账六个层次展开。
  • 在人工智能大模型训练与推理需求快速增长的今天,算力正在成为一种像水电一样的基础生产要素。然而现实中,算力资源往往分散在不同地域、不同架构、不同主体之间,彼此难以互通,出现了“供需错配、使用门槛高”的结构性难题。正是在这样的背景下,天翼云推出了息壤一体化智算服务平台,而“天翼云息壤算力调度”正是这套平台最核心的能力之一。它通过算力插件、算力网关、算数协同等关键技术,把分散的异构算力汇聚成一张可以统一调度、并网交易的智能网络,实现跨服务商、跨架构、跨地域算力资源的统一管理与高效利用,让智算服务真正“供得上、用得起、用得好”。本文将从行业背景、技术原理、核心能力与落地价值四个维度,系统科普天翼云息壤算力调度到底是什么、解决了什么问题,以及它如何把高端算力变成普惠的基础设施。
  • 过去,企业要用算力,往往得先买服务器、建机房,前期投入大、周期长,而且一旦业务波动,闲置资源就成了沉没成本。进入云计算时代,一种更轻量的用算方式逐渐普及——按需付费算力。它的核心理念很简单:用多少、付多少,不用就停。天翼云依托弹性云主机与GPU云主机体系,结合云网融合资源布局,把算力做成可随取随停、费用透明的弹性服务,让企业以轻资产方式应对多变的业务负载。
  • 在决定为业务配置加密凭证时,许多团队会陷入两难——究竟该优先考虑能保护多少个域名,还是优先考虑核验的深度。这个问题没有放之四海皆准的答案,因为两者服务的是不同的目标。本文从实际运维视角出发,把这两个维度拆开讲清楚,帮助开发者在规划阶段就做出更合适的判断,少走回头路。
  • 当AI技术进入规模化应用阶段,模型推理服务平台作为连接AI模型与实际业务的"最后一公里"关键载体,其性能、稳定性与适配性,直接决定产业智能化转型的效率。市场对推理服务的需求,也已经从"有没有"转向"好不好"——企业普遍关心推理延迟高不高、算力成本控得住控不住、多场景适配复不复杂、数据安全保不保得住。天翼云息壤一体化智算服务平台深耕模型推理领域,以全栈优化的推理能力,成为行业认可的高效模型推理服务平台。
  • DPU这个词最近几年在技术圈里频繁出现,但不少人对它的理解还停留在"一种高级网卡"的阶段。实际上,DPU解决的问题远不止网络通信,它涉及到数据中心里计算资源分配、性能瓶颈突破、安全隔离等多个层面。紫金DPU作为天翼云基础设施体系中的一员,承担着非常重要的角色。这篇文章尝试用尽量通俗的语言,把紫金DPU到底解决什么问题讲清楚,不堆砌术语,不做概念空转,从实际问题出发。
  • 网络延迟是很多业务最关心的性能指标。从用户点击一个按钮到服务器返回结果,中间每一毫秒的延迟都可能影响用户体验和业务转化率。DPU在网络延迟优化上的表现,是评估其实际价值的重要维度。这篇文章通过一组对比测试,量化紫金DPU对服务器网络延迟的影响,看看在不同场景下延迟到底降了多少,以及为什么有些场景降得多、有些降得少。
  • 云环境下的安全隔离,核心问题是多租户之间的数据和流量隔离。传统方案依靠虚拟化软件实现网络隔离,但软件方案有一个根本性的弱点:它运行在宿主机上,如果宿主机操作系统被攻破,软件隔离可以被绕过或篡改。DPU提供了另一种可能性——将安全隔离下沉到硬件层面。紫金DPU在这方面的能力到底靠谱不靠谱?这篇文章从安全威胁模型出发,分析紫金DPU的安全隔离机制和它的实际防护能力。
  • 天翼云作为运营商背景的云服务商,在基础设施层面有着自己的技术路线和产品规划。紫金DPU作为天翼云基础设施体系中的关键组件,对云平台的底层性能产生了系统性的影响。这种影响不是某个单一指标的提升,而是从网络、存储、安全到整体资源利用率的全方位改善。这篇文章从天翼云平台架构的角度,分析紫金DPU引入后底层性能发生了哪些变化。
  • 科研算力平台上最让管理员头疼的问题,不是硬件故障,不是网络延迟,而是环境冲突。一个课题组用PyTorch 1.13跑通了实验,另一个课题组用PyTorch 2.0也跑通了实验,但当两个课题组的代码需要在同一台机器上运行时,CUDA版本冲突、cuDNN版本不兼容、Python包依赖打架,环境变得一团糟。更麻烦的是,一个研究生的实验环境配置了三个月,毕业离校后没人知道他当时装了哪些包、改了哪些配置,他的实验再也无法复现。环境模块化与依赖管理要解决的就是这个问题:把环境拆分成独立的模块,每个模块有清晰的版本和依赖关系,用户可以快速组装出自己需要的环境,也可以完整地保存和复现他人的环境。下文从环境模块化的设计原则、模块仓库建设、依赖解析与冲突解决、环境快照与复现、用户交互设计、运维与治理六个层次展开。
  • 点击加载更多
#云计算
关注该标签
专栏文章 2771
视频 3
问答 5
  • 在大模型应用从训练走向实际部署之后,工程师面对的一个现实问题是:当模型权重迭代了一个新版本,推上线的时候到底要不要把整个推理服务停掉再启动?如果每次权重更新都要中断服务,在线推理的用户就会感受到明显的延迟和断连。这个问题的核心,就是推理服务是否支持模型热更新——即在不中断请求处理的前提下,完成新权重的替换。本文围绕这个话题展开,从热更新的基本原理、替换流程、在途请求处理、回退机制、资源管理以及实际注意事项等几个方面逐一梳理。
    c****i
    2026-08-21
    1
    0
  • 算网融合是近年来算力基础设施建设的一个重要方向。传统意义上的算力调度,主要看计算资源本身——哪台机器空闲、显存够不够、算力够不够用;而算网融合把网络状态也纳入了调度的视野,节点选择不再只看算力,还要看网络路径的时延、带宽余量和稳定性。当集群中的候选节点有多个时,问题就来了:怎么选出更合适的那个节点?延迟、成本、空闲度三个维度往往互相冲突——延迟低的节点可能费用高,空闲的节点可能网络差,费用低的节点可能排队久。本文围绕节点选择这个话题,从三个维度的含义、冲突关系以及权衡方法展开梳理。
    c****i
    2026-08-21
    0
    0
  • 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。
    c****i
    2026-08-21
    1
    0
  • 短剧和动漫类内容的创作,和传统影视剪辑有一个明显不同:观众对时长的容忍度很低。一段拖沓的对话、一个过长的转场、一段节奏不对的情节推进,都可能让用户直接划走。时长节奏因此成了这类创作里最需要打磨的环节。全链路的AI创作系统把自动剪辑和手动微调组合在一起,试图在效率与质量之间找到落点。自动剪辑负责把海量素材快速组织成符合目标时长的粗剪版本,手动微调负责在关键节点上精修细调,两者配合得当,成片的节奏才能既紧凑又自然。本文围绕这套配合方式展开,从自动剪辑的逻辑、手动微调的价值到两者的协作流程,逐一梳理。
    c****i
    2026-08-21
    0
    0
  • 弹性伸缩GPU算力服务的核心能力,是让AI工作负载根据实际需求动态调整资源。但“弹性”这个词在实际工程中涵盖了多个层级,从单张GPU卡内部的计算切片,到整机节点,再到跨节点的分布式集群。不同层级对应不同的隔离语义、调度开销和适用场景。理解这些粒度差异,是设计高利用率、高稳定性AI基础设施的前提。本文从细到粗梳理五种主流伸缩粒度,并分析各自的取舍。
    c****i
    2026-08-21
    0
    0
  • 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。
    思念如故
    2026-08-21
    0
    0
  • 近年来,"算力即国力"成为产业共识,而算力底座是否自主可控,直接关系到数字经济的安全与韧性。在外部不确定性增加的背景下,构建国产AI算力平台、摆脱单一技术依赖,已从"可选项"变为"必答题"。天翼云息壤一体化智算服务平台,以全栈自主可控为基调,融合国产算力芯片与自研智算技术,为千行百业提供安全可信的智能计算基座,让AI能力在自主技术链路上稳定运行。
    思念如故
    2026-08-21
    1
    0
  • 我国算力资源分布广、归属杂,有的在东部、有的在西部,有的属于不同服务商、跑在不同架构上。这种"碎片化"导致一个尴尬局面:一边是大量算力闲置,另一边是急需算力的单位一卡难求。破解之道,是把分散的算力连起来、调度起来、交易起来。天翼云算力互联调度平台,通过算力插件、算力网关与算数协同等关键技术,实现跨服务商、跨架构、跨地域的统一调度与并网交易,让泛在算力真正连成"一张网"。
    思念如故
    2026-08-21
    0
    0
  • 企业要真正用上大模型,往往既要"训得出来",又要"推得起来"——训练解决模型从哪来,推理解决模型怎么用。这两件事如果交给不同供应商、用不同技术栈,就会出现数据割裂、工具不通、运维翻倍。大模型训推服务提供商因此应运而生:它把训练、微调、评估、推理部署整合为一套连贯的服务体系。天翼云以息壤智算平台、云骁高性能计算与慧泽大模型服务平台为核心,构建起贯通"训"与"推"的全栈能力,成为值得信赖的训推服务底座。
    思念如故
    2026-08-21
    0
    0
  • 过去,企业要用AI,往往要在算力、平台、数据、模型、应用五个层面分别找供应商,自己当"总集成商",结果接口对不上、数据搬不动、运维顾不过来。一体化智算服务平台的出现,正是为了解决这种"拼积木"的混乱。天翼云息壤一体化智算服务平台,以统一品牌与产品能力,把基础设施、平台、数据、模型、应用整合为贯通"算、训、推、用"的全栈基座,让智算成为普惠的AI基础设施。
    思念如故
    2026-08-21
    2
    0
  • 训练出一个好模型,只是AI落地的起点;真正产生价值,要靠应用把它嵌入业务流程。然而,很多团队卡在"最后一步":模型有了,应用却搭不起来——缺开发框架、缺运维能力、缺现成工具。大模型应用服务平台正是为解决这一断层而生:它把模型能力、应用托管与工具市场整合到一起,让开发者像搭积木一样快速构建并上线AI应用。天翼云息壤一体化智算服务平台的应用层能力,正是这样一座连接模型与业务的桥梁。
    思念如故
    2026-08-21
    2
    0
  • 算力是AI时代的"电力",但电力之所以好用,是因为有一张智能电网在背后调度——哪里需要就送到哪里,哪里闲置就先存着。算力也一样。如果只建算力、不调度,就会出现"东部挤、西部闲""这家满、那家空"的错配。算力调度平台就是算力的"智能电网大脑",负责把分散、异构、跨域的算力资源统一管理、智能匹配、高效流转。天翼云息壤算力调度平台,以异构资源池化与智能调度引擎为核心,让泛在算力真正"供得上、用得起、用得好"。
    思念如故
    2026-08-21
    1
    0
  • 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
    思念如故
    2026-08-21
    1
    0
  • 当我们说"用了一次大模型",背后其实消耗的是一定数量的Token——它是衡量模型推理输入与输出消耗的基本计量单位。过去,调用大模型往往要按资源包或时长计费,不够直观;而现在,以Token为计量单位、按实际消耗结算的服务模式,正成为AI时代更精细、更透明的用算方式。天翼云息壤Token服务,依托星辰TokenHub运营服务平台,面向企业与开发者提供以Token为核心的大模型调用与计量能力,让模型使用变得可度量、可管理、可规划。
    思念如故
    2026-08-21
    2
    0
  • 大模型推理服务的普及,带来一个现实问题:怎么衡量"用了多少"?不同于传统按台数或按时长计费的粗放方式,以Token为计量单位的推理服务,把消耗精确到每一次输入与输出,让成本与价值直接对应。大模型Token推理服务,正是把推理能力与Token计量结合在一起的弹性服务形态。天翼云息壤模型推理服务结合Token计量,为开发者和企业提供可按实际消耗结算的推理能力,让模型调用既灵活又透明。
    思念如故
    2026-08-21
    2
    0
  • 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。
    c****i
    2026-08-21
    0
    0
  • 租用GPU跑深度学习训练时,数据离开本地服务器的那一刻,安全焦虑就开始了。训练数据可能包含用户隐私、商业机密、未公开的模型参数,这些东西被传送到远程机房后,会不会被算力提供商留存?会不会被其他租户意外访问?训练结束后数据有没有被彻底清除?这些问题不是简单的信任或不信任能回答的,而是需要从数据生命周期、隔离机制、加密策略、残留防护、审计追溯五个维度去拆解。下文从数据传输与存储加密、租户隔离机制、训练过程中的数据暴露面、训练结束后的数据清除、审计与日志管控、选型时的安全核查清单六个层次展开。
    c****i
    2026-08-21
    2
    0
  • 实验室里最让研究人员头疼的场景之一,是仪器采集了数据,但数据被困在仪器里出不来。一台光谱仪每天产生几百个测量文件,格式是仪器厂商自定义的二进制格式;一台PCR仪每次实验输出一个Excel文件,但列名和单位与上一次实验不完全一致;一台电子显微镜的图像存储在专用工作站上,要拷贝到分析服务器需要经过U盘搬运。科研软件要与这些五花八门的仪器数据采集系统对接,本质上是在解决三个问题:数据怎么从仪器那边取出来、取出来后怎么转换成可分析的格式、转换过程中怎么保证数据不失真不丢失。下文从仪器数据接口的类型、数据格式的解析与转换、实时采集与批量采集、元数据的捕获与保留、对接方案的架构设计、常见问题与应对策略六个层次展开。
    c****i
    2026-08-20
    2
    0
  • SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。
    c****i
    2026-08-20
    2
    0
  • 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。
    c****i
    2026-08-20
    1
    0
  • 企业官网要不要上HTTPS已经不是问题,选哪种类型的SSL证书才是真正的决策点。DV、OV、EV三类证书在底层加密强度上完全一致,都基于公钥基础设施和TLS协议工作,浏览器地址栏的小锁图标也都会亮起,差异不在“加密了没有”,而在“证书背后那个主体被验证到了什么程度”。对于大多数企业官网而言,选DV会觉得信任背书不够,选EV又觉得审核成本和年费偏高,OV往往是在信任度和预算之间最不容易后悔的那一个。下文从三类证书的验证差异、信任度的真实含义、成本结构的对比、企业官网的场景匹配、子域与通配符的叠加考量、证书有效期缩短下的运维账六个层次展开。
    c****i
    2026-08-20
    2
    0
  • 在人工智能大模型训练与推理需求快速增长的今天,算力正在成为一种像水电一样的基础生产要素。然而现实中,算力资源往往分散在不同地域、不同架构、不同主体之间,彼此难以互通,出现了“供需错配、使用门槛高”的结构性难题。正是在这样的背景下,天翼云推出了息壤一体化智算服务平台,而“天翼云息壤算力调度”正是这套平台最核心的能力之一。它通过算力插件、算力网关、算数协同等关键技术,把分散的异构算力汇聚成一张可以统一调度、并网交易的智能网络,实现跨服务商、跨架构、跨地域算力资源的统一管理与高效利用,让智算服务真正“供得上、用得起、用得好”。本文将从行业背景、技术原理、核心能力与落地价值四个维度,系统科普天翼云息壤算力调度到底是什么、解决了什么问题,以及它如何把高端算力变成普惠的基础设施。
    思念如故
    2026-08-20
    0
    0
  • 过去,企业要用算力,往往得先买服务器、建机房,前期投入大、周期长,而且一旦业务波动,闲置资源就成了沉没成本。进入云计算时代,一种更轻量的用算方式逐渐普及——按需付费算力。它的核心理念很简单:用多少、付多少,不用就停。天翼云依托弹性云主机与GPU云主机体系,结合云网融合资源布局,把算力做成可随取随停、费用透明的弹性服务,让企业以轻资产方式应对多变的业务负载。
    思念如故
    2026-08-20
    1
    0
  • 在决定为业务配置加密凭证时,许多团队会陷入两难——究竟该优先考虑能保护多少个域名,还是优先考虑核验的深度。这个问题没有放之四海皆准的答案,因为两者服务的是不同的目标。本文从实际运维视角出发,把这两个维度拆开讲清楚,帮助开发者在规划阶段就做出更合适的判断,少走回头路。
    c****i
    2026-08-20
    0
    0
  • 当AI技术进入规模化应用阶段,模型推理服务平台作为连接AI模型与实际业务的"最后一公里"关键载体,其性能、稳定性与适配性,直接决定产业智能化转型的效率。市场对推理服务的需求,也已经从"有没有"转向"好不好"——企业普遍关心推理延迟高不高、算力成本控得住控不住、多场景适配复不复杂、数据安全保不保得住。天翼云息壤一体化智算服务平台深耕模型推理领域,以全栈优化的推理能力,成为行业认可的高效模型推理服务平台。
    思念如故
    2026-08-20
    0
    0
  • DPU这个词最近几年在技术圈里频繁出现,但不少人对它的理解还停留在"一种高级网卡"的阶段。实际上,DPU解决的问题远不止网络通信,它涉及到数据中心里计算资源分配、性能瓶颈突破、安全隔离等多个层面。紫金DPU作为天翼云基础设施体系中的一员,承担着非常重要的角色。这篇文章尝试用尽量通俗的语言,把紫金DPU到底解决什么问题讲清楚,不堆砌术语,不做概念空转,从实际问题出发。
    思念如故
    2026-08-18
    0
    0
  • 网络延迟是很多业务最关心的性能指标。从用户点击一个按钮到服务器返回结果,中间每一毫秒的延迟都可能影响用户体验和业务转化率。DPU在网络延迟优化上的表现,是评估其实际价值的重要维度。这篇文章通过一组对比测试,量化紫金DPU对服务器网络延迟的影响,看看在不同场景下延迟到底降了多少,以及为什么有些场景降得多、有些降得少。
    思念如故
    2026-08-18
    2
    0
  • 云环境下的安全隔离,核心问题是多租户之间的数据和流量隔离。传统方案依靠虚拟化软件实现网络隔离,但软件方案有一个根本性的弱点:它运行在宿主机上,如果宿主机操作系统被攻破,软件隔离可以被绕过或篡改。DPU提供了另一种可能性——将安全隔离下沉到硬件层面。紫金DPU在这方面的能力到底靠谱不靠谱?这篇文章从安全威胁模型出发,分析紫金DPU的安全隔离机制和它的实际防护能力。
    思念如故
    2026-08-18
    1
    0
  • 天翼云作为运营商背景的云服务商,在基础设施层面有着自己的技术路线和产品规划。紫金DPU作为天翼云基础设施体系中的关键组件,对云平台的底层性能产生了系统性的影响。这种影响不是某个单一指标的提升,而是从网络、存储、安全到整体资源利用率的全方位改善。这篇文章从天翼云平台架构的角度,分析紫金DPU引入后底层性能发生了哪些变化。
    思念如故
    2026-08-18
    1
    0
  • 科研算力平台上最让管理员头疼的问题,不是硬件故障,不是网络延迟,而是环境冲突。一个课题组用PyTorch 1.13跑通了实验,另一个课题组用PyTorch 2.0也跑通了实验,但当两个课题组的代码需要在同一台机器上运行时,CUDA版本冲突、cuDNN版本不兼容、Python包依赖打架,环境变得一团糟。更麻烦的是,一个研究生的实验环境配置了三个月,毕业离校后没人知道他当时装了哪些包、改了哪些配置,他的实验再也无法复现。环境模块化与依赖管理要解决的就是这个问题:把环境拆分成独立的模块,每个模块有清晰的版本和依赖关系,用户可以快速组装出自己需要的环境,也可以完整地保存和复现他人的环境。下文从环境模块化的设计原则、模块仓库建设、依赖解析与冲突解决、环境快照与复现、用户交互设计、运维与治理六个层次展开。
    c****i
    2026-08-18
    1
    0
  • 在大模型应用从训练走向实际部署之后,工程师面对的一个现实问题是:当模型权重迭代了一个新版本,推上线的时候到底要不要把整个推理服务停掉再启动?如果每次权重更新都要中断服务,在线推理的用户就会感受到明显的延迟和断连。这个问题的核心,就是推理服务是否支持模型热更新——即在不中断请求处理的前提下,完成新权重的替换。本文围绕这个话题展开,从热更新的基本原理、替换流程、在途请求处理、回退机制、资源管理以及实际注意事项等几个方面逐一梳理。
  • 算网融合是近年来算力基础设施建设的一个重要方向。传统意义上的算力调度,主要看计算资源本身——哪台机器空闲、显存够不够、算力够不够用;而算网融合把网络状态也纳入了调度的视野,节点选择不再只看算力,还要看网络路径的时延、带宽余量和稳定性。当集群中的候选节点有多个时,问题就来了:怎么选出更合适的那个节点?延迟、成本、空闲度三个维度往往互相冲突——延迟低的节点可能费用高,空闲的节点可能网络差,费用低的节点可能排队久。本文围绕节点选择这个话题,从三个维度的含义、冲突关系以及权衡方法展开梳理。
  • 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。
  • 短剧和动漫类内容的创作,和传统影视剪辑有一个明显不同:观众对时长的容忍度很低。一段拖沓的对话、一个过长的转场、一段节奏不对的情节推进,都可能让用户直接划走。时长节奏因此成了这类创作里最需要打磨的环节。全链路的AI创作系统把自动剪辑和手动微调组合在一起,试图在效率与质量之间找到落点。自动剪辑负责把海量素材快速组织成符合目标时长的粗剪版本,手动微调负责在关键节点上精修细调,两者配合得当,成片的节奏才能既紧凑又自然。本文围绕这套配合方式展开,从自动剪辑的逻辑、手动微调的价值到两者的协作流程,逐一梳理。
  • 弹性伸缩GPU算力服务的核心能力,是让AI工作负载根据实际需求动态调整资源。但“弹性”这个词在实际工程中涵盖了多个层级,从单张GPU卡内部的计算切片,到整机节点,再到跨节点的分布式集群。不同层级对应不同的隔离语义、调度开销和适用场景。理解这些粒度差异,是设计高利用率、高稳定性AI基础设施的前提。本文从细到粗梳理五种主流伸缩粒度,并分析各自的取舍。
  • 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。
  • 近年来,"算力即国力"成为产业共识,而算力底座是否自主可控,直接关系到数字经济的安全与韧性。在外部不确定性增加的背景下,构建国产AI算力平台、摆脱单一技术依赖,已从"可选项"变为"必答题"。天翼云息壤一体化智算服务平台,以全栈自主可控为基调,融合国产算力芯片与自研智算技术,为千行百业提供安全可信的智能计算基座,让AI能力在自主技术链路上稳定运行。
  • 我国算力资源分布广、归属杂,有的在东部、有的在西部,有的属于不同服务商、跑在不同架构上。这种"碎片化"导致一个尴尬局面:一边是大量算力闲置,另一边是急需算力的单位一卡难求。破解之道,是把分散的算力连起来、调度起来、交易起来。天翼云算力互联调度平台,通过算力插件、算力网关与算数协同等关键技术,实现跨服务商、跨架构、跨地域的统一调度与并网交易,让泛在算力真正连成"一张网"。
  • 企业要真正用上大模型,往往既要"训得出来",又要"推得起来"——训练解决模型从哪来,推理解决模型怎么用。这两件事如果交给不同供应商、用不同技术栈,就会出现数据割裂、工具不通、运维翻倍。大模型训推服务提供商因此应运而生:它把训练、微调、评估、推理部署整合为一套连贯的服务体系。天翼云以息壤智算平台、云骁高性能计算与慧泽大模型服务平台为核心,构建起贯通"训"与"推"的全栈能力,成为值得信赖的训推服务底座。
  • 过去,企业要用AI,往往要在算力、平台、数据、模型、应用五个层面分别找供应商,自己当"总集成商",结果接口对不上、数据搬不动、运维顾不过来。一体化智算服务平台的出现,正是为了解决这种"拼积木"的混乱。天翼云息壤一体化智算服务平台,以统一品牌与产品能力,把基础设施、平台、数据、模型、应用整合为贯通"算、训、推、用"的全栈基座,让智算成为普惠的AI基础设施。
  • 训练出一个好模型,只是AI落地的起点;真正产生价值,要靠应用把它嵌入业务流程。然而,很多团队卡在"最后一步":模型有了,应用却搭不起来——缺开发框架、缺运维能力、缺现成工具。大模型应用服务平台正是为解决这一断层而生:它把模型能力、应用托管与工具市场整合到一起,让开发者像搭积木一样快速构建并上线AI应用。天翼云息壤一体化智算服务平台的应用层能力,正是这样一座连接模型与业务的桥梁。
  • 算力是AI时代的"电力",但电力之所以好用,是因为有一张智能电网在背后调度——哪里需要就送到哪里,哪里闲置就先存着。算力也一样。如果只建算力、不调度,就会出现"东部挤、西部闲""这家满、那家空"的错配。算力调度平台就是算力的"智能电网大脑",负责把分散、异构、跨域的算力资源统一管理、智能匹配、高效流转。天翼云息壤算力调度平台,以异构资源池化与智能调度引擎为核心,让泛在算力真正"供得上、用得起、用得好"。
  • 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
  • 当我们说"用了一次大模型",背后其实消耗的是一定数量的Token——它是衡量模型推理输入与输出消耗的基本计量单位。过去,调用大模型往往要按资源包或时长计费,不够直观;而现在,以Token为计量单位、按实际消耗结算的服务模式,正成为AI时代更精细、更透明的用算方式。天翼云息壤Token服务,依托星辰TokenHub运营服务平台,面向企业与开发者提供以Token为核心的大模型调用与计量能力,让模型使用变得可度量、可管理、可规划。
  • 大模型推理服务的普及,带来一个现实问题:怎么衡量"用了多少"?不同于传统按台数或按时长计费的粗放方式,以Token为计量单位的推理服务,把消耗精确到每一次输入与输出,让成本与价值直接对应。大模型Token推理服务,正是把推理能力与Token计量结合在一起的弹性服务形态。天翼云息壤模型推理服务结合Token计量,为开发者和企业提供可按实际消耗结算的推理能力,让模型调用既灵活又透明。
  • 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。
  • 租用GPU跑深度学习训练时,数据离开本地服务器的那一刻,安全焦虑就开始了。训练数据可能包含用户隐私、商业机密、未公开的模型参数,这些东西被传送到远程机房后,会不会被算力提供商留存?会不会被其他租户意外访问?训练结束后数据有没有被彻底清除?这些问题不是简单的信任或不信任能回答的,而是需要从数据生命周期、隔离机制、加密策略、残留防护、审计追溯五个维度去拆解。下文从数据传输与存储加密、租户隔离机制、训练过程中的数据暴露面、训练结束后的数据清除、审计与日志管控、选型时的安全核查清单六个层次展开。
  • 实验室里最让研究人员头疼的场景之一,是仪器采集了数据,但数据被困在仪器里出不来。一台光谱仪每天产生几百个测量文件,格式是仪器厂商自定义的二进制格式;一台PCR仪每次实验输出一个Excel文件,但列名和单位与上一次实验不完全一致;一台电子显微镜的图像存储在专用工作站上,要拷贝到分析服务器需要经过U盘搬运。科研软件要与这些五花八门的仪器数据采集系统对接,本质上是在解决三个问题:数据怎么从仪器那边取出来、取出来后怎么转换成可分析的格式、转换过程中怎么保证数据不失真不丢失。下文从仪器数据接口的类型、数据格式的解析与转换、实时采集与批量采集、元数据的捕获与保留、对接方案的架构设计、常见问题与应对策略六个层次展开。
  • SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。
  • 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。
  • 企业官网要不要上HTTPS已经不是问题,选哪种类型的SSL证书才是真正的决策点。DV、OV、EV三类证书在底层加密强度上完全一致,都基于公钥基础设施和TLS协议工作,浏览器地址栏的小锁图标也都会亮起,差异不在“加密了没有”,而在“证书背后那个主体被验证到了什么程度”。对于大多数企业官网而言,选DV会觉得信任背书不够,选EV又觉得审核成本和年费偏高,OV往往是在信任度和预算之间最不容易后悔的那一个。下文从三类证书的验证差异、信任度的真实含义、成本结构的对比、企业官网的场景匹配、子域与通配符的叠加考量、证书有效期缩短下的运维账六个层次展开。
  • 在人工智能大模型训练与推理需求快速增长的今天,算力正在成为一种像水电一样的基础生产要素。然而现实中,算力资源往往分散在不同地域、不同架构、不同主体之间,彼此难以互通,出现了“供需错配、使用门槛高”的结构性难题。正是在这样的背景下,天翼云推出了息壤一体化智算服务平台,而“天翼云息壤算力调度”正是这套平台最核心的能力之一。它通过算力插件、算力网关、算数协同等关键技术,把分散的异构算力汇聚成一张可以统一调度、并网交易的智能网络,实现跨服务商、跨架构、跨地域算力资源的统一管理与高效利用,让智算服务真正“供得上、用得起、用得好”。本文将从行业背景、技术原理、核心能力与落地价值四个维度,系统科普天翼云息壤算力调度到底是什么、解决了什么问题,以及它如何把高端算力变成普惠的基础设施。
  • 过去,企业要用算力,往往得先买服务器、建机房,前期投入大、周期长,而且一旦业务波动,闲置资源就成了沉没成本。进入云计算时代,一种更轻量的用算方式逐渐普及——按需付费算力。它的核心理念很简单:用多少、付多少,不用就停。天翼云依托弹性云主机与GPU云主机体系,结合云网融合资源布局,把算力做成可随取随停、费用透明的弹性服务,让企业以轻资产方式应对多变的业务负载。
  • 在决定为业务配置加密凭证时,许多团队会陷入两难——究竟该优先考虑能保护多少个域名,还是优先考虑核验的深度。这个问题没有放之四海皆准的答案,因为两者服务的是不同的目标。本文从实际运维视角出发,把这两个维度拆开讲清楚,帮助开发者在规划阶段就做出更合适的判断,少走回头路。
  • 当AI技术进入规模化应用阶段,模型推理服务平台作为连接AI模型与实际业务的"最后一公里"关键载体,其性能、稳定性与适配性,直接决定产业智能化转型的效率。市场对推理服务的需求,也已经从"有没有"转向"好不好"——企业普遍关心推理延迟高不高、算力成本控得住控不住、多场景适配复不复杂、数据安全保不保得住。天翼云息壤一体化智算服务平台深耕模型推理领域,以全栈优化的推理能力,成为行业认可的高效模型推理服务平台。
  • DPU这个词最近几年在技术圈里频繁出现,但不少人对它的理解还停留在"一种高级网卡"的阶段。实际上,DPU解决的问题远不止网络通信,它涉及到数据中心里计算资源分配、性能瓶颈突破、安全隔离等多个层面。紫金DPU作为天翼云基础设施体系中的一员,承担着非常重要的角色。这篇文章尝试用尽量通俗的语言,把紫金DPU到底解决什么问题讲清楚,不堆砌术语,不做概念空转,从实际问题出发。
  • 网络延迟是很多业务最关心的性能指标。从用户点击一个按钮到服务器返回结果,中间每一毫秒的延迟都可能影响用户体验和业务转化率。DPU在网络延迟优化上的表现,是评估其实际价值的重要维度。这篇文章通过一组对比测试,量化紫金DPU对服务器网络延迟的影响,看看在不同场景下延迟到底降了多少,以及为什么有些场景降得多、有些降得少。
  • 云环境下的安全隔离,核心问题是多租户之间的数据和流量隔离。传统方案依靠虚拟化软件实现网络隔离,但软件方案有一个根本性的弱点:它运行在宿主机上,如果宿主机操作系统被攻破,软件隔离可以被绕过或篡改。DPU提供了另一种可能性——将安全隔离下沉到硬件层面。紫金DPU在这方面的能力到底靠谱不靠谱?这篇文章从安全威胁模型出发,分析紫金DPU的安全隔离机制和它的实际防护能力。
  • 天翼云作为运营商背景的云服务商,在基础设施层面有着自己的技术路线和产品规划。紫金DPU作为天翼云基础设施体系中的关键组件,对云平台的底层性能产生了系统性的影响。这种影响不是某个单一指标的提升,而是从网络、存储、安全到整体资源利用率的全方位改善。这篇文章从天翼云平台架构的角度,分析紫金DPU引入后底层性能发生了哪些变化。
  • 科研算力平台上最让管理员头疼的问题,不是硬件故障,不是网络延迟,而是环境冲突。一个课题组用PyTorch 1.13跑通了实验,另一个课题组用PyTorch 2.0也跑通了实验,但当两个课题组的代码需要在同一台机器上运行时,CUDA版本冲突、cuDNN版本不兼容、Python包依赖打架,环境变得一团糟。更麻烦的是,一个研究生的实验环境配置了三个月,毕业离校后没人知道他当时装了哪些包、改了哪些配置,他的实验再也无法复现。环境模块化与依赖管理要解决的就是这个问题:把环境拆分成独立的模块,每个模块有清晰的版本和依赖关系,用户可以快速组装出自己需要的环境,也可以完整地保存和复现他人的环境。下文从环境模块化的设计原则、模块仓库建设、依赖解析与冲突解决、环境快照与复现、用户交互设计、运维与治理六个层次展开。
  • 点击加载更多