searchusermenu
  • 发布文章
  • 消息中心
#全站加速
关注该标签
专栏文章 95
视频 6
问答 0
  • 把一套在进口加速卡上跑得好好的深度学习模型搬到国产芯片上,最核心的工程问题不是模型架构改了,而是算子不认。进口卡上的CUDA生态积累了十几年,卷积、归一化、注意力、矩阵乘这些算子经过无数次优化,调用起来像呼吸一样自然。换成国产芯片后,指令集不同、运行时库不同、算子库的覆盖范围和优化深度不同,原来一行torch.nn.functional.conv2d背后隐含的cuDNN加速路径,在新的芯片上可能要走一条未经优化的软件模拟路径,速度慢十倍甚至跑不出正确结果。算子适配迁移要做的就是让模型在国产芯片上也能找到高效的执行路径,让开发工程师写一次代码就能在多种芯片上运行。下文从算子映射、算子开发、精度对齐、性能调优、自动化工具、生态共建六个层次展开。
    c****i
    2026-08-12
    0
    0
  • 把一张纸质单据、一张截图、一张拍歪了的发票变成系统里可以参与计算的数字,中间那道桥就是通用OCR接口。天翼云通用型印刷文字识别在官网的定位是检测图片中的文字,返回文字内容及其在图片中的位置信息,它不承诺看懂表格结构,也不处理手写体,但对印刷体中英文混合、数字、金额、编号这类场景足够好用。开发工程师接入时真正的工程量不在发一个请求这件动作本身,而在鉴权签名、图片约束、返回结构解析、以及把识别出的各种格式的文本安全转成程序里的数值类型这一长串后处理里。下文从服务开通与鉴权、请求构造与图片约束、响应结构与位置信息、文本转数字的后处理、异常处理与重试、排障视角六个层次展开。
    c****i
    2026-08-07
    4
    0
  • 桌面云传输的体验天花板,往往不是云端虚拟机的算力,也不是终端的解码能力,而是横在两端之间那条会抖动、会丢包、会突然收窄的网线。天翼云电脑自研的CLINK协议之所以在弱网场景里比传统远程桌面协议更“跟手”,关键不在于它把单帧画质压得有多狠,而在于它把动态码率、帧率档位、内容语义感知和输入预测拧成了一条带滞回的实时闭环。作为开发工程师在对接或自研类似桌面协议时,理解CLINK这套感知—决策—调整的调优逻辑,比背参数表更有用。下文从协议定位、码率闭环、帧率档位、语义编码、弱网兜底、端云协同、输入预测与调参观测八个层次拆开讲。
    c****i
    2026-07-30
    2
    0
  • 桌面云的每一帧画面,从应用程序绘制到最终编码输出,背后都依赖GPU的参与。当多个用户的虚拟桌面共享同一块物理GPU时,渲染任务的排队、抢占和优先级管理就成了决定帧率稳定性的关键因素。如果GPU调度做得粗糙,一个用户的全屏三维应用可能让同机柜里其他用户的文档滚动都变得卡顿。天翼云电脑在GPU资源管理上采用了渲染分流与精细化调度相结合的策略,试图在硬件利用率与单用户体验之间找到更好的平衡点。下文从渲染路径拆分、分流策略、调度模型、优先级管理、弹性扩缩和效果观测六个层次展开。
    c****i
    2026-07-30
    8
    0
  • 在 bookinfo 这条四服务调用链里,遥测数据收集和路由策略看似是两件事:前者关心发生了什么,后者关心接下来去哪。但在服务网格的架构下,它们共用同一个执行点——Sidecar 代理。每一次被劫持进代理的请求,既在出入的瞬间被统计成指标、被采样成调用链、被打印成访问日志,又在同一份配置里被匹配到某条路由规则、被改写请求头、被加权分流、被重试或超时截断。天翼云应用服务网格控制面与数据面同构于业界主流体系,跑 bookinfo 时这套机制不需要业务代码配合,所有动作发生在 Pod 网络命名空间之内。下文从遥测采集点、指标维度、追踪与日志、路由原语、策略协同、排障视角六个层次展开。
    c****i
    2026-07-30
    1
    0
  • 在传统数据架构里,事务库和分析库是两套系统,中间靠抽取同步任务桥接,数据从产生到能被报表看到往往隔着数小时甚至一天。这种链路在实时风控、动态大屏、即时推荐场景里会直接失效——业务要的是事务提交的瞬间,分析侧就能算出结果。天翼云分布式融合数据库走的是HTAP路线,核心把行存和列存放在同一份数据的两个物理视图里,借助实时同步协议把行存变更灌给列存,再让一条SQL在解析后按特征选路执行。理解这条实时查询链路,比背参数更重要,因为它决定了实时二字是不是真实时。下文从写入落盘、行列同步、SQL解析选路、执行下推、一致性快照、链路观测六个层次展开。
    c****i
    2026-07-30
    2
    0
  • 负载均衡的选型最终要落到两个字上——用谁。四层和七层的技术差异可以写成长篇论文,但开发工程师在做架构决策时,最关心的往往是:我要配多少东西才能让它跑起来?出了问题好不好查?以后加新功能要不要改架构?配置复杂度和适用场景是绑在一起的——七层功能多,配置自然复杂;四层功能少,配置自然简单。但这并不意味着简单就是好,复杂就是坏。关键在于你的业务场景需要多少功能,以及你愿意为这些功能付出多少运维成本。下文从四层配置的简洁性、七层配置的丰富性、典型场景对照、运维排障难度、团队能力要求、架构演进路径六个层次展开。
    c****i
    2026-07-30
    3
    0
  • 在互联网安全通信的基础设施中,SSL/TLS证书的兼容性是一个容易被忽视却在关键时刻引发严重问题的重要因素。当用户部署了一款免费SSL证书后,绝大多数现代浏览器和操作系统能够正常识别并建立安全连接,但在某些特定的客户端环境——老旧的操作系统、嵌入式设备、定制化浏览器或企业内部网络——证书链的验证可能失败,导致用户看到“连接不安全”的警告页面。这种兼容性问题的根源往往不在于证书本身的加密强度或域名验证方式,而在于根证书的信任链传递。免费SSL证书的签发机构通常使用中间证书来签署终端证书,而中间证书又由根证书签发。如果客户端的根证书存储中没有包含签发机构的根证书,或者根证书的信任链存在断裂,证书验证就会失败。息壤平台在SSL证书服务的运营过程中,围绕免费SSL证书的根证书兼容性进行了系统性的排查与研究,本文将阐述其核心发现与工程实践。
    c****i
    2026-07-24
    3
    0
  • 在DV级别SSL证书的申请过程中,HTTP文件验证是最常用也最容易出问题的验证方式之一。它的原理并不复杂:证书颁发机构要求你在域名对应的Web服务器上放置一个特定内容的验证文件,然后通过HTTP协议访问这个文件来确认你对域名的控制权。然而,就是这个看似简单的“放个文件”操作,在实际部署中却因为目录权限配置不当导致验证失败的案例比比皆是。Web服务器的运行用户是谁、验证目录是否存在、目录的读写权限是否设置正确、SELinux或AppArmor是否在干扰访问——任何一个环节出错,证书机构就无法读取到验证文件,签发流程就会卡住。息壤平台在处理大量DV证书申请的过程中,围绕HTTP文件验证的目录权限配置积累了系统的工程经验,下文将详细阐述其中的关键要点。
    c****i
    2026-07-24
    1
    0
  • 对于初次接触智算平台的人来说,从零开始跑通第一个模型往往是最大的门槛。平台界面怎么操作、环境怎么配置、数据怎么上传、训练怎么启动、结果怎么看——每一个环节都可能成为绊脚石。本文将以一个完整的模型训练流程为主线,记录在息壤智算平台上从零开始跑通第一个模型的全部过程,帮助新用户快速上手。
    思念如故
    2026-07-23
    2
    0
  • 在拥有多个研发团队的组织中,算力资源的分配和管理是一个普遍存在的难题。不同团队的项目周期不同、算力需求不同、优先级不同,如何在有限算力资源下满足各方需求,同时保证资源的高效利用,是一个复杂的管理问题。传统的人工协调方式效率低下且容易引发矛盾。息壤智算通过系统化的算力管理和调度机制,为这个难题提供了一套技术解决方案。
    思念如故
    2026-07-23
    0
    0
  • 在科研算力平台的日常使用中,环境部署的成功率与一致性是影响用户体验的关键因素。一个科研环境从镜像拉取、容器启动到依赖加载、驱动匹配,中间涉及数十个环节,任何一个环节出现问题都可能导致环境启动失败或运行时行为异常。更棘手的是,许多环境问题具有偶发性——同样的镜像在某个节点上运行正常,在另一个节点上却因为驱动版本差异或内核参数不同而崩溃。如果依赖用户手动排查这些问题,不仅耗费大量时间,而且要求用户具备深厚的系统知识,这与科研平台降低使用门槛的初衷背道而驰。息壤平台在一键部署科研环境的基础上,构建了配套的健康检查与环境验证脚本体系,本文将阐述其设计思路与工程实现。
    c****i
    2026-07-23
    0
    0
  • 在企业微服务架构的演进过程中,很多团队都会逐步陷入“服务数量爆炸”的困境:原本为了解耦业务拆分出的十几个微服务,没过多久就增长到数十个,不同服务运行在不同的集群节点上,对外暴露的接口地址分散在各处,客户端要对接所有服务,就得维护十几套不同的调用配置,不仅接入流程极其繁琐,安全管控更是无从下手。更棘手的是,没有统一入口的情况下,各个微服务各自实现权限校验,逻辑重复且标准不统一,部分服务甚至直接裸奔在内网中,一旦某个业务接口出现漏洞,整个内部系统的核心数据都面临泄露风险;同时,业务高峰期突发的流量洪峰直接冲击后端微服务,很容易拖垮整个集群,而团队却没有一个统一的入口可以快速配置限流规则,只能事后紧急扩容,付出极高的资源成本。天翼云API网关的出现,正是为了解决这些分布式架构下的共性痛点:它作为所有内部微服务的统一流量入口,把分散的后端服务接口全部收拢到一个中心化的平台中,通过可视化的配置能力,一站式完成接口封装、权限管控、流量防护等核心能力,让企业不用在每个微服务中重复开发通用的网关逻辑,就能快速搭建起一套规范、安全、高可靠的内部服务开放体系。本文将从企业内部微服务封装的实际场景出发,系统
    思念如故
    2026-07-21
    4
    0
  • "上云能省钱"——这句话几乎每个企业在上云前都听过。但当账单真正摆在面前时,不少企业发现,实际花费和预期之间存在着不小的差距。上云到底花了多少钱?这笔钱花在了哪里?有没有花冤枉钱?这些问题值得每一家企业认真梳理。
    思念如故
    2026-07-21
    21
    0
  • 大模型热潮席卷全球,算力成了最炙手可热的资源。但在这场算力军备竞赛中,中小企业似乎总是处于弱势地位。头部企业动辄投入数亿元采购GPU集群,而中小企业连租几张高端显卡都要排队等货。算力焦虑,正在成为制约中小企业AI发展的核心瓶颈。
    思念如故
    2026-07-21
    16
    0
  • 信创(信息技术应用创新)替代,是近年来企业IT领域最受关注的话题之一。从操作系统、数据库到中间件、办公软件,国产化替代的浪潮正在席卷各个行业。但真正做过信创替代项目的人都知道,这不是简单地把国外产品换成国产产品就完事了——它涉及到应用适配、性能验证、生态完善、人员培训等一系列复杂工作。
    思念如故
    2026-07-21
    16
    0
  • 企业从传统物理机房迁移到云端,看似只是换了一个运行环境,实际上涉及应用架构、网络规划、数据安全、运维体系等多个维度的变革。很多企业在迁移过程中,都经历过"踩坑"的痛苦。以下五个最常见的坑,几乎每个上云项目都会遇到至少一个。
    思念如故
    2026-07-21
    4
    0
  • 大模型的崛起,正在深刻改变云计算的基础设施形态。从算力架构到存储系统,从网络互联到调度平台,几乎所有底层基础设施都在经历一场为AI而生的重构。这场变革的影响范围之广、程度之深,可能是云计算诞生以来最大的一次。
    思念如故
    2026-07-21
    11
    0
  • 在"双碳"目标的大背景下,绿色低碳已经成为数据中心行业的关键词。但如果你以为绿色数据中心只是一个环保口号,那就大错特错了。对于数据中心运营者来说,绿色意味着实实在在的成本节约和竞争力提升。能效每提升一个百分点,每年节省的电费可能高达数百万元。绿色计算,背后是真金白银。
    思念如故
    2026-07-21
    7
    0
  • 如果把时针拨回十年前,企业IT的技术栈与今天截然不同。物理服务器摆在机房机柜里,操作系统直接安装在裸机上,应用以单体架构打包成war包部署到应用服务器中,数据库运行在专用存储上,运维人员24小时待命应对突发故障。十年后的今天,容器编排、微服务、服务网格、可观测性、平台工程等概念已经成为技术栈的标准配置。这十年,技术栈经历了什么?
    思念如故
    2026-07-21
    10
    0
  • 数字化转型是近年来所有企业都在谈的话题,而"上云"几乎被等同于数字化转型本身。似乎只要把业务搬到云上,数字化转型就算完成了。但越来越多的实践表明,上云不等于数字化转型,甚至如果上云的方式不对,不仅不能推动转型,反而可能拖累业务。在急着上云之前,有些问题值得认真思考。
    思念如故
    2026-07-21
    5
    0
  • 云计算行业从来不缺新闻。每隔几个月就有新技术发布、新产品上线、新趋势涌现。但如果把视野拉长到一整年,哪些事情真正值得关注?以下盘点云计算圈这一年最值得关注的十件事,它们或代表了技术演进的方向,或预示着行业格局的变化,或影响着每一家企业的云上实践。
    思念如故
    2026-07-21
    4
    0
  • 很多团队在大模型训练初期都经历过这样一个阶段:到云平台上租几台GPU服务器,手动配置环境,然后开始训练。这种模式简单直接,但随着训练规模和频率的增加,问题逐渐暴露——成本高、效率低、管理混乱。从租GPU转向使用智算平台,本质上是从"手动挡"升级到"自动挡"的过程。这个升级到底能带来多少成本节省,值得仔细算一笔账。
    思念如故
    2026-07-21
    2
    0
  • 弹性算力是云计算的核心承诺之一。当流量突增时,系统能够快速扩容以应对压力;当流量回落时,又能自动缩容以节省成本。这个承诺在Web应用场景中已经被广泛验证,但在AI训练和推理场景中,弹性算力的挑战要大得多。GPU资源的弹性伸缩不像CPU实例那样简单——GPU的调度、数据迁移、任务恢复都更为复杂。息壤智算在弹性算力方面的表现如何,能否真正扛住突发流量,需要从技术机制到实际效果进行深入分析。
    思念如故
    2026-07-21
    2
    0
  • 在智算概念火热的当下,有一种误解颇为流行:智算不就是多买些GPU堆在一起吗?这种看法忽略了智算平台在架构设计、资源调度、网络通信、存储系统等多个层面的复杂性。如果把智算比作一座工厂,GPU只是流水线上的机器,而真正让工厂高效运转的是整个生产体系。本文将从多个维度解释为什么智算远不只是GPU的简单堆叠。
    思念如故
    2026-07-21
    3
    0
  • 多租户隔离是智算平台安全的核心。多个用户或团队共享同一套算力基础设施时,如何确保各自的算力资源不被侵占、数据不被泄露、训练任务不被干扰,是多租户隔离要解决的核心问题。息壤智算在多租户隔离方面采取了哪些技术措施,实际效果如何,本文将从技术原理到实际测试进行深入分析。
    思念如故
    2026-07-21
    1
    0
  • 大模型训练不是一个简单的"点一下开始"的过程,而是包含数据准备、环境配置、任务提交、训练执行、监控调优和结果输出等多个环节的完整流程。每个环节的效率和质量都会影响最终的训练效果。本文将以一个完整的模型训练流程为主线,详细拆解在息壤智算平台上从模型准备到训练完成的全过程。
    思念如故
    2026-07-21
    4
    0
  • 云网融合是天翼云的核心战略之一,也是其区别于其他云服务商的重要特征。当云网融合与智算相结合,会产生怎样的化学反应?对于AI训练和推理来说,云网融合意味着什么?本文将从多个角度分析息壤智算与天翼云云网融合带来的独特价值。
    思念如故
    2026-07-21
    3
    0
  • 微服务架构让应用迭代更灵活,却也让发布变得更危险。一次全量上线如果出了问题,影响的不是一个模块,而是整条调用链。传统的停机发布早已被淘汰,蓝绿部署虽然稳妥,但双倍资源成本让中小企业望而却步。真正被大规模验证、兼顾效率与稳定性的方案,是灰度发布——而天翼云容器服务CTK搭配应用服务网格ASM,恰恰为这一方案提供了最优雅的落地土壤。CTK作为基于Kubernetes构建的Serverless容器产品,继承了Kubernetes声明式编排的全部能力,又抹平了集群管理的沉重门槛。ASM则在此基础上,通过Envoy Sidecar代理将熔断、降级、流量治理等能力下沉到基础设施层,让开发者从繁琐的服务治理中解放出来。本文将从ASM灰度发布的完整配置流程,到熔断降级策略的精细化调优,为你拆解一套可直接落地的实战方案。
    思念如故
    2026-07-08
    4
    0
  • 在云原生架构中,ETCD是当之无愧的"定海神针"。它承载着集群状态、配置数据、服务发现等核心信息,一旦ETCD集群不可用,整个Kubernetes控制面将瞬间瘫痪。然而,ETCD的高可用不是"装三个节点就完事"那么简单——节点数量怎么选、心跳参数怎么调、快照策略怎么定,每一个决策都直接决定了集群在故障面前的生存能力。天翼云提供的托管式ETCD服务,在底层已经做了大量高可用优化,但作为开发者,你仍然需要理解这些机制的运作原理,才能在架构设计和运维排障中游刃有余。本文将从节点规模规划、心跳与选举机制、快照备份策略三个核心维度,为你拆解一套可落地的ETCD高可用部署方案。
    思念如故
    2026-07-08
    17
    0
  • 把一套在进口加速卡上跑得好好的深度学习模型搬到国产芯片上,最核心的工程问题不是模型架构改了,而是算子不认。进口卡上的CUDA生态积累了十几年,卷积、归一化、注意力、矩阵乘这些算子经过无数次优化,调用起来像呼吸一样自然。换成国产芯片后,指令集不同、运行时库不同、算子库的覆盖范围和优化深度不同,原来一行torch.nn.functional.conv2d背后隐含的cuDNN加速路径,在新的芯片上可能要走一条未经优化的软件模拟路径,速度慢十倍甚至跑不出正确结果。算子适配迁移要做的就是让模型在国产芯片上也能找到高效的执行路径,让开发工程师写一次代码就能在多种芯片上运行。下文从算子映射、算子开发、精度对齐、性能调优、自动化工具、生态共建六个层次展开。
  • 把一张纸质单据、一张截图、一张拍歪了的发票变成系统里可以参与计算的数字,中间那道桥就是通用OCR接口。天翼云通用型印刷文字识别在官网的定位是检测图片中的文字,返回文字内容及其在图片中的位置信息,它不承诺看懂表格结构,也不处理手写体,但对印刷体中英文混合、数字、金额、编号这类场景足够好用。开发工程师接入时真正的工程量不在发一个请求这件动作本身,而在鉴权签名、图片约束、返回结构解析、以及把识别出的各种格式的文本安全转成程序里的数值类型这一长串后处理里。下文从服务开通与鉴权、请求构造与图片约束、响应结构与位置信息、文本转数字的后处理、异常处理与重试、排障视角六个层次展开。
  • 桌面云传输的体验天花板,往往不是云端虚拟机的算力,也不是终端的解码能力,而是横在两端之间那条会抖动、会丢包、会突然收窄的网线。天翼云电脑自研的CLINK协议之所以在弱网场景里比传统远程桌面协议更“跟手”,关键不在于它把单帧画质压得有多狠,而在于它把动态码率、帧率档位、内容语义感知和输入预测拧成了一条带滞回的实时闭环。作为开发工程师在对接或自研类似桌面协议时,理解CLINK这套感知—决策—调整的调优逻辑,比背参数表更有用。下文从协议定位、码率闭环、帧率档位、语义编码、弱网兜底、端云协同、输入预测与调参观测八个层次拆开讲。
  • 桌面云的每一帧画面,从应用程序绘制到最终编码输出,背后都依赖GPU的参与。当多个用户的虚拟桌面共享同一块物理GPU时,渲染任务的排队、抢占和优先级管理就成了决定帧率稳定性的关键因素。如果GPU调度做得粗糙,一个用户的全屏三维应用可能让同机柜里其他用户的文档滚动都变得卡顿。天翼云电脑在GPU资源管理上采用了渲染分流与精细化调度相结合的策略,试图在硬件利用率与单用户体验之间找到更好的平衡点。下文从渲染路径拆分、分流策略、调度模型、优先级管理、弹性扩缩和效果观测六个层次展开。
  • 在 bookinfo 这条四服务调用链里,遥测数据收集和路由策略看似是两件事:前者关心发生了什么,后者关心接下来去哪。但在服务网格的架构下,它们共用同一个执行点——Sidecar 代理。每一次被劫持进代理的请求,既在出入的瞬间被统计成指标、被采样成调用链、被打印成访问日志,又在同一份配置里被匹配到某条路由规则、被改写请求头、被加权分流、被重试或超时截断。天翼云应用服务网格控制面与数据面同构于业界主流体系,跑 bookinfo 时这套机制不需要业务代码配合,所有动作发生在 Pod 网络命名空间之内。下文从遥测采集点、指标维度、追踪与日志、路由原语、策略协同、排障视角六个层次展开。
  • 在传统数据架构里,事务库和分析库是两套系统,中间靠抽取同步任务桥接,数据从产生到能被报表看到往往隔着数小时甚至一天。这种链路在实时风控、动态大屏、即时推荐场景里会直接失效——业务要的是事务提交的瞬间,分析侧就能算出结果。天翼云分布式融合数据库走的是HTAP路线,核心把行存和列存放在同一份数据的两个物理视图里,借助实时同步协议把行存变更灌给列存,再让一条SQL在解析后按特征选路执行。理解这条实时查询链路,比背参数更重要,因为它决定了实时二字是不是真实时。下文从写入落盘、行列同步、SQL解析选路、执行下推、一致性快照、链路观测六个层次展开。
  • 负载均衡的选型最终要落到两个字上——用谁。四层和七层的技术差异可以写成长篇论文,但开发工程师在做架构决策时,最关心的往往是:我要配多少东西才能让它跑起来?出了问题好不好查?以后加新功能要不要改架构?配置复杂度和适用场景是绑在一起的——七层功能多,配置自然复杂;四层功能少,配置自然简单。但这并不意味着简单就是好,复杂就是坏。关键在于你的业务场景需要多少功能,以及你愿意为这些功能付出多少运维成本。下文从四层配置的简洁性、七层配置的丰富性、典型场景对照、运维排障难度、团队能力要求、架构演进路径六个层次展开。
  • 在互联网安全通信的基础设施中,SSL/TLS证书的兼容性是一个容易被忽视却在关键时刻引发严重问题的重要因素。当用户部署了一款免费SSL证书后,绝大多数现代浏览器和操作系统能够正常识别并建立安全连接,但在某些特定的客户端环境——老旧的操作系统、嵌入式设备、定制化浏览器或企业内部网络——证书链的验证可能失败,导致用户看到“连接不安全”的警告页面。这种兼容性问题的根源往往不在于证书本身的加密强度或域名验证方式,而在于根证书的信任链传递。免费SSL证书的签发机构通常使用中间证书来签署终端证书,而中间证书又由根证书签发。如果客户端的根证书存储中没有包含签发机构的根证书,或者根证书的信任链存在断裂,证书验证就会失败。息壤平台在SSL证书服务的运营过程中,围绕免费SSL证书的根证书兼容性进行了系统性的排查与研究,本文将阐述其核心发现与工程实践。
  • 在DV级别SSL证书的申请过程中,HTTP文件验证是最常用也最容易出问题的验证方式之一。它的原理并不复杂:证书颁发机构要求你在域名对应的Web服务器上放置一个特定内容的验证文件,然后通过HTTP协议访问这个文件来确认你对域名的控制权。然而,就是这个看似简单的“放个文件”操作,在实际部署中却因为目录权限配置不当导致验证失败的案例比比皆是。Web服务器的运行用户是谁、验证目录是否存在、目录的读写权限是否设置正确、SELinux或AppArmor是否在干扰访问——任何一个环节出错,证书机构就无法读取到验证文件,签发流程就会卡住。息壤平台在处理大量DV证书申请的过程中,围绕HTTP文件验证的目录权限配置积累了系统的工程经验,下文将详细阐述其中的关键要点。
  • 对于初次接触智算平台的人来说,从零开始跑通第一个模型往往是最大的门槛。平台界面怎么操作、环境怎么配置、数据怎么上传、训练怎么启动、结果怎么看——每一个环节都可能成为绊脚石。本文将以一个完整的模型训练流程为主线,记录在息壤智算平台上从零开始跑通第一个模型的全部过程,帮助新用户快速上手。
  • 在拥有多个研发团队的组织中,算力资源的分配和管理是一个普遍存在的难题。不同团队的项目周期不同、算力需求不同、优先级不同,如何在有限算力资源下满足各方需求,同时保证资源的高效利用,是一个复杂的管理问题。传统的人工协调方式效率低下且容易引发矛盾。息壤智算通过系统化的算力管理和调度机制,为这个难题提供了一套技术解决方案。
  • 在科研算力平台的日常使用中,环境部署的成功率与一致性是影响用户体验的关键因素。一个科研环境从镜像拉取、容器启动到依赖加载、驱动匹配,中间涉及数十个环节,任何一个环节出现问题都可能导致环境启动失败或运行时行为异常。更棘手的是,许多环境问题具有偶发性——同样的镜像在某个节点上运行正常,在另一个节点上却因为驱动版本差异或内核参数不同而崩溃。如果依赖用户手动排查这些问题,不仅耗费大量时间,而且要求用户具备深厚的系统知识,这与科研平台降低使用门槛的初衷背道而驰。息壤平台在一键部署科研环境的基础上,构建了配套的健康检查与环境验证脚本体系,本文将阐述其设计思路与工程实现。
  • 在企业微服务架构的演进过程中,很多团队都会逐步陷入“服务数量爆炸”的困境:原本为了解耦业务拆分出的十几个微服务,没过多久就增长到数十个,不同服务运行在不同的集群节点上,对外暴露的接口地址分散在各处,客户端要对接所有服务,就得维护十几套不同的调用配置,不仅接入流程极其繁琐,安全管控更是无从下手。更棘手的是,没有统一入口的情况下,各个微服务各自实现权限校验,逻辑重复且标准不统一,部分服务甚至直接裸奔在内网中,一旦某个业务接口出现漏洞,整个内部系统的核心数据都面临泄露风险;同时,业务高峰期突发的流量洪峰直接冲击后端微服务,很容易拖垮整个集群,而团队却没有一个统一的入口可以快速配置限流规则,只能事后紧急扩容,付出极高的资源成本。天翼云API网关的出现,正是为了解决这些分布式架构下的共性痛点:它作为所有内部微服务的统一流量入口,把分散的后端服务接口全部收拢到一个中心化的平台中,通过可视化的配置能力,一站式完成接口封装、权限管控、流量防护等核心能力,让企业不用在每个微服务中重复开发通用的网关逻辑,就能快速搭建起一套规范、安全、高可靠的内部服务开放体系。本文将从企业内部微服务封装的实际场景出发,系统
  • "上云能省钱"——这句话几乎每个企业在上云前都听过。但当账单真正摆在面前时,不少企业发现,实际花费和预期之间存在着不小的差距。上云到底花了多少钱?这笔钱花在了哪里?有没有花冤枉钱?这些问题值得每一家企业认真梳理。
  • 大模型热潮席卷全球,算力成了最炙手可热的资源。但在这场算力军备竞赛中,中小企业似乎总是处于弱势地位。头部企业动辄投入数亿元采购GPU集群,而中小企业连租几张高端显卡都要排队等货。算力焦虑,正在成为制约中小企业AI发展的核心瓶颈。
  • 信创(信息技术应用创新)替代,是近年来企业IT领域最受关注的话题之一。从操作系统、数据库到中间件、办公软件,国产化替代的浪潮正在席卷各个行业。但真正做过信创替代项目的人都知道,这不是简单地把国外产品换成国产产品就完事了——它涉及到应用适配、性能验证、生态完善、人员培训等一系列复杂工作。
  • 企业从传统物理机房迁移到云端,看似只是换了一个运行环境,实际上涉及应用架构、网络规划、数据安全、运维体系等多个维度的变革。很多企业在迁移过程中,都经历过"踩坑"的痛苦。以下五个最常见的坑,几乎每个上云项目都会遇到至少一个。
  • 大模型的崛起,正在深刻改变云计算的基础设施形态。从算力架构到存储系统,从网络互联到调度平台,几乎所有底层基础设施都在经历一场为AI而生的重构。这场变革的影响范围之广、程度之深,可能是云计算诞生以来最大的一次。
  • 在"双碳"目标的大背景下,绿色低碳已经成为数据中心行业的关键词。但如果你以为绿色数据中心只是一个环保口号,那就大错特错了。对于数据中心运营者来说,绿色意味着实实在在的成本节约和竞争力提升。能效每提升一个百分点,每年节省的电费可能高达数百万元。绿色计算,背后是真金白银。
  • 如果把时针拨回十年前,企业IT的技术栈与今天截然不同。物理服务器摆在机房机柜里,操作系统直接安装在裸机上,应用以单体架构打包成war包部署到应用服务器中,数据库运行在专用存储上,运维人员24小时待命应对突发故障。十年后的今天,容器编排、微服务、服务网格、可观测性、平台工程等概念已经成为技术栈的标准配置。这十年,技术栈经历了什么?
  • 数字化转型是近年来所有企业都在谈的话题,而"上云"几乎被等同于数字化转型本身。似乎只要把业务搬到云上,数字化转型就算完成了。但越来越多的实践表明,上云不等于数字化转型,甚至如果上云的方式不对,不仅不能推动转型,反而可能拖累业务。在急着上云之前,有些问题值得认真思考。
  • 云计算行业从来不缺新闻。每隔几个月就有新技术发布、新产品上线、新趋势涌现。但如果把视野拉长到一整年,哪些事情真正值得关注?以下盘点云计算圈这一年最值得关注的十件事,它们或代表了技术演进的方向,或预示着行业格局的变化,或影响着每一家企业的云上实践。
  • 很多团队在大模型训练初期都经历过这样一个阶段:到云平台上租几台GPU服务器,手动配置环境,然后开始训练。这种模式简单直接,但随着训练规模和频率的增加,问题逐渐暴露——成本高、效率低、管理混乱。从租GPU转向使用智算平台,本质上是从"手动挡"升级到"自动挡"的过程。这个升级到底能带来多少成本节省,值得仔细算一笔账。
  • 弹性算力是云计算的核心承诺之一。当流量突增时,系统能够快速扩容以应对压力;当流量回落时,又能自动缩容以节省成本。这个承诺在Web应用场景中已经被广泛验证,但在AI训练和推理场景中,弹性算力的挑战要大得多。GPU资源的弹性伸缩不像CPU实例那样简单——GPU的调度、数据迁移、任务恢复都更为复杂。息壤智算在弹性算力方面的表现如何,能否真正扛住突发流量,需要从技术机制到实际效果进行深入分析。
  • 在智算概念火热的当下,有一种误解颇为流行:智算不就是多买些GPU堆在一起吗?这种看法忽略了智算平台在架构设计、资源调度、网络通信、存储系统等多个层面的复杂性。如果把智算比作一座工厂,GPU只是流水线上的机器,而真正让工厂高效运转的是整个生产体系。本文将从多个维度解释为什么智算远不只是GPU的简单堆叠。
  • 多租户隔离是智算平台安全的核心。多个用户或团队共享同一套算力基础设施时,如何确保各自的算力资源不被侵占、数据不被泄露、训练任务不被干扰,是多租户隔离要解决的核心问题。息壤智算在多租户隔离方面采取了哪些技术措施,实际效果如何,本文将从技术原理到实际测试进行深入分析。
  • 大模型训练不是一个简单的"点一下开始"的过程,而是包含数据准备、环境配置、任务提交、训练执行、监控调优和结果输出等多个环节的完整流程。每个环节的效率和质量都会影响最终的训练效果。本文将以一个完整的模型训练流程为主线,详细拆解在息壤智算平台上从模型准备到训练完成的全过程。
  • 云网融合是天翼云的核心战略之一,也是其区别于其他云服务商的重要特征。当云网融合与智算相结合,会产生怎样的化学反应?对于AI训练和推理来说,云网融合意味着什么?本文将从多个角度分析息壤智算与天翼云云网融合带来的独特价值。
  • 微服务架构让应用迭代更灵活,却也让发布变得更危险。一次全量上线如果出了问题,影响的不是一个模块,而是整条调用链。传统的停机发布早已被淘汰,蓝绿部署虽然稳妥,但双倍资源成本让中小企业望而却步。真正被大规模验证、兼顾效率与稳定性的方案,是灰度发布——而天翼云容器服务CTK搭配应用服务网格ASM,恰恰为这一方案提供了最优雅的落地土壤。CTK作为基于Kubernetes构建的Serverless容器产品,继承了Kubernetes声明式编排的全部能力,又抹平了集群管理的沉重门槛。ASM则在此基础上,通过Envoy Sidecar代理将熔断、降级、流量治理等能力下沉到基础设施层,让开发者从繁琐的服务治理中解放出来。本文将从ASM灰度发布的完整配置流程,到熔断降级策略的精细化调优,为你拆解一套可直接落地的实战方案。
  • 在云原生架构中,ETCD是当之无愧的"定海神针"。它承载着集群状态、配置数据、服务发现等核心信息,一旦ETCD集群不可用,整个Kubernetes控制面将瞬间瘫痪。然而,ETCD的高可用不是"装三个节点就完事"那么简单——节点数量怎么选、心跳参数怎么调、快照策略怎么定,每一个决策都直接决定了集群在故障面前的生存能力。天翼云提供的托管式ETCD服务,在底层已经做了大量高可用优化,但作为开发者,你仍然需要理解这些机制的运作原理,才能在架构设计和运维排障中游刃有余。本文将从节点规模规划、心跳与选举机制、快照备份策略三个核心维度,为你拆解一套可落地的ETCD高可用部署方案。
  • 点击加载更多
#全站加速
关注该标签
专栏文章 95
视频 6
问答 0
  • 把一套在进口加速卡上跑得好好的深度学习模型搬到国产芯片上,最核心的工程问题不是模型架构改了,而是算子不认。进口卡上的CUDA生态积累了十几年,卷积、归一化、注意力、矩阵乘这些算子经过无数次优化,调用起来像呼吸一样自然。换成国产芯片后,指令集不同、运行时库不同、算子库的覆盖范围和优化深度不同,原来一行torch.nn.functional.conv2d背后隐含的cuDNN加速路径,在新的芯片上可能要走一条未经优化的软件模拟路径,速度慢十倍甚至跑不出正确结果。算子适配迁移要做的就是让模型在国产芯片上也能找到高效的执行路径,让开发工程师写一次代码就能在多种芯片上运行。下文从算子映射、算子开发、精度对齐、性能调优、自动化工具、生态共建六个层次展开。
    c****i
    2026-08-12
    0
    0
  • 把一张纸质单据、一张截图、一张拍歪了的发票变成系统里可以参与计算的数字,中间那道桥就是通用OCR接口。天翼云通用型印刷文字识别在官网的定位是检测图片中的文字,返回文字内容及其在图片中的位置信息,它不承诺看懂表格结构,也不处理手写体,但对印刷体中英文混合、数字、金额、编号这类场景足够好用。开发工程师接入时真正的工程量不在发一个请求这件动作本身,而在鉴权签名、图片约束、返回结构解析、以及把识别出的各种格式的文本安全转成程序里的数值类型这一长串后处理里。下文从服务开通与鉴权、请求构造与图片约束、响应结构与位置信息、文本转数字的后处理、异常处理与重试、排障视角六个层次展开。
    c****i
    2026-08-07
    4
    0
  • 桌面云传输的体验天花板,往往不是云端虚拟机的算力,也不是终端的解码能力,而是横在两端之间那条会抖动、会丢包、会突然收窄的网线。天翼云电脑自研的CLINK协议之所以在弱网场景里比传统远程桌面协议更“跟手”,关键不在于它把单帧画质压得有多狠,而在于它把动态码率、帧率档位、内容语义感知和输入预测拧成了一条带滞回的实时闭环。作为开发工程师在对接或自研类似桌面协议时,理解CLINK这套感知—决策—调整的调优逻辑,比背参数表更有用。下文从协议定位、码率闭环、帧率档位、语义编码、弱网兜底、端云协同、输入预测与调参观测八个层次拆开讲。
    c****i
    2026-07-30
    2
    0
  • 桌面云的每一帧画面,从应用程序绘制到最终编码输出,背后都依赖GPU的参与。当多个用户的虚拟桌面共享同一块物理GPU时,渲染任务的排队、抢占和优先级管理就成了决定帧率稳定性的关键因素。如果GPU调度做得粗糙,一个用户的全屏三维应用可能让同机柜里其他用户的文档滚动都变得卡顿。天翼云电脑在GPU资源管理上采用了渲染分流与精细化调度相结合的策略,试图在硬件利用率与单用户体验之间找到更好的平衡点。下文从渲染路径拆分、分流策略、调度模型、优先级管理、弹性扩缩和效果观测六个层次展开。
    c****i
    2026-07-30
    8
    0
  • 在 bookinfo 这条四服务调用链里,遥测数据收集和路由策略看似是两件事:前者关心发生了什么,后者关心接下来去哪。但在服务网格的架构下,它们共用同一个执行点——Sidecar 代理。每一次被劫持进代理的请求,既在出入的瞬间被统计成指标、被采样成调用链、被打印成访问日志,又在同一份配置里被匹配到某条路由规则、被改写请求头、被加权分流、被重试或超时截断。天翼云应用服务网格控制面与数据面同构于业界主流体系,跑 bookinfo 时这套机制不需要业务代码配合,所有动作发生在 Pod 网络命名空间之内。下文从遥测采集点、指标维度、追踪与日志、路由原语、策略协同、排障视角六个层次展开。
    c****i
    2026-07-30
    1
    0
  • 在传统数据架构里,事务库和分析库是两套系统,中间靠抽取同步任务桥接,数据从产生到能被报表看到往往隔着数小时甚至一天。这种链路在实时风控、动态大屏、即时推荐场景里会直接失效——业务要的是事务提交的瞬间,分析侧就能算出结果。天翼云分布式融合数据库走的是HTAP路线,核心把行存和列存放在同一份数据的两个物理视图里,借助实时同步协议把行存变更灌给列存,再让一条SQL在解析后按特征选路执行。理解这条实时查询链路,比背参数更重要,因为它决定了实时二字是不是真实时。下文从写入落盘、行列同步、SQL解析选路、执行下推、一致性快照、链路观测六个层次展开。
    c****i
    2026-07-30
    2
    0
  • 负载均衡的选型最终要落到两个字上——用谁。四层和七层的技术差异可以写成长篇论文,但开发工程师在做架构决策时,最关心的往往是:我要配多少东西才能让它跑起来?出了问题好不好查?以后加新功能要不要改架构?配置复杂度和适用场景是绑在一起的——七层功能多,配置自然复杂;四层功能少,配置自然简单。但这并不意味着简单就是好,复杂就是坏。关键在于你的业务场景需要多少功能,以及你愿意为这些功能付出多少运维成本。下文从四层配置的简洁性、七层配置的丰富性、典型场景对照、运维排障难度、团队能力要求、架构演进路径六个层次展开。
    c****i
    2026-07-30
    3
    0
  • 在互联网安全通信的基础设施中,SSL/TLS证书的兼容性是一个容易被忽视却在关键时刻引发严重问题的重要因素。当用户部署了一款免费SSL证书后,绝大多数现代浏览器和操作系统能够正常识别并建立安全连接,但在某些特定的客户端环境——老旧的操作系统、嵌入式设备、定制化浏览器或企业内部网络——证书链的验证可能失败,导致用户看到“连接不安全”的警告页面。这种兼容性问题的根源往往不在于证书本身的加密强度或域名验证方式,而在于根证书的信任链传递。免费SSL证书的签发机构通常使用中间证书来签署终端证书,而中间证书又由根证书签发。如果客户端的根证书存储中没有包含签发机构的根证书,或者根证书的信任链存在断裂,证书验证就会失败。息壤平台在SSL证书服务的运营过程中,围绕免费SSL证书的根证书兼容性进行了系统性的排查与研究,本文将阐述其核心发现与工程实践。
    c****i
    2026-07-24
    3
    0
  • 在DV级别SSL证书的申请过程中,HTTP文件验证是最常用也最容易出问题的验证方式之一。它的原理并不复杂:证书颁发机构要求你在域名对应的Web服务器上放置一个特定内容的验证文件,然后通过HTTP协议访问这个文件来确认你对域名的控制权。然而,就是这个看似简单的“放个文件”操作,在实际部署中却因为目录权限配置不当导致验证失败的案例比比皆是。Web服务器的运行用户是谁、验证目录是否存在、目录的读写权限是否设置正确、SELinux或AppArmor是否在干扰访问——任何一个环节出错,证书机构就无法读取到验证文件,签发流程就会卡住。息壤平台在处理大量DV证书申请的过程中,围绕HTTP文件验证的目录权限配置积累了系统的工程经验,下文将详细阐述其中的关键要点。
    c****i
    2026-07-24
    1
    0
  • 对于初次接触智算平台的人来说,从零开始跑通第一个模型往往是最大的门槛。平台界面怎么操作、环境怎么配置、数据怎么上传、训练怎么启动、结果怎么看——每一个环节都可能成为绊脚石。本文将以一个完整的模型训练流程为主线,记录在息壤智算平台上从零开始跑通第一个模型的全部过程,帮助新用户快速上手。
    思念如故
    2026-07-23
    2
    0
  • 在拥有多个研发团队的组织中,算力资源的分配和管理是一个普遍存在的难题。不同团队的项目周期不同、算力需求不同、优先级不同,如何在有限算力资源下满足各方需求,同时保证资源的高效利用,是一个复杂的管理问题。传统的人工协调方式效率低下且容易引发矛盾。息壤智算通过系统化的算力管理和调度机制,为这个难题提供了一套技术解决方案。
    思念如故
    2026-07-23
    0
    0
  • 在科研算力平台的日常使用中,环境部署的成功率与一致性是影响用户体验的关键因素。一个科研环境从镜像拉取、容器启动到依赖加载、驱动匹配,中间涉及数十个环节,任何一个环节出现问题都可能导致环境启动失败或运行时行为异常。更棘手的是,许多环境问题具有偶发性——同样的镜像在某个节点上运行正常,在另一个节点上却因为驱动版本差异或内核参数不同而崩溃。如果依赖用户手动排查这些问题,不仅耗费大量时间,而且要求用户具备深厚的系统知识,这与科研平台降低使用门槛的初衷背道而驰。息壤平台在一键部署科研环境的基础上,构建了配套的健康检查与环境验证脚本体系,本文将阐述其设计思路与工程实现。
    c****i
    2026-07-23
    0
    0
  • 在企业微服务架构的演进过程中,很多团队都会逐步陷入“服务数量爆炸”的困境:原本为了解耦业务拆分出的十几个微服务,没过多久就增长到数十个,不同服务运行在不同的集群节点上,对外暴露的接口地址分散在各处,客户端要对接所有服务,就得维护十几套不同的调用配置,不仅接入流程极其繁琐,安全管控更是无从下手。更棘手的是,没有统一入口的情况下,各个微服务各自实现权限校验,逻辑重复且标准不统一,部分服务甚至直接裸奔在内网中,一旦某个业务接口出现漏洞,整个内部系统的核心数据都面临泄露风险;同时,业务高峰期突发的流量洪峰直接冲击后端微服务,很容易拖垮整个集群,而团队却没有一个统一的入口可以快速配置限流规则,只能事后紧急扩容,付出极高的资源成本。天翼云API网关的出现,正是为了解决这些分布式架构下的共性痛点:它作为所有内部微服务的统一流量入口,把分散的后端服务接口全部收拢到一个中心化的平台中,通过可视化的配置能力,一站式完成接口封装、权限管控、流量防护等核心能力,让企业不用在每个微服务中重复开发通用的网关逻辑,就能快速搭建起一套规范、安全、高可靠的内部服务开放体系。本文将从企业内部微服务封装的实际场景出发,系统
    思念如故
    2026-07-21
    4
    0
  • "上云能省钱"——这句话几乎每个企业在上云前都听过。但当账单真正摆在面前时,不少企业发现,实际花费和预期之间存在着不小的差距。上云到底花了多少钱?这笔钱花在了哪里?有没有花冤枉钱?这些问题值得每一家企业认真梳理。
    思念如故
    2026-07-21
    21
    0
  • 大模型热潮席卷全球,算力成了最炙手可热的资源。但在这场算力军备竞赛中,中小企业似乎总是处于弱势地位。头部企业动辄投入数亿元采购GPU集群,而中小企业连租几张高端显卡都要排队等货。算力焦虑,正在成为制约中小企业AI发展的核心瓶颈。
    思念如故
    2026-07-21
    16
    0
  • 信创(信息技术应用创新)替代,是近年来企业IT领域最受关注的话题之一。从操作系统、数据库到中间件、办公软件,国产化替代的浪潮正在席卷各个行业。但真正做过信创替代项目的人都知道,这不是简单地把国外产品换成国产产品就完事了——它涉及到应用适配、性能验证、生态完善、人员培训等一系列复杂工作。
    思念如故
    2026-07-21
    16
    0
  • 企业从传统物理机房迁移到云端,看似只是换了一个运行环境,实际上涉及应用架构、网络规划、数据安全、运维体系等多个维度的变革。很多企业在迁移过程中,都经历过"踩坑"的痛苦。以下五个最常见的坑,几乎每个上云项目都会遇到至少一个。
    思念如故
    2026-07-21
    4
    0
  • 大模型的崛起,正在深刻改变云计算的基础设施形态。从算力架构到存储系统,从网络互联到调度平台,几乎所有底层基础设施都在经历一场为AI而生的重构。这场变革的影响范围之广、程度之深,可能是云计算诞生以来最大的一次。
    思念如故
    2026-07-21
    11
    0
  • 在"双碳"目标的大背景下,绿色低碳已经成为数据中心行业的关键词。但如果你以为绿色数据中心只是一个环保口号,那就大错特错了。对于数据中心运营者来说,绿色意味着实实在在的成本节约和竞争力提升。能效每提升一个百分点,每年节省的电费可能高达数百万元。绿色计算,背后是真金白银。
    思念如故
    2026-07-21
    7
    0
  • 如果把时针拨回十年前,企业IT的技术栈与今天截然不同。物理服务器摆在机房机柜里,操作系统直接安装在裸机上,应用以单体架构打包成war包部署到应用服务器中,数据库运行在专用存储上,运维人员24小时待命应对突发故障。十年后的今天,容器编排、微服务、服务网格、可观测性、平台工程等概念已经成为技术栈的标准配置。这十年,技术栈经历了什么?
    思念如故
    2026-07-21
    10
    0
  • 数字化转型是近年来所有企业都在谈的话题,而"上云"几乎被等同于数字化转型本身。似乎只要把业务搬到云上,数字化转型就算完成了。但越来越多的实践表明,上云不等于数字化转型,甚至如果上云的方式不对,不仅不能推动转型,反而可能拖累业务。在急着上云之前,有些问题值得认真思考。
    思念如故
    2026-07-21
    5
    0
  • 云计算行业从来不缺新闻。每隔几个月就有新技术发布、新产品上线、新趋势涌现。但如果把视野拉长到一整年,哪些事情真正值得关注?以下盘点云计算圈这一年最值得关注的十件事,它们或代表了技术演进的方向,或预示着行业格局的变化,或影响着每一家企业的云上实践。
    思念如故
    2026-07-21
    4
    0
  • 很多团队在大模型训练初期都经历过这样一个阶段:到云平台上租几台GPU服务器,手动配置环境,然后开始训练。这种模式简单直接,但随着训练规模和频率的增加,问题逐渐暴露——成本高、效率低、管理混乱。从租GPU转向使用智算平台,本质上是从"手动挡"升级到"自动挡"的过程。这个升级到底能带来多少成本节省,值得仔细算一笔账。
    思念如故
    2026-07-21
    2
    0
  • 弹性算力是云计算的核心承诺之一。当流量突增时,系统能够快速扩容以应对压力;当流量回落时,又能自动缩容以节省成本。这个承诺在Web应用场景中已经被广泛验证,但在AI训练和推理场景中,弹性算力的挑战要大得多。GPU资源的弹性伸缩不像CPU实例那样简单——GPU的调度、数据迁移、任务恢复都更为复杂。息壤智算在弹性算力方面的表现如何,能否真正扛住突发流量,需要从技术机制到实际效果进行深入分析。
    思念如故
    2026-07-21
    2
    0
  • 在智算概念火热的当下,有一种误解颇为流行:智算不就是多买些GPU堆在一起吗?这种看法忽略了智算平台在架构设计、资源调度、网络通信、存储系统等多个层面的复杂性。如果把智算比作一座工厂,GPU只是流水线上的机器,而真正让工厂高效运转的是整个生产体系。本文将从多个维度解释为什么智算远不只是GPU的简单堆叠。
    思念如故
    2026-07-21
    3
    0
  • 多租户隔离是智算平台安全的核心。多个用户或团队共享同一套算力基础设施时,如何确保各自的算力资源不被侵占、数据不被泄露、训练任务不被干扰,是多租户隔离要解决的核心问题。息壤智算在多租户隔离方面采取了哪些技术措施,实际效果如何,本文将从技术原理到实际测试进行深入分析。
    思念如故
    2026-07-21
    1
    0
  • 大模型训练不是一个简单的"点一下开始"的过程,而是包含数据准备、环境配置、任务提交、训练执行、监控调优和结果输出等多个环节的完整流程。每个环节的效率和质量都会影响最终的训练效果。本文将以一个完整的模型训练流程为主线,详细拆解在息壤智算平台上从模型准备到训练完成的全过程。
    思念如故
    2026-07-21
    4
    0
  • 云网融合是天翼云的核心战略之一,也是其区别于其他云服务商的重要特征。当云网融合与智算相结合,会产生怎样的化学反应?对于AI训练和推理来说,云网融合意味着什么?本文将从多个角度分析息壤智算与天翼云云网融合带来的独特价值。
    思念如故
    2026-07-21
    3
    0
  • 微服务架构让应用迭代更灵活,却也让发布变得更危险。一次全量上线如果出了问题,影响的不是一个模块,而是整条调用链。传统的停机发布早已被淘汰,蓝绿部署虽然稳妥,但双倍资源成本让中小企业望而却步。真正被大规模验证、兼顾效率与稳定性的方案,是灰度发布——而天翼云容器服务CTK搭配应用服务网格ASM,恰恰为这一方案提供了最优雅的落地土壤。CTK作为基于Kubernetes构建的Serverless容器产品,继承了Kubernetes声明式编排的全部能力,又抹平了集群管理的沉重门槛。ASM则在此基础上,通过Envoy Sidecar代理将熔断、降级、流量治理等能力下沉到基础设施层,让开发者从繁琐的服务治理中解放出来。本文将从ASM灰度发布的完整配置流程,到熔断降级策略的精细化调优,为你拆解一套可直接落地的实战方案。
    思念如故
    2026-07-08
    4
    0
  • 在云原生架构中,ETCD是当之无愧的"定海神针"。它承载着集群状态、配置数据、服务发现等核心信息,一旦ETCD集群不可用,整个Kubernetes控制面将瞬间瘫痪。然而,ETCD的高可用不是"装三个节点就完事"那么简单——节点数量怎么选、心跳参数怎么调、快照策略怎么定,每一个决策都直接决定了集群在故障面前的生存能力。天翼云提供的托管式ETCD服务,在底层已经做了大量高可用优化,但作为开发者,你仍然需要理解这些机制的运作原理,才能在架构设计和运维排障中游刃有余。本文将从节点规模规划、心跳与选举机制、快照备份策略三个核心维度,为你拆解一套可落地的ETCD高可用部署方案。
    思念如故
    2026-07-08
    17
    0
  • 把一套在进口加速卡上跑得好好的深度学习模型搬到国产芯片上,最核心的工程问题不是模型架构改了,而是算子不认。进口卡上的CUDA生态积累了十几年,卷积、归一化、注意力、矩阵乘这些算子经过无数次优化,调用起来像呼吸一样自然。换成国产芯片后,指令集不同、运行时库不同、算子库的覆盖范围和优化深度不同,原来一行torch.nn.functional.conv2d背后隐含的cuDNN加速路径,在新的芯片上可能要走一条未经优化的软件模拟路径,速度慢十倍甚至跑不出正确结果。算子适配迁移要做的就是让模型在国产芯片上也能找到高效的执行路径,让开发工程师写一次代码就能在多种芯片上运行。下文从算子映射、算子开发、精度对齐、性能调优、自动化工具、生态共建六个层次展开。
  • 把一张纸质单据、一张截图、一张拍歪了的发票变成系统里可以参与计算的数字,中间那道桥就是通用OCR接口。天翼云通用型印刷文字识别在官网的定位是检测图片中的文字,返回文字内容及其在图片中的位置信息,它不承诺看懂表格结构,也不处理手写体,但对印刷体中英文混合、数字、金额、编号这类场景足够好用。开发工程师接入时真正的工程量不在发一个请求这件动作本身,而在鉴权签名、图片约束、返回结构解析、以及把识别出的各种格式的文本安全转成程序里的数值类型这一长串后处理里。下文从服务开通与鉴权、请求构造与图片约束、响应结构与位置信息、文本转数字的后处理、异常处理与重试、排障视角六个层次展开。
  • 桌面云传输的体验天花板,往往不是云端虚拟机的算力,也不是终端的解码能力,而是横在两端之间那条会抖动、会丢包、会突然收窄的网线。天翼云电脑自研的CLINK协议之所以在弱网场景里比传统远程桌面协议更“跟手”,关键不在于它把单帧画质压得有多狠,而在于它把动态码率、帧率档位、内容语义感知和输入预测拧成了一条带滞回的实时闭环。作为开发工程师在对接或自研类似桌面协议时,理解CLINK这套感知—决策—调整的调优逻辑,比背参数表更有用。下文从协议定位、码率闭环、帧率档位、语义编码、弱网兜底、端云协同、输入预测与调参观测八个层次拆开讲。
  • 桌面云的每一帧画面,从应用程序绘制到最终编码输出,背后都依赖GPU的参与。当多个用户的虚拟桌面共享同一块物理GPU时,渲染任务的排队、抢占和优先级管理就成了决定帧率稳定性的关键因素。如果GPU调度做得粗糙,一个用户的全屏三维应用可能让同机柜里其他用户的文档滚动都变得卡顿。天翼云电脑在GPU资源管理上采用了渲染分流与精细化调度相结合的策略,试图在硬件利用率与单用户体验之间找到更好的平衡点。下文从渲染路径拆分、分流策略、调度模型、优先级管理、弹性扩缩和效果观测六个层次展开。
  • 在 bookinfo 这条四服务调用链里,遥测数据收集和路由策略看似是两件事:前者关心发生了什么,后者关心接下来去哪。但在服务网格的架构下,它们共用同一个执行点——Sidecar 代理。每一次被劫持进代理的请求,既在出入的瞬间被统计成指标、被采样成调用链、被打印成访问日志,又在同一份配置里被匹配到某条路由规则、被改写请求头、被加权分流、被重试或超时截断。天翼云应用服务网格控制面与数据面同构于业界主流体系,跑 bookinfo 时这套机制不需要业务代码配合,所有动作发生在 Pod 网络命名空间之内。下文从遥测采集点、指标维度、追踪与日志、路由原语、策略协同、排障视角六个层次展开。
  • 在传统数据架构里,事务库和分析库是两套系统,中间靠抽取同步任务桥接,数据从产生到能被报表看到往往隔着数小时甚至一天。这种链路在实时风控、动态大屏、即时推荐场景里会直接失效——业务要的是事务提交的瞬间,分析侧就能算出结果。天翼云分布式融合数据库走的是HTAP路线,核心把行存和列存放在同一份数据的两个物理视图里,借助实时同步协议把行存变更灌给列存,再让一条SQL在解析后按特征选路执行。理解这条实时查询链路,比背参数更重要,因为它决定了实时二字是不是真实时。下文从写入落盘、行列同步、SQL解析选路、执行下推、一致性快照、链路观测六个层次展开。
  • 负载均衡的选型最终要落到两个字上——用谁。四层和七层的技术差异可以写成长篇论文,但开发工程师在做架构决策时,最关心的往往是:我要配多少东西才能让它跑起来?出了问题好不好查?以后加新功能要不要改架构?配置复杂度和适用场景是绑在一起的——七层功能多,配置自然复杂;四层功能少,配置自然简单。但这并不意味着简单就是好,复杂就是坏。关键在于你的业务场景需要多少功能,以及你愿意为这些功能付出多少运维成本。下文从四层配置的简洁性、七层配置的丰富性、典型场景对照、运维排障难度、团队能力要求、架构演进路径六个层次展开。
  • 在互联网安全通信的基础设施中,SSL/TLS证书的兼容性是一个容易被忽视却在关键时刻引发严重问题的重要因素。当用户部署了一款免费SSL证书后,绝大多数现代浏览器和操作系统能够正常识别并建立安全连接,但在某些特定的客户端环境——老旧的操作系统、嵌入式设备、定制化浏览器或企业内部网络——证书链的验证可能失败,导致用户看到“连接不安全”的警告页面。这种兼容性问题的根源往往不在于证书本身的加密强度或域名验证方式,而在于根证书的信任链传递。免费SSL证书的签发机构通常使用中间证书来签署终端证书,而中间证书又由根证书签发。如果客户端的根证书存储中没有包含签发机构的根证书,或者根证书的信任链存在断裂,证书验证就会失败。息壤平台在SSL证书服务的运营过程中,围绕免费SSL证书的根证书兼容性进行了系统性的排查与研究,本文将阐述其核心发现与工程实践。
  • 在DV级别SSL证书的申请过程中,HTTP文件验证是最常用也最容易出问题的验证方式之一。它的原理并不复杂:证书颁发机构要求你在域名对应的Web服务器上放置一个特定内容的验证文件,然后通过HTTP协议访问这个文件来确认你对域名的控制权。然而,就是这个看似简单的“放个文件”操作,在实际部署中却因为目录权限配置不当导致验证失败的案例比比皆是。Web服务器的运行用户是谁、验证目录是否存在、目录的读写权限是否设置正确、SELinux或AppArmor是否在干扰访问——任何一个环节出错,证书机构就无法读取到验证文件,签发流程就会卡住。息壤平台在处理大量DV证书申请的过程中,围绕HTTP文件验证的目录权限配置积累了系统的工程经验,下文将详细阐述其中的关键要点。
  • 对于初次接触智算平台的人来说,从零开始跑通第一个模型往往是最大的门槛。平台界面怎么操作、环境怎么配置、数据怎么上传、训练怎么启动、结果怎么看——每一个环节都可能成为绊脚石。本文将以一个完整的模型训练流程为主线,记录在息壤智算平台上从零开始跑通第一个模型的全部过程,帮助新用户快速上手。
  • 在拥有多个研发团队的组织中,算力资源的分配和管理是一个普遍存在的难题。不同团队的项目周期不同、算力需求不同、优先级不同,如何在有限算力资源下满足各方需求,同时保证资源的高效利用,是一个复杂的管理问题。传统的人工协调方式效率低下且容易引发矛盾。息壤智算通过系统化的算力管理和调度机制,为这个难题提供了一套技术解决方案。
  • 在科研算力平台的日常使用中,环境部署的成功率与一致性是影响用户体验的关键因素。一个科研环境从镜像拉取、容器启动到依赖加载、驱动匹配,中间涉及数十个环节,任何一个环节出现问题都可能导致环境启动失败或运行时行为异常。更棘手的是,许多环境问题具有偶发性——同样的镜像在某个节点上运行正常,在另一个节点上却因为驱动版本差异或内核参数不同而崩溃。如果依赖用户手动排查这些问题,不仅耗费大量时间,而且要求用户具备深厚的系统知识,这与科研平台降低使用门槛的初衷背道而驰。息壤平台在一键部署科研环境的基础上,构建了配套的健康检查与环境验证脚本体系,本文将阐述其设计思路与工程实现。
  • 在企业微服务架构的演进过程中,很多团队都会逐步陷入“服务数量爆炸”的困境:原本为了解耦业务拆分出的十几个微服务,没过多久就增长到数十个,不同服务运行在不同的集群节点上,对外暴露的接口地址分散在各处,客户端要对接所有服务,就得维护十几套不同的调用配置,不仅接入流程极其繁琐,安全管控更是无从下手。更棘手的是,没有统一入口的情况下,各个微服务各自实现权限校验,逻辑重复且标准不统一,部分服务甚至直接裸奔在内网中,一旦某个业务接口出现漏洞,整个内部系统的核心数据都面临泄露风险;同时,业务高峰期突发的流量洪峰直接冲击后端微服务,很容易拖垮整个集群,而团队却没有一个统一的入口可以快速配置限流规则,只能事后紧急扩容,付出极高的资源成本。天翼云API网关的出现,正是为了解决这些分布式架构下的共性痛点:它作为所有内部微服务的统一流量入口,把分散的后端服务接口全部收拢到一个中心化的平台中,通过可视化的配置能力,一站式完成接口封装、权限管控、流量防护等核心能力,让企业不用在每个微服务中重复开发通用的网关逻辑,就能快速搭建起一套规范、安全、高可靠的内部服务开放体系。本文将从企业内部微服务封装的实际场景出发,系统
  • "上云能省钱"——这句话几乎每个企业在上云前都听过。但当账单真正摆在面前时,不少企业发现,实际花费和预期之间存在着不小的差距。上云到底花了多少钱?这笔钱花在了哪里?有没有花冤枉钱?这些问题值得每一家企业认真梳理。
  • 大模型热潮席卷全球,算力成了最炙手可热的资源。但在这场算力军备竞赛中,中小企业似乎总是处于弱势地位。头部企业动辄投入数亿元采购GPU集群,而中小企业连租几张高端显卡都要排队等货。算力焦虑,正在成为制约中小企业AI发展的核心瓶颈。
  • 信创(信息技术应用创新)替代,是近年来企业IT领域最受关注的话题之一。从操作系统、数据库到中间件、办公软件,国产化替代的浪潮正在席卷各个行业。但真正做过信创替代项目的人都知道,这不是简单地把国外产品换成国产产品就完事了——它涉及到应用适配、性能验证、生态完善、人员培训等一系列复杂工作。
  • 企业从传统物理机房迁移到云端,看似只是换了一个运行环境,实际上涉及应用架构、网络规划、数据安全、运维体系等多个维度的变革。很多企业在迁移过程中,都经历过"踩坑"的痛苦。以下五个最常见的坑,几乎每个上云项目都会遇到至少一个。
  • 大模型的崛起,正在深刻改变云计算的基础设施形态。从算力架构到存储系统,从网络互联到调度平台,几乎所有底层基础设施都在经历一场为AI而生的重构。这场变革的影响范围之广、程度之深,可能是云计算诞生以来最大的一次。
  • 在"双碳"目标的大背景下,绿色低碳已经成为数据中心行业的关键词。但如果你以为绿色数据中心只是一个环保口号,那就大错特错了。对于数据中心运营者来说,绿色意味着实实在在的成本节约和竞争力提升。能效每提升一个百分点,每年节省的电费可能高达数百万元。绿色计算,背后是真金白银。
  • 如果把时针拨回十年前,企业IT的技术栈与今天截然不同。物理服务器摆在机房机柜里,操作系统直接安装在裸机上,应用以单体架构打包成war包部署到应用服务器中,数据库运行在专用存储上,运维人员24小时待命应对突发故障。十年后的今天,容器编排、微服务、服务网格、可观测性、平台工程等概念已经成为技术栈的标准配置。这十年,技术栈经历了什么?
  • 数字化转型是近年来所有企业都在谈的话题,而"上云"几乎被等同于数字化转型本身。似乎只要把业务搬到云上,数字化转型就算完成了。但越来越多的实践表明,上云不等于数字化转型,甚至如果上云的方式不对,不仅不能推动转型,反而可能拖累业务。在急着上云之前,有些问题值得认真思考。
  • 云计算行业从来不缺新闻。每隔几个月就有新技术发布、新产品上线、新趋势涌现。但如果把视野拉长到一整年,哪些事情真正值得关注?以下盘点云计算圈这一年最值得关注的十件事,它们或代表了技术演进的方向,或预示着行业格局的变化,或影响着每一家企业的云上实践。
  • 很多团队在大模型训练初期都经历过这样一个阶段:到云平台上租几台GPU服务器,手动配置环境,然后开始训练。这种模式简单直接,但随着训练规模和频率的增加,问题逐渐暴露——成本高、效率低、管理混乱。从租GPU转向使用智算平台,本质上是从"手动挡"升级到"自动挡"的过程。这个升级到底能带来多少成本节省,值得仔细算一笔账。
  • 弹性算力是云计算的核心承诺之一。当流量突增时,系统能够快速扩容以应对压力;当流量回落时,又能自动缩容以节省成本。这个承诺在Web应用场景中已经被广泛验证,但在AI训练和推理场景中,弹性算力的挑战要大得多。GPU资源的弹性伸缩不像CPU实例那样简单——GPU的调度、数据迁移、任务恢复都更为复杂。息壤智算在弹性算力方面的表现如何,能否真正扛住突发流量,需要从技术机制到实际效果进行深入分析。
  • 在智算概念火热的当下,有一种误解颇为流行:智算不就是多买些GPU堆在一起吗?这种看法忽略了智算平台在架构设计、资源调度、网络通信、存储系统等多个层面的复杂性。如果把智算比作一座工厂,GPU只是流水线上的机器,而真正让工厂高效运转的是整个生产体系。本文将从多个维度解释为什么智算远不只是GPU的简单堆叠。
  • 多租户隔离是智算平台安全的核心。多个用户或团队共享同一套算力基础设施时,如何确保各自的算力资源不被侵占、数据不被泄露、训练任务不被干扰,是多租户隔离要解决的核心问题。息壤智算在多租户隔离方面采取了哪些技术措施,实际效果如何,本文将从技术原理到实际测试进行深入分析。
  • 大模型训练不是一个简单的"点一下开始"的过程,而是包含数据准备、环境配置、任务提交、训练执行、监控调优和结果输出等多个环节的完整流程。每个环节的效率和质量都会影响最终的训练效果。本文将以一个完整的模型训练流程为主线,详细拆解在息壤智算平台上从模型准备到训练完成的全过程。
  • 云网融合是天翼云的核心战略之一,也是其区别于其他云服务商的重要特征。当云网融合与智算相结合,会产生怎样的化学反应?对于AI训练和推理来说,云网融合意味着什么?本文将从多个角度分析息壤智算与天翼云云网融合带来的独特价值。
  • 微服务架构让应用迭代更灵活,却也让发布变得更危险。一次全量上线如果出了问题,影响的不是一个模块,而是整条调用链。传统的停机发布早已被淘汰,蓝绿部署虽然稳妥,但双倍资源成本让中小企业望而却步。真正被大规模验证、兼顾效率与稳定性的方案,是灰度发布——而天翼云容器服务CTK搭配应用服务网格ASM,恰恰为这一方案提供了最优雅的落地土壤。CTK作为基于Kubernetes构建的Serverless容器产品,继承了Kubernetes声明式编排的全部能力,又抹平了集群管理的沉重门槛。ASM则在此基础上,通过Envoy Sidecar代理将熔断、降级、流量治理等能力下沉到基础设施层,让开发者从繁琐的服务治理中解放出来。本文将从ASM灰度发布的完整配置流程,到熔断降级策略的精细化调优,为你拆解一套可直接落地的实战方案。
  • 在云原生架构中,ETCD是当之无愧的"定海神针"。它承载着集群状态、配置数据、服务发现等核心信息,一旦ETCD集群不可用,整个Kubernetes控制面将瞬间瘫痪。然而,ETCD的高可用不是"装三个节点就完事"那么简单——节点数量怎么选、心跳参数怎么调、快照策略怎么定,每一个决策都直接决定了集群在故障面前的生存能力。天翼云提供的托管式ETCD服务,在底层已经做了大量高可用优化,但作为开发者,你仍然需要理解这些机制的运作原理,才能在架构设计和运维排障中游刃有余。本文将从节点规模规划、心跳与选举机制、快照备份策略三个核心维度,为你拆解一套可落地的ETCD高可用部署方案。
  • 点击加载更多