- 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。思念如故2026-09-0310
- 线上推理和实验室里跑模型完全是两回事。真实业务里,不同系统对推理的延迟、吞吐和稳定性要求差别很大:搜索推荐希望毫秒级返回,报表类任务可以慢慢算;核心业务不能受其他业务波动的影响。如果所有请求都涌向同一组实例,高峰时互相拖累,排查问题也分不清是谁造成的。把推理服务按业务分流、让不同模型各走各的实例组,是解决这类问题的常见做法。下面从分流的价值讲起,说说实例组怎么划分、路由怎么实现、资源怎么隔离,以及日常运维中需要留意什么。分流的思路说穿了就一句话:让重要的流量走稳,让重的流量走专,让新的流量先试。c****i2026-09-0300
- 提到算力集群,工程师往往会想到两种使用形态:一种是容器方式,任务打包在容器里,按需分配若干张卡,启动快、密度高;另一种是裸金属方式,整台机器连卡带网络直接划给使用者,资源独占、没有额外开销。两者各有擅长,训练大模型偏好裸金属的稳定与高速互联,在线服务和轻量任务则更适合容器的灵活。于是自然产生一个问题:同一套集群能不能两种形态并存,统一纳管?答案是肯定的,而且这正是当前许多算力系统的主流做法。下面聊聊混部的原理、管理方式和实践要点。混部的关键词是统一:统一资源视图、统一调度入口、统一运维口径,三个统一做到了,两种形态就能像一支队伍一样协作。c****i2026-09-0300
- 定时任务上线只是开始,能不能看到每一次执行的记录、失败了能不能及时知道,才是长期运维的关键。不少开发者的痛点正在这里:任务跑没跑、跑到哪一步、为什么失败,控制台上找不到直观的答案;等业务方反馈数据没有更新,才发现任务早已连续失败多轮。本文围绕控制台的执行历史查看能力与失败告警的配置方法,把可用能力、查看路径、保留策略与告警思路讲清楚,帮助大家建立起"看得见、叫得应"的运维闭环。c****i2026-08-3110
- 不少团队的管理后台基于Spring构建,希望把定时触发器的创建、查询、更新、删除等操作封装进自己的业务系统,而不是每次都登录控制台手动操作,这就需要把官方SDK接入Spring项目。接入过程本身不复杂,但两个环节容易出问题:一是客户端的初始化方式不当,埋下资源隐患;二是SDK携带的传递依赖与项目既有依赖版本不一致,引发难以定位的冲突。本文按步骤讲清接入方法,并给出规避依赖冲突的完整思路。c****i2026-08-3110
- 定时任务的灵魂在于"什么时候执行"。接入云上服务时,开发者首先要弄清楚支持哪些触发方式,其次要掌握cron表达式的写法与时区的配置方法——这两个问题不搞明白,轻则任务跑的时间不对,重则凌晨本该执行的批处理整个白天都没有动静,等业务方发现时损失已经造成。本文依据官方文档,把函数计算定时触发器的三种触发方式、六段式表达式的结构与写法、时区的处理规则,以及容器定时任务的并发策略逐一讲透,并附上常见配置错误的核对清单。c****i2026-08-3140
- 企业官网是机构在互联网上的门面,承载着品牌形象、产品介绍与客户触达的多重使命。在安全建设上,为官网配备SSL证书早已是共识——它既保证访客与服务器之间的数据传输加密,也向外界传递“这是一家经过审核的正规机构”的信号。但打开证书服务页面,域名验证型、机构验证型、扩展验证型一字排开,价格逐级走高,很多负责人随即陷入纠结:企业官网到底选哪一档?经常被提到的OV与EV,在浏览器地址栏里的展示差异究竟是什么?这种差异值不值得为之付出更高的费用与更长的审核周期?本文从需求画像入手,把类型选择与展示差异讲透。c****i2026-08-2850
- 为网站配备SSL证书,如今已是安全建设中的常规动作。不过,真正面对证书服务页面时,很多人会犯难:同类产品,报价从几十元到数千元不等,列表里还列着一长串附加项——有的写着高额担保,有的标榜专属服务,有的附带检测工具。哪些钱是必须花的?哪些项看着热闹、实际很少用到?作为开发工程师,如果只凭页面介绍做决定,很容易为用不上的功能多付出一截预算。本文从证书费用的构成入手,逐一分析哪些属于必要支出,哪些附加项的实际使用率偏低,帮助大家把钱花在刀刃上。c****i2026-08-2820
- 为网站部署SSL证书,是安全建设中最常规也最要紧的一步。真正进入选型阶段,开发者面对的第一个分岔,往往不是证书类型,而是品牌归属:市场上活跃的证书品牌,大体分为国产与海外两大阵营。两者的宣传各有侧重,参数表看起来大同小异,费用区间却有明显差别。很多人选完才发现,证书这类产品“选时三分钟,用后两三年”,真正拉开体验差距的,是平日里不起眼的售后支持——证书到期忘了续、私钥意外泄露、服务器迁移后证书部署异常,这些时刻能不能快速找到人、拿到答案,直接决定业务中断多久。本文先厘清两类品牌的差异根源,再深入剖析售后支持渠道与响应时效的真实差距,帮助大家按自身情况做出稳妥选择。c****i2026-08-2810
- 为网站配备SSL证书,申请环节看似只是填个表单、点个提交,实际背后存在多条路径。选择哪条路径,决定了验证的深度、签发的速度、需要准备的材料,也决定了后续续期的便捷程度。在这些路径中,“在线签发”与“邮件确认”是两类经常被提及、却最容易被混淆的方式:一个走全自动协议交互,几分钟出证;一个靠人工点击确认信,留下可查的记录。不少初次申请的人分不清两者的边界,要么明明可以自动签发却反复等邮件,要么需要留痕确认时漏掉了关键环节。本文系统梳理证书申请的几种方法,把在线签发与邮件确认的流程拆开细讲,并给出按需选择的依据。c****i2026-08-2800
- 大模型从训练到推理,要经历多轮实验。每一次实验换一批数据、改一组超参、调一次结构,都会产出不同的训练结果。随着实验越积越多,问题就来了:一个月前跑出来的那个效果最好的模型,当时用的是哪份数据、哪版代码?线上正在服务的推理模型,对应的是哪次训练产物?这些问题如果不提前管理,到了需要复盘或回退的时候就会无从查起。全链路系统把训练和推理串在一起,版本管理的难度比单纯做训练时更高——因为训练产物和推理模型之间还需要建立可追溯的对应关系。本文围绕实验版本管理和训练推理回溯两个话题,从版本管理的对象、标识方式、产物追踪和回溯机制展开梳理。c****i2026-08-2540
- 科研算力平台可以让研究人员像使用个人电脑一样操作远程的GPU服务器。很多平台都提供了图形化远程桌面功能,用户通过浏览器就能打开一个完整的Linux桌面环境,在里面运行需要图形界面的科研软件。至于连接方式,多数现代科研算力平台优先提供纯浏览器访问,不需要在本地安装任何客户端;同时也会保留本地客户端作为备选,用于追求更高画质或更复杂交互的场景。下文从平台是否支持远程桌面、纯浏览器方案、本地客户端方案、两种方式的取舍、典型科研场景的选型、使用注意事项六个层次展开。c****i2026-08-2510
- 企业在引入大模型能力时,常常会问一个问题:服务系统到底能接哪些模型?手里已经微调好的自研模型能不能直接放上去?团队想用社区里的开源模型做对比实验,服务系统支不支持?这些问题的背后,是对服务系统模型接入能力的关注。本文从主流模型类型、开源与自研的差异、混接的技术基础和实践注意点几个方面展开梳理。c****i2026-08-2110
- 在一个多人共享的算力集群里,任务排队是常态。训练任务、推理任务、数据预处理任务混在一起,按某种规则依次获取算力资源。大多数任务都能在合理的时间内等到资源,但有一种情况很让人头疼:某些任务始终排在队尾,无论等待多久都轮不到执行,这就是常说的任务饿死。饿死不会让系统崩溃,也不会产生错误结果,但它意味着投入的算力白白闲置——任务提交了却永远跑不起来。本文围绕任务饿死这个话题,从它的成因、常见调度策略、优先级与配额的配置方法等几个方面展开梳理。c****i2026-08-2110
- 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。c****i2026-08-2110
- 接入大模型推理服务之后,开发者最先接触到的概念往往是Token。发一次请求,系统返回结果,同时显示这次调用消耗了多少Token;上下文越长、输出越长,消耗越多。同样是表达一个意思,用中文写和用英文写,Token数量可能差出一倍;同样一段逻辑,写成代码和写成自然语言,消耗也完全不同。Token到底是怎么算出来的,中英文和代码在计费上有没有差别,这是很多开发者在接入推理服务时都会遇到的问题。本文围绕这个话题,从Token的定义、计算方式、语言差异、代码特点和成本控制几个方面展开梳理。c****i2026-08-21100
- 接入Token推理服务时,团队通常会在两种用量方式之间做选择:一种是按实际消耗逐笔结算,用多少算多少;另一种是以Token Plan的形式,预先投入一笔固定费用,换取一个周期内固定额度的Token用量。两种方式各有特点,适合的团队也不一样。用量稳定、预算明确的团队,Token Plan几乎是为它们准备的;而用量波动大的团队,往往会犹豫——波动这么大,选固定额度的方案会不会吃亏?本文围绕Token Plan的定位、适合的团队类型、波动场景下的适配方式以及选择考量展开梳理。c****i2026-08-2110
- 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。思念如故2026-08-2120
- 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。思念如故2026-08-2110
- 天翼云主机网络虚拟化底座是支撑云上业务流量安全可控运行的核心技术层,涵盖虚拟交换、流量隔离和安全组策略等关键机制。本文从虚拟网络底座的概念与设计目标出发,解析虚拟交换与流量转发机制,探讨安全组策略与流量隔离的设计原理,结合天翼云主机在网络治理方面的工程实践与运维经验,为企业在云网络架构设计和流量安全管理时提供可参考的技术方案,帮助构建安全可控的云网络环境与运维经验。c****82026-08-2100
- 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。c****i2026-08-2100
- 在智算环境里,GPU是昂贵且稀缺的资源,能不能把它用满、用对,直接决定项目的成本与进度。很多团队把注意力放在"能不能申请到卡"上,等到卡到手才发现:要么跑起来利用率很低、大量算力在空转,要么长期挂着一个没活干的实例,既占着资源又担心被系统收走。在息壤这样的智算体系里,GPU通常以实例或任务的形式对外提供,使用者既希望随时能查到每张卡的实时状况,也希望清楚什么样的状态会被判定为空跑、会不会被回收。现实中,一次训练任务结束后忘了关实例、或者脚本卡住导致卡空转,都是常见情况,弄清楚监控与回收的规则,比事后补救省心得多。本文从开发工程师视角出发,先讲清为什么要盯住GPU利用率,再说明在息壤上怎么把利用率看清楚,接着回答长期空跑是否会被回收,最后补充让算力利用更稳的做法与常见误区。按这个顺序读,你会对"怎么看、会不会被收、怎么用得更值"有清晰判断,动手前先把规则理清,能少走不少弯路。c****i2026-08-2100
- 大模型训练对底层硬件的依赖,常常被上层应用掩盖。过去很长一段时间,训练任务几乎只跑在某一种软件生态之上,大家习惯了那套接口与工具链。随着国产AI芯片的发展,越来越多团队开始关心:手上的训练环境,能不能直接用上国产芯片?如果要从原有体系迁过去,代价到底有多大?这类问题背后,是供应稳定、成本结构与技术自主等多重考量,并不是单纯比拼纸面参数。在智算体系里,训练任务通常运行在一套调度与框架之上,芯片只是其中一环,真正决定能不能迁、迁起来顺不顺的,是这一整套软件与工具是否跟得上。现实中,很多团队卡在"想迁但不敢迁",担心代码要大改、周期拉得太长、效果又难保证。也因此,把"支不支持"和"贵在哪"这两件事讲透,比单纯比较算力数字更有意义。本文从开发工程师视角出发,先讲清训练环境对国产芯片的支持方式,再系统拆解迁移成本究竟落在哪些环节,然后给出降低成本的路径、可参考的推进顺序与常见误区。按这个顺序读,你会对"支不支持、贵在哪、怎么省、怎么推"有清晰判断,动手前先把账算清,能少走不少弯路。c****i2026-08-2100
- 随着数字中国建设深入推进,人工智能技术已成为驱动产业升级和政务效能提升的核心引擎。在这一背景下,AI算力平台的选型不再仅仅关乎性能和成本,更上升到了国家安全、数据主权和技术自主可控的战略高度。特别是在政企采购领域,国产AI算力平台凭借其在信创合规方面的独特优势,逐渐成为首选方案。本文将从政策导向、技术自主、数据安全、供应链管理等维度,深入探讨国产AI算力平台的信创合规优势,以及政企采购为何对此格外看重。c****i2026-08-2100
- 算力互联调度平台的核心价值在于把分散在不同地域、不同运营商、不同硬件架构的算力资源整合成一个统一的资源池,然后根据用户任务的特性,自动选择最合适的计算节点来执行。这个“自动选择”的过程就是调度策略发挥作用的地方。调度策略决定了任务被分配到哪个节点、什么时候开始执行、以及如何与其他任务共享资源。成本优先、延迟优先、空闲优先是三种最基本的调度策略,但它们各自的适用场景、优缺点和实现复杂度截然不同。更复杂的生产环境还需要组合策略和动态调整机制。下文从调度策略的基本要素、成本优先策略、延迟优先策略、空闲优先策略、组合策略与优先级编排、实际选型中的权衡六个层次展开。c****i2026-08-2110
- 数据预处理是科研工作中重复性最高的环节。不同课题、不同实验、不同数据集,预处理步骤却惊人地相似:缺失值处理、异常值检测、标准化或归一化、特征编码、数据集划分。每一轮新实验开始,科研人员都要重新写一遍这些代码,调一遍参数,测一遍效果。更令人沮丧的是,上学期做过的一个预处理流程,这学期要用的时候已经忘了当时用的什么参数、什么顺序、什么阈值,只能凭记忆重新摸索。科研工具如果能把这些常用的数据预处理步骤存成可复用的模板,让科研人员像搭积木一样组合出自己需要的预处理流程,那将是效率的巨大提升。下文从模板的定义与结构、模板的构建与存储、模板的组合与编排、模板的参数化与定制、模板的共享与复用、模板的版本与演化六个层次展开。c****i2026-08-2010
- SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。c****i2026-08-2040
- 获取SSL证书时,用户支付的那一笔费用背后并不只是“一张证书文件”的工本费。在证书签发机构的服务体系里,价格通常覆盖了证书在订购周期内的签发服务、验证流程支撑、以及订购周期内不限次数的重新签发(Reissue)权益;而退款则是一条独立的售后边界,它和“重新签发免费”属于两套逻辑,不能混为一谈。开发工程师和运维在选型时如果只盯着单价,很容易在后续私钥泄露、服务器迁移、域名调整或签发后才发现选错时陷入被动。下文从重新签发的计费边界、重新签发与续费的区别、退款的触发边界、不同证书类型的差异、订阅制下的重签账期、选型时的核对清单六个层次展开。c****i2026-08-2010
- 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。c****i2026-08-2030
- 过去几年,大模型技术从实验室快速走向生产线,越来越多的政务、医疗、金融与科研机构开始尝试用人工智能改造业务流程。然而,摆在它们面前的现实难题并不轻松:自建算力集群投入大、周期长;把敏感数据传到公共环境又面临合规与安全的顾虑;即便硬件到位,模型微调、推理部署、应用搭建仍需要一整套工程能力。正是在这样的背景下,天翼云推出了“天翼云息壤智算一体机”——一款软硬一体、极具性价比的智算服务产品。它把强大的AI算力、一站式智算服务平台、预置的主流大模型以及面向行业的丰富应用,全部封装进一台可私有化部署的设备中,具备全栈国产化、快速交付、零管理节点、开箱即用等特性,能够为对数据安全和自主可控要求极高的客户提供私有化全场景的智算解决方案。本文将从行业背景、产品能力、技术认证与落地实践四个维度,系统科普这款产品到底解决了什么问题、由哪些关键技术构成,以及它如何在千行百业中发挥作用。思念如故2026-08-2030
共 1031 条
- 1
- 2
- 3
- 4
- 5
- 6
- 35
页
- 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
- 线上推理和实验室里跑模型完全是两回事。真实业务里,不同系统对推理的延迟、吞吐和稳定性要求差别很大:搜索推荐希望毫秒级返回,报表类任务可以慢慢算;核心业务不能受其他业务波动的影响。如果所有请求都涌向同一组实例,高峰时互相拖累,排查问题也分不清是谁造成的。把推理服务按业务分流、让不同模型各走各的实例组,是解决这类问题的常见做法。下面从分流的价值讲起,说说实例组怎么划分、路由怎么实现、资源怎么隔离,以及日常运维中需要留意什么。分流的思路说穿了就一句话:让重要的流量走稳,让重的流量走专,让新的流量先试。
- 提到算力集群,工程师往往会想到两种使用形态:一种是容器方式,任务打包在容器里,按需分配若干张卡,启动快、密度高;另一种是裸金属方式,整台机器连卡带网络直接划给使用者,资源独占、没有额外开销。两者各有擅长,训练大模型偏好裸金属的稳定与高速互联,在线服务和轻量任务则更适合容器的灵活。于是自然产生一个问题:同一套集群能不能两种形态并存,统一纳管?答案是肯定的,而且这正是当前许多算力系统的主流做法。下面聊聊混部的原理、管理方式和实践要点。混部的关键词是统一:统一资源视图、统一调度入口、统一运维口径,三个统一做到了,两种形态就能像一支队伍一样协作。
- 定时任务上线只是开始,能不能看到每一次执行的记录、失败了能不能及时知道,才是长期运维的关键。不少开发者的痛点正在这里:任务跑没跑、跑到哪一步、为什么失败,控制台上找不到直观的答案;等业务方反馈数据没有更新,才发现任务早已连续失败多轮。本文围绕控制台的执行历史查看能力与失败告警的配置方法,把可用能力、查看路径、保留策略与告警思路讲清楚,帮助大家建立起"看得见、叫得应"的运维闭环。
- 不少团队的管理后台基于Spring构建,希望把定时触发器的创建、查询、更新、删除等操作封装进自己的业务系统,而不是每次都登录控制台手动操作,这就需要把官方SDK接入Spring项目。接入过程本身不复杂,但两个环节容易出问题:一是客户端的初始化方式不当,埋下资源隐患;二是SDK携带的传递依赖与项目既有依赖版本不一致,引发难以定位的冲突。本文按步骤讲清接入方法,并给出规避依赖冲突的完整思路。
- 定时任务的灵魂在于"什么时候执行"。接入云上服务时,开发者首先要弄清楚支持哪些触发方式,其次要掌握cron表达式的写法与时区的配置方法——这两个问题不搞明白,轻则任务跑的时间不对,重则凌晨本该执行的批处理整个白天都没有动静,等业务方发现时损失已经造成。本文依据官方文档,把函数计算定时触发器的三种触发方式、六段式表达式的结构与写法、时区的处理规则,以及容器定时任务的并发策略逐一讲透,并附上常见配置错误的核对清单。
- 企业官网是机构在互联网上的门面,承载着品牌形象、产品介绍与客户触达的多重使命。在安全建设上,为官网配备SSL证书早已是共识——它既保证访客与服务器之间的数据传输加密,也向外界传递“这是一家经过审核的正规机构”的信号。但打开证书服务页面,域名验证型、机构验证型、扩展验证型一字排开,价格逐级走高,很多负责人随即陷入纠结:企业官网到底选哪一档?经常被提到的OV与EV,在浏览器地址栏里的展示差异究竟是什么?这种差异值不值得为之付出更高的费用与更长的审核周期?本文从需求画像入手,把类型选择与展示差异讲透。
- 为网站配备SSL证书,如今已是安全建设中的常规动作。不过,真正面对证书服务页面时,很多人会犯难:同类产品,报价从几十元到数千元不等,列表里还列着一长串附加项——有的写着高额担保,有的标榜专属服务,有的附带检测工具。哪些钱是必须花的?哪些项看着热闹、实际很少用到?作为开发工程师,如果只凭页面介绍做决定,很容易为用不上的功能多付出一截预算。本文从证书费用的构成入手,逐一分析哪些属于必要支出,哪些附加项的实际使用率偏低,帮助大家把钱花在刀刃上。
- 为网站部署SSL证书,是安全建设中最常规也最要紧的一步。真正进入选型阶段,开发者面对的第一个分岔,往往不是证书类型,而是品牌归属:市场上活跃的证书品牌,大体分为国产与海外两大阵营。两者的宣传各有侧重,参数表看起来大同小异,费用区间却有明显差别。很多人选完才发现,证书这类产品“选时三分钟,用后两三年”,真正拉开体验差距的,是平日里不起眼的售后支持——证书到期忘了续、私钥意外泄露、服务器迁移后证书部署异常,这些时刻能不能快速找到人、拿到答案,直接决定业务中断多久。本文先厘清两类品牌的差异根源,再深入剖析售后支持渠道与响应时效的真实差距,帮助大家按自身情况做出稳妥选择。
- 为网站配备SSL证书,申请环节看似只是填个表单、点个提交,实际背后存在多条路径。选择哪条路径,决定了验证的深度、签发的速度、需要准备的材料,也决定了后续续期的便捷程度。在这些路径中,“在线签发”与“邮件确认”是两类经常被提及、却最容易被混淆的方式:一个走全自动协议交互,几分钟出证;一个靠人工点击确认信,留下可查的记录。不少初次申请的人分不清两者的边界,要么明明可以自动签发却反复等邮件,要么需要留痕确认时漏掉了关键环节。本文系统梳理证书申请的几种方法,把在线签发与邮件确认的流程拆开细讲,并给出按需选择的依据。
- 大模型从训练到推理,要经历多轮实验。每一次实验换一批数据、改一组超参、调一次结构,都会产出不同的训练结果。随着实验越积越多,问题就来了:一个月前跑出来的那个效果最好的模型,当时用的是哪份数据、哪版代码?线上正在服务的推理模型,对应的是哪次训练产物?这些问题如果不提前管理,到了需要复盘或回退的时候就会无从查起。全链路系统把训练和推理串在一起,版本管理的难度比单纯做训练时更高——因为训练产物和推理模型之间还需要建立可追溯的对应关系。本文围绕实验版本管理和训练推理回溯两个话题,从版本管理的对象、标识方式、产物追踪和回溯机制展开梳理。
- 科研算力平台可以让研究人员像使用个人电脑一样操作远程的GPU服务器。很多平台都提供了图形化远程桌面功能,用户通过浏览器就能打开一个完整的Linux桌面环境,在里面运行需要图形界面的科研软件。至于连接方式,多数现代科研算力平台优先提供纯浏览器访问,不需要在本地安装任何客户端;同时也会保留本地客户端作为备选,用于追求更高画质或更复杂交互的场景。下文从平台是否支持远程桌面、纯浏览器方案、本地客户端方案、两种方式的取舍、典型科研场景的选型、使用注意事项六个层次展开。
- 企业在引入大模型能力时,常常会问一个问题:服务系统到底能接哪些模型?手里已经微调好的自研模型能不能直接放上去?团队想用社区里的开源模型做对比实验,服务系统支不支持?这些问题的背后,是对服务系统模型接入能力的关注。本文从主流模型类型、开源与自研的差异、混接的技术基础和实践注意点几个方面展开梳理。
- 在一个多人共享的算力集群里,任务排队是常态。训练任务、推理任务、数据预处理任务混在一起,按某种规则依次获取算力资源。大多数任务都能在合理的时间内等到资源,但有一种情况很让人头疼:某些任务始终排在队尾,无论等待多久都轮不到执行,这就是常说的任务饿死。饿死不会让系统崩溃,也不会产生错误结果,但它意味着投入的算力白白闲置——任务提交了却永远跑不起来。本文围绕任务饿死这个话题,从它的成因、常见调度策略、优先级与配额的配置方法等几个方面展开梳理。
- 大模型能力对外提供服务,最常见的方式是通过接口调用。调用方发送请求,服务端返回生成结果,按消耗的Token数量核算用量。这种模式的好处是门槛低——不需要自己部署推理环境,只需要一个接口地址和访问凭证,就能把大模型能力接入到自己的应用里。对于企业来说,选择Token服务时最关心两个问题:一是服务端支持哪些模型,能不能覆盖业务需要;二是团队自己微调出来的自研模型,能不能直接接入调用。本文围绕这两个问题展开,从Token服务的定位、支持的模型范围、自研模型接入的方式和注意事项几个方面梳理。
- 接入大模型推理服务之后,开发者最先接触到的概念往往是Token。发一次请求,系统返回结果,同时显示这次调用消耗了多少Token;上下文越长、输出越长,消耗越多。同样是表达一个意思,用中文写和用英文写,Token数量可能差出一倍;同样一段逻辑,写成代码和写成自然语言,消耗也完全不同。Token到底是怎么算出来的,中英文和代码在计费上有没有差别,这是很多开发者在接入推理服务时都会遇到的问题。本文围绕这个话题,从Token的定义、计算方式、语言差异、代码特点和成本控制几个方面展开梳理。
- 接入Token推理服务时,团队通常会在两种用量方式之间做选择:一种是按实际消耗逐笔结算,用多少算多少;另一种是以Token Plan的形式,预先投入一笔固定费用,换取一个周期内固定额度的Token用量。两种方式各有特点,适合的团队也不一样。用量稳定、预算明确的团队,Token Plan几乎是为它们准备的;而用量波动大的团队,往往会犹豫——波动这么大,选固定额度的方案会不会吃亏?本文围绕Token Plan的定位、适合的团队类型、波动场景下的适配方式以及选择考量展开梳理。
- 在人工智能走向行业落地的今天,越来越多企业与科研机构不再满足于直接调用现成大模型,而是希望基于自有数据训练或微调出更贴近业务的专属模型。然而,大模型训练涉及数据清洗、分布式并行、显存管理、故障恢复等多个环节,技术门槛与算力门槛都不低。天翼云息壤平台大模型训练体系,依托统一纳管的异构算力、一站式的训推工具链以及断点续训等关键技术,把复杂的训练工程封装为易用的平台能力,让企业和科研机构也能稳定、高效地完成从数据准备到模型导出的完整训练闭环。
- 过去,算力和网络是两套各自规划的系统:算力建在哪、网络怎么连,往往各算各的。结果就是——算力明明在西部,数据却在东部,跨域传输又慢又贵;任务要调度,网络却跟不上,算力空转。算网融合调度的出现,正是为了打破这种割裂:它把算力资源与网络资源一体规划、一体编排,让"数据少跑路、算力就近用"。天翼云息壤平台突破算网融合调度技术,融合多维算网要素,实现算网资源的高效统筹,为算力互联互通提供了新范式。
- 天翼云主机网络虚拟化底座是支撑云上业务流量安全可控运行的核心技术层,涵盖虚拟交换、流量隔离和安全组策略等关键机制。本文从虚拟网络底座的概念与设计目标出发,解析虚拟交换与流量转发机制,探讨安全组策略与流量隔离的设计原理,结合天翼云主机在网络治理方面的工程实践与运维经验,为企业在云网络架构设计和流量安全管理时提供可参考的技术方案,帮助构建安全可控的云网络环境与运维经验。
- 推理服务和模型训练是两类不同的任务形态。训练多集中在一段时期内跑完就结束,推理则是长期在线、随时有人调用,请求量随时段、活动、突发话题起伏明显。扩缩容,简单说就是根据请求多少,动态增减对外提供推理的实例数量:人少时收一收省资源,人多时加一加保体验。在息壤这样的智算体系里,推理服务通常以后台服务形式运行,面对流量高峰能不能自动加实例,是很多团队上线前最关心的问题。现实中,一次营销活动、一条热门内容,都可能让请求在几分钟内翻倍,若没有及时调整,轻则响应变慢、重则服务不可用。这正是扩缩容要解决的问题:让实例数量跟着请求走,而不是永远按最大峰值备着。本文从工程视角出发,先讲清为什么推理要重视扩缩容,再说明在息壤上怎么手动调整,接着回答流量高峰能否自动加实例,最后补充让扩缩更稳的做法与常见误区。按这个顺序读,你会对"怎么扩、能不能自动、怎么稳"有清晰判断。
- 在智算环境里,GPU是昂贵且稀缺的资源,能不能把它用满、用对,直接决定项目的成本与进度。很多团队把注意力放在"能不能申请到卡"上,等到卡到手才发现:要么跑起来利用率很低、大量算力在空转,要么长期挂着一个没活干的实例,既占着资源又担心被系统收走。在息壤这样的智算体系里,GPU通常以实例或任务的形式对外提供,使用者既希望随时能查到每张卡的实时状况,也希望清楚什么样的状态会被判定为空跑、会不会被回收。现实中,一次训练任务结束后忘了关实例、或者脚本卡住导致卡空转,都是常见情况,弄清楚监控与回收的规则,比事后补救省心得多。本文从开发工程师视角出发,先讲清为什么要盯住GPU利用率,再说明在息壤上怎么把利用率看清楚,接着回答长期空跑是否会被回收,最后补充让算力利用更稳的做法与常见误区。按这个顺序读,你会对"怎么看、会不会被收、怎么用得更值"有清晰判断,动手前先把规则理清,能少走不少弯路。
- 大模型训练对底层硬件的依赖,常常被上层应用掩盖。过去很长一段时间,训练任务几乎只跑在某一种软件生态之上,大家习惯了那套接口与工具链。随着国产AI芯片的发展,越来越多团队开始关心:手上的训练环境,能不能直接用上国产芯片?如果要从原有体系迁过去,代价到底有多大?这类问题背后,是供应稳定、成本结构与技术自主等多重考量,并不是单纯比拼纸面参数。在智算体系里,训练任务通常运行在一套调度与框架之上,芯片只是其中一环,真正决定能不能迁、迁起来顺不顺的,是这一整套软件与工具是否跟得上。现实中,很多团队卡在"想迁但不敢迁",担心代码要大改、周期拉得太长、效果又难保证。也因此,把"支不支持"和"贵在哪"这两件事讲透,比单纯比较算力数字更有意义。本文从开发工程师视角出发,先讲清训练环境对国产芯片的支持方式,再系统拆解迁移成本究竟落在哪些环节,然后给出降低成本的路径、可参考的推进顺序与常见误区。按这个顺序读,你会对"支不支持、贵在哪、怎么省、怎么推"有清晰判断,动手前先把账算清,能少走不少弯路。
- 随着数字中国建设深入推进,人工智能技术已成为驱动产业升级和政务效能提升的核心引擎。在这一背景下,AI算力平台的选型不再仅仅关乎性能和成本,更上升到了国家安全、数据主权和技术自主可控的战略高度。特别是在政企采购领域,国产AI算力平台凭借其在信创合规方面的独特优势,逐渐成为首选方案。本文将从政策导向、技术自主、数据安全、供应链管理等维度,深入探讨国产AI算力平台的信创合规优势,以及政企采购为何对此格外看重。
- 算力互联调度平台的核心价值在于把分散在不同地域、不同运营商、不同硬件架构的算力资源整合成一个统一的资源池,然后根据用户任务的特性,自动选择最合适的计算节点来执行。这个“自动选择”的过程就是调度策略发挥作用的地方。调度策略决定了任务被分配到哪个节点、什么时候开始执行、以及如何与其他任务共享资源。成本优先、延迟优先、空闲优先是三种最基本的调度策略,但它们各自的适用场景、优缺点和实现复杂度截然不同。更复杂的生产环境还需要组合策略和动态调整机制。下文从调度策略的基本要素、成本优先策略、延迟优先策略、空闲优先策略、组合策略与优先级编排、实际选型中的权衡六个层次展开。
- 数据预处理是科研工作中重复性最高的环节。不同课题、不同实验、不同数据集,预处理步骤却惊人地相似:缺失值处理、异常值检测、标准化或归一化、特征编码、数据集划分。每一轮新实验开始,科研人员都要重新写一遍这些代码,调一遍参数,测一遍效果。更令人沮丧的是,上学期做过的一个预处理流程,这学期要用的时候已经忘了当时用的什么参数、什么顺序、什么阈值,只能凭记忆重新摸索。科研工具如果能把这些常用的数据预处理步骤存成可复用的模板,让科研人员像搭积木一样组合出自己需要的预处理流程,那将是效率的巨大提升。下文从模板的定义与结构、模板的构建与存储、模板的组合与编排、模板的参数化与定制、模板的共享与复用、模板的版本与演化六个层次展开。
- SSL证书的部署是网站从HTTP升级到HTTPS的最后一步,也是很多开发工程师觉得“应该很简单但实际上总出问题”的一步。证书申请下来之后,拿到的是几个文本文件——证书文件、私钥文件、中间证书链文件。把它们放到服务器的正确位置,修改Nginx的配置文件,重启服务,HTTPS就应该生效了。但实际操作中,证书路径写错、中间链遗漏、权限设置不对、重定向配置缺失等问题层出不穷,导致HTTPS无法正常访问,或者浏览器提示证书不可信。本文从证书文件的组成与存放、Nginx配置文件的修改、HTTPS强制跳转的设置、证书链的完整性检查、部署后的验证方法、证书续期与自动化六个方面展开,帮助开发工程师把免费SSL证书稳稳当当地部署到Nginx上。
- 获取SSL证书时,用户支付的那一笔费用背后并不只是“一张证书文件”的工本费。在证书签发机构的服务体系里,价格通常覆盖了证书在订购周期内的签发服务、验证流程支撑、以及订购周期内不限次数的重新签发(Reissue)权益;而退款则是一条独立的售后边界,它和“重新签发免费”属于两套逻辑,不能混为一谈。开发工程师和运维在选型时如果只盯着单价,很容易在后续私钥泄露、服务器迁移、域名调整或签发后才发现选错时陷入被动。下文从重新签发的计费边界、重新签发与续费的区别、退款的触发边界、不同证书类型的差异、订阅制下的重签账期、选型时的核对清单六个层次展开。
- 为网站启用HTTPS不再是可以犹豫的选项,而是现代Web服务的底线要求。明文HTTP传输会让用户数据在链路中暴露,浏览器也会在地址栏直接标记“不安全”,进而影响访问信任与检索权重。免费申请SSL证书并自动部署到云服务器,核心是利用自动化证书管理协议完成域名控制权验证、证书签发、Web服务器配置写入以及到期前自动续期四个动作,让开发工程师在初次配置后几乎不再人工干预。下文从免费证书的发放逻辑、域名验证的两条路径、证书申请工具选型、自动部署到Nginx、续期定时机制、生产环境注意事项六个层次展开。
- 过去几年,大模型技术从实验室快速走向生产线,越来越多的政务、医疗、金融与科研机构开始尝试用人工智能改造业务流程。然而,摆在它们面前的现实难题并不轻松:自建算力集群投入大、周期长;把敏感数据传到公共环境又面临合规与安全的顾虑;即便硬件到位,模型微调、推理部署、应用搭建仍需要一整套工程能力。正是在这样的背景下,天翼云推出了“天翼云息壤智算一体机”——一款软硬一体、极具性价比的智算服务产品。它把强大的AI算力、一站式智算服务平台、预置的主流大模型以及面向行业的丰富应用,全部封装进一台可私有化部署的设备中,具备全栈国产化、快速交付、零管理节点、开箱即用等特性,能够为对数据安全和自主可控要求极高的客户提供私有化全场景的智算解决方案。本文将从行业背景、产品能力、技术认证与落地实践四个维度,系统科普这款产品到底解决了什么问题、由哪些关键技术构成,以及它如何在千行百业中发挥作用。
点击加载更多