一张 GPU 卖 4 万美元,真正的账单在机柜后面

本文是「AI 低成本」系列的第 2 篇(共 8 篇)。

GPU 和 CPU,干的不是一种活

高端 GPU 之所以卖得贵,首先是因为它干的活儿跟普通计算设备完全不同。

CPU 像是个全能管家,擅长处理复杂逻辑和通用任务,运行操作系统、数据库和各种业务程序都不在话下;GPU 更像是一个超级方阵,擅长同时处理海量的相似计算,非常适合图形渲染、科学计算和大模型训练。

大模型训练本质上是对海量矩阵进行枯燥的重复运算,GPU 这种并行计算的天赋就成了胜负手。

拿英伟达的 H100 来说,它是专门为数据中心和 AI 训练而生的。它的核心价值不只是单张卡的峰值算力,更在于显存容量、显存带宽、张量计算单元、互联能力,以及那套护城河般的软件生态。虽然消费级显卡也能凑合算,但在高精度计算、长时间稳定性、多卡互联以及数据中心管理这些“硬指标”上,跟企业级 GPU 完全不是一个量级。

模型训练从来不是单打独斗,最烧钱的地方其实在于:成千上万张卡如何像一支军队那样高效协同。

3.5 万到 4 万美元,贵在哪里

一张高端 GPU 能卖到 3.5 万到 4 万美元,这个价格里包含了先进制程、复杂封装、昂贵显存、板卡设计、散热方案以及供应链的稀缺性。

它的芯片面积巨大,塞满了计算单元,还必须配上高带宽显存。对 AI 训练而言,高带宽显存是命门,因为模型参数和中间结果需要极速读写,一旦带宽跟不上,训练速度就会被活生生拖慢。

不过,买到 GPU 仅仅是个开始。

从一张卡到一座智算中心

企业把卡买回来后,还得配齐 CPU、主板、内存、存储、网络交换机、配电设备、机柜、散热系统、监控系统以及调度软件。

规模是这么堆起来的:

  • 八张 GPU 才能凑成一台 AI 服务器;
  • 几十台服务器才能填满一个机柜区;
  • 更多的机柜组合在一起,才叫智算中心。

到了这一步,问题已经不再是简单的买硬件,而是一场复杂的系统建设工程。

四笔隐形账单

电力

在数据中心的世界里,电力是最让人无法忽视的存在。GPU 全速运转时功耗惊人,多卡服务器没日没夜地工作,散发出的热量简直像个大火炉。

为了伺候这些“电老虎”,电力供应必须稳如泰山。机房里通常要配齐不间断电源(UPS)、储能设备和一套极其复杂的配电系统,就怕电压抖一下影响了计算。毕竟,训练任务一旦中途断掉,损失的不只是时间,还有大把的真金白银,严重时还得费劲去恢复任务状态。

散热

散热同样要命。以前靠风冷,用风扇吹空气带走热量,这在功率密度不高的时候还行。但现在 AI 服务器的功率密度蹿升,液冷开始成为主流。

液冷可不是随便接根水管那么简单,它背后是一整套冷板、泵、管路、换热设备,还得有漏液监测、运维标准和机房改造。

数据中心圈子里常用 PUE 来衡量能源效率,这个数越接近 1,说明除了计算设备本身,浪费在杂项上的能耗就越少。对于大规模 AI 集群,PUE 降下来一点,省下的都是实打实的运营成本。

网络

网络往往会成为拖后腿的那个瓶颈。在大模型训练里,成百上千张 GPU 得频繁交换参数和梯度。如果计算跑得飞快,网络传输却慢吞吞,GPU 就只能在那儿干等数据,这么贵的设备效率全给糟蹋了。

所以,高速交换机、网卡、光模块、光纤和通信协议全都挤进了 AI 产业链。别看一个小小的光模块在整座数据中心里价值占比不算最高,但它往往决定了整个集群能不能稳定、高速地沟通。

存储

存储的重要性也在悄悄抬头。训练数据得长期存着,样本得能快速读出来,模型版本要管理,日志要记录,甚至推理服务还得缓存用户的对话上下文和检索知识库。

这就分出了层次:热数据得能秒开,冷数据得能低成本存放。AI 火了之后,固态硬盘、机械硬盘、存储服务器和分布式文件系统,这些面孔又重新回到了聚光灯下。

账面算力不等于可用算力

把这些环节全部堆在一起,你会发现 AI 算力中心绝不是买几张显卡那么简单。它是一个由芯片、服务器、网络、电力、制冷、存储、运维和软件调度组成的庞大系统。任何一个环节掉链子,算力效率都会大打折扣。

账面上你有多少张 GPU,那只是理论上的数字;真正能派上用场的算力,还得扣掉网络损耗、任务排队、故障停机、散热限制和调度折损。

这也是为什么英伟达能坐稳霸主地位。它卖的可不光是 GPU 硬件,还打包了 CUDA 软件生态、通信方案、服务器参考架构和各种开发工具。AI 开发者们这么多年都是围着 CUDA 写代码,模型框架和工程工具也都是在英伟达的生态里长熟的。企业买英伟达的设备,买的是一种“确定性”——训练效率有保障,迁移成本也更低。

正因如此,高端 GPU 成了全球竞争里的战略物资。芯片制造、先进封装、高带宽存储(HBM)、出口管制、云服务租赁以及资本投入,这些因素交织在一起,左右着算力的供给。对很多公司来说,拿不到足够的芯片,就别想训练出最高规格的模型;而就算拿到了芯片,如果工程能力跟不上,也只能守着金矿却挖不出金子。

这解释了为什么 AI 公司愿意砸下重金去建设集群:他们追求的不只是一次训练的成功,而是持续迭代的底气。大模型从预训练到微调,从评测到正式上线,再从用户反馈到下一轮优化,每一步都离不开稳定的算力支持。竞争越是白热化,迭代周期就缩得越短,算力也就越像是一项必须长期经营的核心能力。

买到上限,买不到低成本

然而,资源越是昂贵,就越得讲究效率。企业可以用巨额资金买到能力的上限,却买不来低成本服务的本事。

模型上线后,如果每次回答都在亏钱,那么用户越多,经营压力就越大。算力中心固然决定了谁有资格进入高端局,但商业逻辑最终会追问:

  • 怎样用更少的算力完成同样的任务?
  • 怎样用更低的成本服务更多的用户?
  • 又该怎样把昂贵的设备转化为可持续的收入?

Comments

Popular posts from this blog

How to turn off Sass warning prompts in Nuxt.js projects

Configuring SSH Access to a Docker Container via an Alternative Port

Quickly Set Up a Cloud Database Using MongoDB Atlas