换一把尺子之前,先立一道公式
从这一章开始,我们离开火箭,走进 xAI。马斯克 2023 年才成立这家 AI 公司,比 OpenAI、Google 晚了一大截。一个后来者,凭什么在两年里追到牌桌上?这一章我们只回答半个问题——训练一个大模型,拼的到底是什么——然后盯住其中最硬、也最容易被低估的一环:算力。至于「Grok 靠什么追上来」「排行榜有多少水分」,那是第 9、第 10 章的活,这里先按下不表。
先立一道糙但管用的公式。训练一个大语言模型,本质是让机器做天文数字级别的乘法和加法(更新神经网络里的参数),业内用 FLOP(floating point operation,浮点运算次数)来数这些运算。训练一个前沿模型,动辄要几十亿亿亿次 FLOP。而你能凑出多少运算量,可以粗略写成:
总算力 ≈ 芯片数 × 训练时间 × 每卡算力
这里的「芯片」,指的是 GPU(graphics processing unit,图形处理器)。它原本是打游戏时给画面做渲染的,专门干「同一种运算、成千上万份一起算」的粗活。后来人们发现,训练神经网络恰恰就是海量的矩阵乘法——同一种运算、成千上万份一起算——于是 GPU 阴差阳错成了 AI 时代的主力矿机。
用大白话说:想让模型更聪明,要么堆更多张卡(芯片数),要么让它们连轴转更久(时间),要么换更强的新卡(每卡算力)。三个乘数任意一个变大,你能投喂进去的「思考量」就变大。这就是为什么全世界都在抢 GPU。
但公式外面还压着两块沉甸甸的砝码。一是电力:每张卡跑起来都在烧电,几万张卡一起满载,就是一座小城市的用电。二是数据:卡再多,没有足够多、足够好的语料喂进去也是空转。这一章讲清前者——把电、把卡、把网络攒成一台能干活的机器;数据和算法留给下一章。
Colossus:几个月堆出一座算力巨兽
2024 年,xAI 在美国田纳西州孟菲斯,把十万级的 GPU 塞进一座厂房,起名 Colossus(意为「巨像」)。这是一个 集群——把海量服务器用网络连成一整台「超级计算机」的意思,你可以把它想成一间站满了矿机、却要像一个人一样协同思考的车间。
规模上,Colossus 一期就是约 10 万张 Nvidia H100(当时最强的训练卡之一),随后又追加 H200、下一代卡,很快扩到 20 万张 GPU 量级,是当时全世界数一数二大的单体训练集群。
但真正让业内倒吸一口凉气的,不是「大」,而是「快」。从破土到十万张卡开始训练,据称只用了约 122 天,几个月而已。要知道,同等规模的集群,别家常规要一两年才能落地。这个速度差,是这一整章的题眼。
钱能买来十万张卡,但钱买不来「几个月就让十万张卡一起跑起来」。速度,是这里唯一稀缺、也最能说明问题的东西。
为什么钱不能瞬间变成算力
很多人以为,AI 竞赛就是比谁钱多、谁下单早。钱当然是门票,但把一堆卡变成一台能稳定训练的机器,中间隔着三道极硬的工程骨头。每一道都不是「多花钱就能立刻搞定」的。
第一道骨头:电力
十万级 GPU 满载,是几十到上百兆瓦级的用电——孟菲斯这座园区据报道拉到了约 380 兆瓦,够几十万户家庭用。问题是,电网不是水龙头,说要几百兆瓦就立刻给你接上。新建变电站、拉专线、和电力公司谈容量,动辄要排队好几年。
xAI 的解法很马斯克:等不及电网,就自己发电。他们在现场架起一批移动式燃气轮机(烧天然气的小型发电机组),先把电顶上,再慢慢等正式供电到位;后来还配了大量 Tesla 的 Megapack 电池组做缓冲和备份,稳住那些用电忽高忽低的时刻。
这一步很聪明,但也别只唱赞歌:自带燃气轮机发电意味着额外排放,孟菲斯当地为此有过环保和空气质量的争议。这是「快」的代价,中性地摆在这里。
第二道骨头:散热
电烧进去,几乎原封不动变成热吐出来。十万张卡挤在厂房里,产生的热量惊人——散不掉,卡就会过热烧毁,或者自动降频(为了保命主动变慢),你花大价钱买的算力当场缩水。
靠吹风扇早就不够了。Colossus 用的是 液冷(用循环的冷却液直接贴着芯片把热带走,比空气导热高效得多),几十张卡一个机柜地做水冷。把这么大规模的液冷系统一次性建起来、不漏不堵、稳定运转,本身就是一项重工程。
第三道骨头:网络互联(最难的一道)
前两道解决的是「让每张卡活着」,第三道才是灵魂:让上万张卡像一个人一样思考。
训练一个模型时,这几万张卡不是各算各的。它们算的是同一个模型的不同部分,每算完一小步,就要把各自算出的梯度(可以理解为「这一步该往哪个方向、改多少」的修正量)互相交换、对齐,再一起迈下一步。这叫同步训练。
打个比方:一万个工人一起盖一栋楼,每砌几块砖就必须全体停下来对一次图纸、校一次进度,再一起砌下一层。只要有一个人手慢了,或者传话的通道堵了,全体一万人都得等他——整栋楼的工期就被这一个短板拖垮。
这就是为什么网络是最硬的骨头。几万张卡之间要用超高带宽、超低延迟的专用网络连起来(业内常用 InfiniBand 这类为超算而生的高速互联,或者顶配的高速以太网),把「传话」这件事快到几乎感觉不到。任何一张卡掉队、任何一条链路拥塞,都会像那个偷懒的工人一样拖慢整体。
更麻烦的是,卡越多,需要「对齐」的次数和通信量越大,掉队的概率也越高。规模每翻一倍,协同的难度不是加一倍,而是往上蹿。把十万张卡拉齐到能稳定同步训练,是整条链路里最考验软硬件功力的地方——也是最容易翻车的地方。
用尺子收一下:这是哪一层的本事
回到全书那三把尺子:口号、现金、物理。Colossus 落在哪一层?
它不是口号。「我们要造最大的集群」谁都会喊,但喊不出散热和网络。它也不只是现金——十万张卡的采购单确实要天量的钱,可如果只看钱,那所有大厂都买得起,凭什么是 xAI 在几个月里跑通?
它落在现金与工程之间那一层真本事上,而真本事的名字叫「速度」。供电、散热、互联、调试到能稳定训练,这一整套在几个月内咬合到位,是钱买不来的执行力。这是马斯克团队实打实「做对了」的一件事,不该被贬成「不就是砸钱嘛」。
但——这里必须给第 9、第 10 章埋一个钩子——请别把「集群大」直接当成「模型强」。
算力是必要条件,不是充分条件。有了十万张卡,只等于有了一台足够大的引擎;引擎能不能造出好车,还要看烧什么油(数据)、怎么设计传动(算法)、谁来调校(人才)。
Colossus 证明的是:马斯克能极快地把算力堆起来。它没有证明、也不可能单独证明 Grok 就是最好的模型。集群的「大」是一个可以称重、可以核对的物理事实;模型的「强」则是另一套要小心求证的东西——尤其当它被写进排行榜的时候。
所以这一章的结论很干净:在算力这道题上,马斯克确实做对了,而且做得又快又狠。至于这台巨兽最后喂出了一个多聪明的 Grok、那些漂亮的榜单成绩里又有多少是真功夫、多少是水分——翻页,我们接着拆。