矿工的云 书架

第 04 章 / 共 14 章

第四章 · 为什么是矿工接住了这波

上一章我们说清了新云是种什么动物:它不按虚拟机切片卖,而是把成千上万张 GPU 用高速网线连成一整台超级计算机整块出租。问题来了——盖这么一台机器,谁有本事?答案有点反直觉:接住这波 AI 算力荒的,很多是挖矿的人。这一章要讲清楚,这绝不是巧合,而是因为挖矿这门苦活儿,恰好把干 AI 云需要的三块肌肉都练出来了。

先说清楚:矿工到底在干什么

为了讲明白,得先把"挖矿"这件事拆开。这里说的不是挖煤,而是 GPU 挖矿——用大量显卡去算一种数学题,谁先算出来谁就拿到加密货币奖励。在 2022 年之前,最赚钱的是挖以太坊(Ethereum,一种加密货币,当时用"拼算力"的方式发行新币)。

你可以把它想成:一屋子显卡二十四小时不停地掷骰子,谁先掷出一个符合条件的数,谁就能领一笔钱。掷得越快(算力越大)领钱概率越高。于是矿工的全部生意逻辑就变成一句话:怎么让尽可能多的显卡,尽可能便宜地、尽可能不停机地转下去。

注意这句话里藏着三件苦差事。第一,显卡耗电惊人,电费直接吃掉利润,所以你必须搞到全世界最便宜的电。第二,你得有地方摆这些卡、给它们通风散热供电,也就是得快速盖出机房。第三,几千上万张卡挤在一起日夜满载,坏卡、过热、掉线是常态,你得有本事大规模伺候这一屋子发烫的卡

现在把这三件事和上一章的 AI 云需求对一下——你会发现它们几乎是同一张清单。这就是本章的核心:挖矿练出的三块肌肉,正好是 AI 云的入场券。下面一块一块看。

肌肉一:搞到便宜电

先建立一个直觉:大规模算力的头号成本不是芯片,是电。一张顶级 AI 显卡(比如英伟达的 H100)满载时约耗 700 瓦,一整台几千卡的集群加上散热,动辄要吃掉几十兆瓦——兆瓦(MW)是功率单位,1 兆瓦大约是一千户普通家庭同时开空调的用电量。几十兆瓦,就是一个小镇的电。

矿工在挖矿时代,利润薄得像刀片,电价每度差一分钱,一年下来就是生死线。所以他们被逼成了"找电专家":哪里有水电站的富余电、哪里有电网用不完的谷电、哪里有别人不要的能源,他们就把机器搬到哪里。

最极端的例子是 Crusoe(一家从挖矿转做 AI 数据中心的公司)。油田打油时会伴生大量天然气,运不出去,只能就地点火烧掉——行话叫放空燃烧(flaring),白白烧掉还污染。Crusoe 干的事是:把这些本来要烧掉的气接进发电机,就地发电,就地挖矿。等于捡了一堆免费的、别人当垃圾的能源。它靠这套在美国好几个州和阿根廷铺了四百多个模块化机房、两百多兆瓦。

为什么这条肌肉对 AI 云值钱?因为 AI 训练同样是"电老虎",而 2024、2025 年真正卡脖子的已经不是买不到卡,而是拿不到电、并不上网(这本书第十章会专门讲)。一个练过"全球找便宜电"的团队,和一个从没为电发过愁的软件公司,谁更可能在两年里搞定几百兆瓦?答案很清楚。

肌肉二:快速盖机房

光有电还不够,卡得有地方住。这里要澄清一个外行的误会:数据中心不是盖个房子摆上机架就行。它是一套精密的物理工程——要把几十兆瓦的电稳稳送进来、要在卡满载发热时把热量抽走、要有备用电源保证不断电、要有网络布线。这些活儿又慢又重,跟写软件是两个世界。

而矿工天生就是干这个的。挖矿利润随币价剧烈波动,谁能更快把新机房建起来、更快把卡通上电开始转,谁就能在行情好的时候多赚。所以矿工被市场逼出了一种"抢工期"的建设能力:不追求豪华,追求快和便宜——模块化、标准化、哪里有电有地就地起一片。

典型的路径是 CoreWeave(如今最大的新云之一,2025 年 3 月在纳斯达克上市)。它的前身叫 Atlantic Crypto,2018 年前后是北美最大的以太坊矿工之一,在七个数据中心里塞了数千张英伟达显卡,还自己捣鼓散热方案。建机房、供电、散热、塞卡——这套本事它在挖矿时代已经练了好几年。2019 年它嗅到风向不对(以太坊迟早要抛弃 GPU 挖矿),干脆掉头去给缺卡的机器学习研究者租显卡。到 2025 年,它已经运营着 40 多个数据中心、约 850 兆瓦在用电力、约 25 万张 GPU。

这里的因果链很干净:先有了盖机房、供电、散热的硬功夫,转型时才只需要换"客户",不需要换"本事"。一个纯软件出身的团队要从零学会这些重工程,起步就慢了好几年——而在算力荒里,几年就是错过整个窗口。

肌肉三:大规模运维一屋子发烫的卡

第三块肌肉最不起眼,却最难。想象一个房间里塞了上万张显卡,全部满载、日夜不停、烫得能煎蛋。在这种状态下,坏卡不是意外,是日常——每天都有卡过热降频、掉线、彻底罢工。

对挖矿来说,一张卡停转就是一份钱在流失,所以矿工被迫练出一整套"大规模运维"的手艺:怎么快速定位哪张卡出了问题、怎么在不停整机的情况下换掉坏卡、怎么调风道和功耗让一屋子卡长期稳定地烫着转。这是一种蓝领式的、脏活累活的运营能力,写代码写得再漂亮也替代不了它。

为什么这条对 AI 尤其致命?训练一个大模型,是让几千张卡作为一个整体连续跑几周甚至几个月,中间只要有一张卡挂了、整台"超算"就可能卡住,几周的进度付诸东流。所以 AI 集群对"卡不能随便掉、掉了要秒级换上"的要求,比挖矿还苛刻。一个练过大规模伺候发烫显卡的团队,正好接得住。

把三块肌肉拼起来看

现在退一步,把这三样并排放:搞到便宜电、快速盖机房、大规模运维发烫的卡。你会发现一个惊人的事实——这既是挖矿的全部苦活,又是 AI 云的入场券,两张清单几乎完全重合。

这就解释了为什么是矿工接住了这波,而不是别人。它不是运气,是能力错配的结果:

换句话说,AI 算力这门生意,表面看是芯片和软件的故事,骨子里是一门能源加房地产加重运维的实体生意。谁把这套实体功夫练熟了,谁就有资格入场——而在 2019 到 2022 那几年,恰好是矿工把这套功夫练到了肌肉记忆的程度。

当然,肌肉对了,只是有了入场券,不等于稳赢。矿工手里有能力,但真正把这些能力猛地推向 AI 市场,还需要一个触发事件——2022 年 9 月,以太坊一夜之间抛弃了 GPU 挖矿,让这三块肌肉突然无处可用。那一天发生了什么、又是怎么把整个行业的显卡和人一起推向 AI,是下一章的事。

(本章数字为公开报道的量级:CoreWeave 前身 Atlantic Crypto 曾是北美最大以太坊矿工之一,2019 年转型做 GPU 云,2025 年 3 月纳斯达克上市;其规模约 40 多个数据中心、约 850 兆瓦、约 25 万张 GPU。Crusoe 以油田放空天然气发电起家,铺设两百多兆瓦模块化机房后转向 AI。具体数字随时间变动,此处取合理量级。)

矿工的云 · sissi
面向对世界有好奇心的人 · 费曼式写法 · 由多个 AI 代理撰写与互相审校