算力尽头是光 书架

第 01 章 / 共 12 章

第一章 · 一张GPU为什么等另一张

一台昂贵的计算机最令人心疼的状态,不是算错,而是等待。想象一百位厨师共同做一道菜:每个人切得飞快,却必须等隔壁传来配料和称重结果。再买一百把刀,未必能让晚餐提前。AI机房的光通信,解决的正是这条传菜通道。

算得快,把搬运变成了主角

GPU是擅长同时做大量相似计算的处理器。训练大模型时,工作往往拆给很多张GPU;各自算出的结果需要汇合,才能继续下一步。带宽是单位时间能运送多少数据,像道路每秒通过多少辆车;延迟是一次传递要多久,像第一辆车到终点的时间。拓宽道路不一定让第一辆车更早到达,两者不能混为一谈。

假设每一轮计算用8毫秒,交换数据用2毫秒,而且两者不能重叠,那么一轮需要10毫秒。换成快一倍的芯片,计算降到4毫秒,一轮仍需6毫秒,整体只快了约1.67倍。若交换也降到1毫秒,才得到完整的两倍提升。这是一个教学算例;真实系统会让部分计算和传输同时进行,但等待越多,网络升级越值钱的因果不变。

推理是用训练好的模型生成答案,也并不天然“不需要网络”。模型可能大到一张卡装不下;不同部分可能住在不同机器;一次请求还可能调用多个模型。反过来,若小模型完全放在一台机器里,外部通信就少。不能把“推理占比提高”直接翻译成光模块需求上升或下降,必须追问:每次请求的数据到底跨了几台机器?

先分三层,再数光

Scale-up是把一组处理器连得像一台大机器,强调低延迟和密集交换。Scale-out是把更多机器或机柜接入一个集群,强调规模。Scale-across则把相隔更远的数据中心连起来。它们是通信范围与组织方式,不是规定必须用铜还是光的材料说明书。

短距离铜连接很有竞争力:省去了电变光、光再变电的器件,安装和维护也熟悉。距离拉长、速率提高之后,铜线损耗和补偿电路的代价增加,光纤才越来越划算。因此一台全新的AI机柜里,可能既有铜线,也有跨柜光纤,更远处还有连接园区的光网络。把所有内部连接都计为光模块,会先把需求夸大一遍。

英伟达的互连产品页同时列有可插拔光器件、铜缆及共封装光学,正说明现实采购是按距离和系统约束配套的组合。[1] 研究产业时,先画清哪些线越过机柜边界,再统计这些线两头的器件,会比先猜“每卡配几个模块”稳得多。

一根线,不等于一个模块

光模块是把电信号与光信号相互转换的一组封装器件,常见外观是插在交换机或网卡上的银色盒子。一条两端都用可插拔模块的双向光链路,通常需要两只模块。双向,并不意味着再乘两倍:每只收发模块本来就同时包含发送和接收功能。

看一个刻意简化的集群:1,024台服务器,每台一条光链路接到第一层交换机,共1,024条;交换机之间另有512条光链路。一共1,536条,两端可插拔对应3,072只模块。这还没有加备件,也没有存储网络。若厂商给出的数字已经是两端端口数,就不能再乘二。

如果某些交换机端改成集成光引擎,光链路仍在,两端的光电转换仍在,却不再都是银色盒子。这时“可插拔模块只数下降”和“光通信带宽增长”可以同时为真。产业变化经常先改变采购清单的名字,再改变最终支出。

先数哪些数据需要走远,再数每根线的两个端点,最后判断端点长成什么产品。别从GPU收入直接跳到光模块只数。

本书要结清的账

后面会沿这条线打开模块、比较技术,再回到季度报告与厂商产能。我们会把资料分成三种:已经发生的事实、公司宣布的计划、为计算而设的情景。没有公开披露的客户名字、产品份额和合同价,会明确留空。留空并不是没有分析,而是让下一次新信息进来时,知道该填在哪个位置。

本书资料核验截至2026年9月9日;2026年尚未结束,2027—2028年更不能被写成已知结果。贯穿全书的问题只有一个:当AI预算继续增加,哪一种光学能力最先成为瓶颈,又由谁把解决瓶颈的价值留下来?

资料与核验

[1] NVIDIA,Optical Transceivers and Cables for AI Networking,产品页,访问于2026-09-09:https://www.nvidia.com/en-us/networking/interconnect/ 。本章数量均为教学算例,不是厂商出货预测。

算力尽头是光 · 蜜蜡
蜜蜡 著 · 串行写作与逐章复核 · 事实、规划与情景分别标注