全球最大AI超算内部首次曝光!马斯克19天组装10万块H100,未来规模还将扩大一倍

最近,马斯克又宣布了一条振奋人心的消息——集群即将扩展到20万张H100/H200显卡!

同时,ServeTheHome也发布了一条15分钟的视频,公布了这台超算的详情!
这台全球最大的AI超级计算机Colossus位于美国田纳西州孟菲斯,配备了10万个英伟达Hopper GPU,并由英伟达Spectrum-X以太网提供网络传输支持。
目前,Colossus的第一阶段建设已完成,集群全面上线,但这并不是终点。它将很快迎来升级,GPU容量将翻倍,新增5万块H100 GPU和5万块下一代H200 GPU。
Colossus正在用于训练xAI的Grok,并为X Premium订阅用户提供聊天机器人功能。

在训练超大规模的Grok时,Colossus展现了前所未有的网络性能。在网络结构的所有层级中,系统在流量冲突的情况下没有经历任何应用延迟降级或数据包丢失。
通过Spectrum-X拥塞控制,它保持了95%的数据吞吐量。这种性能水平无法通过标准以太网实现,标准以太网在传输中会产生数千次流量冲突,数据吞吐量仅能达到60%。
由于保密协议的限制,这台超级计算机的一些细节并没有透露。不过,像Supermicro GPU服务器等关键部件的介绍在视频中都有所涉及。
液冷机架

Colossus集群的基本构建单元是Supermicro液冷机架。
每个机架包含八台4U服务器,每台服务器配备八个英伟达H100,共计64个GPU。
八台此类GPU服务器再加上一个Supermicro冷却分配单元(CDU)及相关硬件,构成了一个GPU计算机架。
这些机架以八台为一组排列,共512个GPU,并通过网络连接,形成更大系统中的小型集群。

xAI使用的是Supermicro 4U通用GPU系统。
这是目前市面上最先进的AI服务器,有2个原因:其一是它的液冷程度;其二是设备的可维护性。
该系统被放置在托盘上,无需将系统从机架中移出即可维护。1U机架分流器可为每个系统引入冷却液并排出温热液体。快速断开装置让液冷系统可以迅速移除,甚至可以人工单手拆装;移除后,托盘即可拉出以便维护。
下图是一张该服务器原型的照片,展示了这些系统的内部构造。

上图SC23原型中的两个x86 CPU液冷模块相对常见。
特别之处在于右侧:Supermicro的主板集成了几乎所有HGX AI服务器中使用的四个Broadcom PCIe交换机,而非将其单独安装在另一块板上。Supermicro为这四个PCIe交换机设计了定制液冷模块。
其他AI服务器通常是在风冷设计的基础上加装液冷,而Supermicro的设计则完全从零开始,为液冷而打造,且所有组件均来自同一供应商。
打个通俗的比方,这类似于汽车——有些车型先设计为燃油车,之后再安装电动动力系统,而有些车型从一开始就是为电动车设计的。这款Supermicro系统就属于后者,而其他HGX H100系统则属于前者。
Patrick怒赞道:测评了各种各样的液冷系统设计,这款Supermicro系统遥遥领先于其他系统!
网络系统
打个比方,如果1GbE的普通家庭网络好比是一条单车道公路,那这个400GbE就像是一条拥有400车道的高速公路。而每个系统有9条这样的「高速公路」,相当于每台GPU计算服务器拥有9条这样的超宽带公路,总带宽达到3.6Tbps。
这个带宽甚至超过了2021年初顶级Intel Xeon服务器处理器在所有PCIe通道上所能处理的连接总量。
GPU的RDMA网络构成了该带宽的大部分。每个GPU都有自己的NIC。

在这里,xAI使用英伟达BlueField-3 SuperNIC和Spectrum-X网络。英伟达的网络堆栈中加入了一些独特技术,可以帮助数据绕过集群中的瓶颈,确保数据准确地传输到指定位置。
这是一个重大突破!许多超级计算机网络使用的是InfiniBand或其他技术,而这里采用的是以太网。
以太网是互联网的骨干,因此它具有极强的扩展性。这些庞大的AI集群已扩展到一些更小众技术未能触及的规模。对于xAI团队而言,这确实是一个大胆的举措。

除了GPU的RDMA网络外,CPU也配备了400GbE连接,但使用完全不同的交换结构。xAI为其GPU和集群的其余部分分别配置了独立的网络,这在高性能计算集群中是非常常见的设计。
除了高速集群网络外,还有低速网络用于管理接口和环境设备,这些都是此类集群的重要组成部分。
-
8 卡 5090 服务器、5090 推理机、5090 一体机部署实践,P2P 破解技术利弊分析,七号智算落地经验分享
AI 推理市场迎来爆发期,大模型落地从训练转向大规模商业化部署,降本增效成为行业核心诉求。消费级高端 GPU 凭借优秀的性价比,越来越多被投入推理、微调场景,8 卡 5090 服务器、5090 推理机、5090 一体机成为市场热门硬件方案,但 RTX5090 出厂默认关闭 P2P 直连功能,多卡协同存在天然性能瓶颈,P2P 破解技术也随之成为圈内重点讨论的技术方向,七号智算结合大量项目落地实践,对整套硬件方案与 P2P 破解做完整技术拆解。
넶0 2026-09-03 -
H200 租赁、B200 租赁、B300 租赁成为大模型落地核心底座,七号智算打造全栈算力服务
近期全球 AI 算力行业持续热度高涨,海外算力服务商披露千亿级算力签约订单,Blackwell 架构芯片交付节奏加快,国内大模型迭代速度持续提速,行业对于高端 GPU 算力的渴求进一步放大。受供应链管控、芯片产能影响,H200、B200、B300 等旗舰芯片硬件采购门槛居高不下,自建智算中心投入成本高、周期漫长,算力租赁模式正在成为众多企业、科研机构落地 AI 项目的主流选择,七号智算瞄准高端算力缺口,完成多型号旗舰算力资源布局,为市场提供弹性可落地的算力租赁解决方案。
넶0 2026-09-03 -
8卡5090服务器P2P破解技术深度解析,七号智算解锁消费级多卡算力新上限
随着开源大模型全面普及,中小AI团队、个人开发者及中小型企业的算力需求持续爆发。相较于价格高昂、交付周期长的专业数据中心服务器,8卡5090服务器凭借单卡算力强劲、性价比高、部署灵活的优势,成为模型微调、多模态推理、本地私有化部署的主流选择。但受限于厂商产品定位限制,原生8卡5090服务器存在多卡通信卡顿、算力利用率低的问题,而P2P破解技术成为释放多卡集群全部性能的核心关键。七号智算深耕消费级多卡服务器底层优化领域,结合行业热点应用场景,全方位拆解8卡5090服务器P2P破解的技术原理、落地价值与应用边界。
넶3 2026-08-31 -
算力租赁风口持续升温,B300租赁依托七号智算破解高端算力困局
2026年AI产业进入规模化落地的关键阶段,智能体迭代、多模态大模型升级、工业仿真、自动驾驶训练等各类场景全面爆发,市场对高端算力的需求呈指数级增长。算力已然成为数字经济时代的核心生产力,传统自建算力集群模式成本高、周期长、灵活性差的弊端彻底凸显,轻量化、弹性化的算力租赁模式成为行业主流选择。其中,搭载Blackwell架构的B300高端算力租赁服务异军突起,成为头部企业、科研机构、AI创业团队攻坚高端研发场景的核心依托,而七号智算深耕高端算力租赁赛道,凭借优质的B300算力资源与全链路运维服务,精准破解行业高端算力供给短缺、利用率低的核心难题。
넶4 2026-08-31
