埃隆·马斯克计划到2026年底前,将Colossus 2集群现有的先进英伟达AI芯片规模扩大近一倍。

据悉,位于田纳西州孟菲斯的AI集群目前部署了11万块英伟达GB200处理器和44万块GB300处理器,总计55万块芯片。另有22万块GB300处理器预计将于下周全面投入运营,11月将再增加22万块。马斯克表示,若进展顺利,年底前可能还会额外增加22万块GB300芯片。

按照这一时间表,到12月底,Colossus 2的GB200和GB300处理器总数将达到121万块。即便未计入最后一批增量,该集群芯片数量也将达到99万块。这一规模远超SpaceX AI此前公布的2026年为孟菲斯设施配备100万块GPU的目标。SpaceX表示,Colossus集群为Grok AI模型提供核心算力支持。

集群建设与算力规模

马斯克同时披露了较旧的Colossus 1集群数据:包含15万块英伟达H100S、5万块H200S和3万块GB200处理器,总计23万块。

Colossus 2的建设速度与其规模同样惊人。SpaceX数据显示,第一个Colossus 2集群在91天内上线约11万块GB200处理器,算力约为210兆瓦;第二个集群在64天内上线11万块GB300处理器,算力为220兆瓦。下一阶段扩建将至少增加22万块GB300处理器,提供超过400兆瓦算力。

英伟达此前曾表示,Colossus 2将容纳超过50万块GPU。最新数据显示这一里程碑已被超越,且加速器数量可能在三个月内再次翻倍。

电力挑战与商业化

庞大的硅芯片集群消耗着惊人电力。独立研究机构Epoch AI估计,Colossus 2目前支持约946兆瓦的信息技术(IT)功率。不过,马斯克并未说明其年底时间表中的每块处理器是否都已具备充足的电力和配套基础设施。

目前,Colossus不再仅服务于马斯克的个人AI项目。该设施已向外部的AI业务提供计算能力,而SpaceX AI仍在继续扩大孟菲斯基地规模,以满足训练和运行日益“饥渴”的前沿模型需求。