斯坦福大学退休教授约翰·奥斯特豪特(John Ousterhout)正致力于一项使命:在数据中心机架和集群内部流量中弃用TCP协议。曾在Sun Microsystems构建系统、塑造数据库与操作系统核心思想的奥斯特豪特指出,尽管TCP成就非凡,但其设计已无法适应现代数据中心需求。

据媒体报道,奥斯特豪特在2026年10月1日的AI工程师世界博览会上表示,当GPU因等待微小消息而停滞时,这一曾连接互联网的协议显得力不从心。人工智能集群的工作负载特征已发生改变:除了模型训练阶段的大数据传输,推理任务和智能体系统更频繁地产生元数据传输、缓存查找等短促数据包爆发。毫秒级的延迟累积将导致数千美元的算力闲置。

Homa:基于消息长度的智能调度

奥斯特豪特的解决方案名为Homa。该设计源于Behnam Montazeri(现任谷歌高级工程师)2019年的斯坦福博士论文。奥斯特豪特退休后接过研究火炬,将其视为毕生使命。

Homa摒弃了TCP的字节流模型,将流量视为具有已知长度的离散消息(类似RPC)。这种对消息长度的预知能力实现了更智能的调度。其核心机制包括:

  • 接收方驱动的拥塞控制:发送方仅在获得接收方许可后发送数据,消除了传统TCP在队列堆积后的反应式退避,使接收方能掌握全局状况。
  • 最短剩余处理时间(SRPT)调度:利用现代交换机的多硬件优先级队列,短消息优先通过,长流程留在低优先级队列,紧急数据包可绕过拥堵。

基准测试数据证实了其优势。在80%利用率下的100 Gbps网络中,Homa处理短消息的第99百分位延迟仅为92微秒,而同等条件下TCP延迟为1.2毫秒,Homa速度快13倍。长消息的延迟也大致减半。

部署简便与生态挑战

这些数据印证了奥斯特豪特2022年在arXiv发表的论文《是时候在数据中心替换TCP了》中的观点。尽管网络架构师伊万·佩佩尔尼亚克(Ivan Pepelnjak)曾在2023年质疑称调优后的TCP或RDMA即可解决问题,但奥斯特豪特持续优化方案,最新的内核模块更新显示了其技术坚持。

Homa的部署门槛较低。工程师可从GitHub编译代码,在客户端和服务器加载内核模块,无需重启。代码可与TCP共存,支持逐个工作负载迁移,剩余TCP流量甚至因竞争减少而受益。目前,Homa已支持反向移植至Red Hat Enterprise Linux 8和9.5版本,奥斯特豪特正推进IETF文档起草及内核上游合并。一家大型金融服务公司已在生产环境中展开原型测试。

然而,推广仍面临巨大障碍。TCP承载了绝大多数Web流量和云工作负载,数十年的应用、中间设备及运营商知识均建立在其之上。替换协议栈需要框架所有者(如gRPC维护者)提供支持。此外,谷歌、Meta和微软等超大规模厂商已部署定制网络或RDMA变体(如RoCE),尽管这些技术在混合负载中仍存在缓冲区膨胀等问题,但厂商对其网络栈保护严密,标准化需时数年。

经济账倒逼变革

近期,奥斯特豪特相关演讲视频在YouTube获得超22万次浏览,工程师们广泛讨论其尾部延迟优势。随着AI基础设施成本攀升,闲置GPU时间成为昂贵浪费。奥斯特豪特在2023年更新的论文中警告,TCP的流导向和有序交付期望与数据中心现实冲突,难以通过修补解决。

行业是否会跟进尚待观察。但奥斯特豪特认为,当前的经济账已算不过来。传输协议的演变通常缓慢,但数据中心的运作经济学不同于公共互联网。当毫秒级延迟直接转化为硅基算力利用率时,经济因素可能迫使变革比预期更快到来。目前,Homa已准备就绪,只需一个模块的距离即可在任何基于Linux的集群中试用,关键在于运营商是否会在真实AI负载下验证其尾部延迟并采取行动。