2026年8月,OpenAI在Hot Chips大会上展示了其自研推理ASIC芯片Jalapeño。该芯片高度依赖AI技术,实现了极短的设计周期。随后,OpenAI硬件副总裁Richard Ho就芯片研发背景、技术路径及未来规划接受了采访。

核心驱动力:效率与全栈协同

Richard Ho指出,自研芯片的核心驱动力在于效率。面对数据中心功率容量的物理瓶颈,OpenAI旨在有限算力下最大化交付给用户的智能水平。鉴于训练成本主要由预训练承担,而用户感知的智能体现在推理侧的响应速度,Jalapeño专注于提供低延迟设备,并通过调整实现高吞吐量,从而降低推理成本。

针对“专为OpenAI工作负载优化”的观点,Ho予以澄清。他强调,Jalapeño的优势源于内部团队与研究人员的全栈协同设计,能够智能权衡软件、模型优化与硬件实现的取舍,而非简单地为特定模型硬编码。SemiAnalysis的InferenceX基准测试显示,该芯片不仅适用于OpenAI模型,也能高效运行任何基于Transformer的大语言模型。收到芯片后两个月内完成编程并展现高性能,证明了其通用性。

在供应策略上,Ho表示理论上任何人都可使用该芯片,但鉴于公司内部算力需求巨大且持续增长,OpenAI将优先保障自身供应,特别是随着日活用户增加及Codex等新能力的推出。

AI辅助设计:周期缩短一半

Jalapeño从立项到首次流片仅耗时约九个月,远低于传统流程所需的18至24个月。Ho确认,这一速度得益于Codex、Sol及Astra等AI模型的辅助,显著提升了工程师生产力,形成了人机协作的新范式。尽管团队推崇开源精神,但在最终验证阶段仍采用Cadence和Synopsys的标准EDA流程,以确保结果的准确性。

业界对这一AI辅助设计流程表现出浓厚兴趣。Ho表示,OpenAI不打算保密该技术,随着基础模型的迭代,公司将更具体地分享方法论,以提升行业整体生产力。

供应链与战略选型

在供应链方面,Ho坦言形势依然紧张。OpenAI早在两年前便积极与晶圆厂沟通锁定产能,目前处于相对有利位置。在搭配Jalapeño时,公司选择了Nvidia的Turing架构而非更新的Vera,主要出于风险控制和快速部署的考量,Turing架构成熟度高且合作伙伴经验丰富。

关于终极目标,Ho强调“北极星”指标是最低的基础设施成本。若自研芯片在性能和能效上具备优势,公司将优先使用;若第三方芯片更具性价比,也会纳入集群。这是一种务实的技术选型策略。

性能展望与量产节奏

在性能层面,Jalapeño硬件已支持推测解码(Speculative Decode)。Ho透露,内部单令牌预测性能已优于当前多令牌预测的最先进水平,一旦在生产环境部署多令牌预测,性能有望提升3至5倍。在长上下文窗口场景中,Jalapeño的表现也优于对比基准中的其他设备。

量产方面,今年剩余时间将进行小规模试产以验证生产环境,预计2027年实现大规模放量。对于下一代产品,OpenAI不会单纯按日历时间表迭代,而是等待技术在每瓦性能、延迟、HBM代际更替或光电集成等方面产生实质性飞跃,确保每一步都有显著改进。