OpenAI 在其自研 Jalapeño 芯片的部分设计环节中引入了自家 AI 模型,尽管工程师有时无法完全解释模型修改的具体逻辑。OpenAI 硬件团队负责人 Richard Ho 透露,在某一案例中,这种辅助设计方式节省了超过 13% 的芯片面积。Ho 坦言:“坦白说,我至今仍不完全信任它们。”

今年 6 月,OpenAI 展示了首款自研 AI 芯片,该芯片由博通(Broadcom)代工,专用于运行模型而非训练。8 月的 Hot Chips 大会上,OpenAI 公布了其与英伟达 GB300 的性能对比基准测试。Ho 于 2023 年加入 OpenAI,此前曾是谷歌 TPU 项目核心工程师,并在 D.E. Shaw Research 负责构建 Anton 超级计算机。

AI 介入逻辑布局

Ho 表示,研发团队推进速度极快,初期对芯片逻辑门数量的估算出现偏差。为保性能,团队将问题交由内部 AI 模型解决。当时这些模型未经微调,能力仅略高于公众可用水平。

模型处理的大部分代码基于 XLS 编写,这是一种将高级代码转换为芯片逻辑的工具,由现供职于 Ho 团队的 Chris Leary 在谷歌期间开源。相较于传统芯片设计常用的 Verilog 语言,XLS 代码风格更接近 Rust。Ho 指出,模型在软件层面的处理能力优于 Verilog,使用 XLS 有助于其更好地进行设计推理。

“黑盒”修改与严格验证

模型对源代码的部分修改缺乏明确理由。Ho 承认,因进度紧张,团队无暇深入分析这些修改为何有效。“我们在概念层面上并不完全清楚它究竟在做什么。”他说。

因此,所有修改仍需经过完整验证流程,最终芯片签核仍由标准设计工具负责。Ho 指出,一颗芯片包含数亿个逻辑门,即便模型准确率达 99.99%,对芯片设计而言仍不够精确。他认为,只要保持谨慎,这是一项值得承担的风险。此外,他明确表示不会因引入 AI 模型而裁减员工,而是利用其提高效率、加快产出。

一体化设计应对全链路

Ho 为该芯片的一体化设计理念进行了辩护。行业普遍将推理任务拆分至不同硬件:预填充(prefill)阶段读取提示词,解码(decode)阶段生成答案。而 OpenAI 采用单一芯片处理所有环节。

Ho 表示,当工作负载比例动态变化时,将数据中心容量锁定在固定比例存在风险。他承认,这种设计可能在实际部署中带来成本挑战,且超长上下文可能触及限制。该芯片通过将高带宽存储库直接连接核心,减少数据移动。Ho 预计,包括 GPU 制造商在内的竞争对手将效仿这一思路。尽管 OpenAI 是英伟达最大客户之一,但仍选择公开此设计。“因为我们仍然需要 GPU,而且我们希望 GPU 变得更好。”Ho 解释道。

在他看来,行业瓶颈并非功耗、内存或封装技术,而在于高管和投资者受过往泡沫影响趋于保守,未能看清 AI 发展上限。目前,Jalapeño 第二代芯片已在实验室进行验证,OpenAI 正朝着量产迈进。