五秒的计算瓶颈被压缩至1.8毫秒,原本导致通用编译崩溃的内存操作在11GB显存下流畅运行。一种混合分片策略在两个无法单独满足的并行约束间找到平衡——实时AI视频模型首次在非英伟达芯片上输出正确结果。

据Amazon Science于2026年9月25日发布的文章,亚马逊AWS Neuron Science团队与实时交互式AI平台Reactor合作,首次证明驱动互动游戏、机器人模拟和自动驾驶训练的自回归扩散视频模型,可在AWS Trainium加速器上以实时帧率运行。这一成果无需英伟达硬件,也无需重写整个软件栈。

靶向内核手术:绕过编译器瓶颈

实现这一目标的关键并非新硅片,而是针对通用编译器处理最差的三项操作进行的“靶向内核手术”。这种被称为“靶向内核对等”的策略,通过AWS的Neuron Kernel Interface (NKI) 直接访问NeuronCore指令集,用手工调优的代码替换特定瓶颈操作,同时保留其余部分的標準编译管道。

研究指出,Rolling Forcing模型在标准编译下面临三大难题:

  • 动态形状:滑动窗口KV缓存导致注意力长度变化,静态编译难以适配。
  • 三维旋转位置嵌入(3D-RoPE):通用编译器将其拆分为多个小内存传输,造成巨大开销。
  • 逐层KV缓存拷贝:每层读写缓存带来高昂延迟。

通过NKI定制内核,3D-RoPE的执行时间从5秒骤降至1.8毫秒,加速比达2,778倍;缓存拷贝操作从每层23毫秒降至1.9毫秒。优化后的管道仅占用11GB高带宽内存,而标准急切模式执行则因内存耗尽而失败。

混合并行与阶段批处理

为解决多核分配难题,团队采用了混合并行策略:在四个核心上应用张量并行(TP)分割注意力头,在两个核心上应用序列并行(SP)分割序列,既避免了纯TP的计算浪费,又保持了视频Token的空间关系。此外,VAE解码器通过空间分片实现了8.25倍的超线性加速。

针对去噪和缓存更新两种不同性质的前向传递,团队重构代码实施“阶段批处理”,将共享组件合并执行,解决了Trainium实例在轻量级缓存更新任务上的利用率不足问题。

商业验证:Decart与Reactor的案例

这一技术路径已获得商业层面的独立佐证。以色列AI初创公司Decart报告称,其Lucy模型在AWS Trainium3上的生成速度比同等英伟达GPU配置快四倍,成本减半。Decart已于2026年5月完成3亿美元B轮融资,估值近40亿美元,并与AWS Bedrock平台达成整合。

合作方Reactor则由前Luma AI CTO Alberto Taiuti和前Apple Vision Pro技术负责人Bryce Schmidtchen创立,于2026年5月筹集5900万美元。Schmidtchen表示,AWS的基础设施和Trainium路线图非常适合应对消费者规模互动AI的推理需求。

并非全面替代,而是精准突围

这是否意味着AWS已全面追上英伟达?答案是否定的。英伟达CUDA生态系统凭借15年的积累,在库的广度和开发者工作流支持上仍具巨大优势。但对于性能限制操作可被识别并替换的特定工作负载,Trainium与英伟达GPU之间的硬件差距可通过靶向工程弥合。

AWS Neuron Science团队强调,此次开发的NKI技术——包括动态形状处理、3D-RoPE自定义内核、混合分片及阶段批处理——具有通用性,适用于任何具备相同结构特征的自回归扩散模型。为推广这一生态,AWS已启动Trainium Frontier竞赛,鼓励开发者在Trainium硬件上探索新颖的语言模型训练技术。