企业级人工智能的普及正引发新的基础设施困境。除了模型选择过剩,核心难题在于:特定请求应由哪个模型处理,以及在何处运行。

红帽公司首席技术官办公室杰出工程师兼副总裁Stephen Watt指出,随着企业从小型AI试点转向大规模部署,推理成本成为难以忽视的挑战。他直言,许多企业在跨越试点阶段后面临“资金耗尽”的局面。

优步(Uber)便是典型案例。今年早些时候,该平台宣布仅在四个月内便用完了全年的AI预算。Watt将此视为成本危机的首个预警信号。

挑战部分源于企业访问模型的方式。通过中间服务调用Anthropic和OpenAI等提供商的模型虽能加速部署,却使得细粒度、实时的支出监控变得困难。在测试阶段,应用仅进行少量调用;但在实际生产中,跨系统运行的智能体可能因完成任务而发起重复推理请求,导致经济性问题凸显。

智能体悖论

Watt将这种现象称为“智能体悖论”。企业发现采用托管模型更为便捷,无需构建大量基础设施即可通过API访问强大模型。“使用他人的基础设施总是更快,但控制力也大大减弱,”Watt表示。

随着规模扩大,高昂的费用开始侵蚀利润空间。Watt指出,不从托管模型起步是不现实的,但长期依赖则代价巨大。这并非要求企业放弃前沿模型,而是改变其使用方式。

Watt建议根据AI任务所需的具体技能进行评估,识别哪些场景必须使用前沿模型,哪些可由其他模型胜任。红帽的开源vLLM推理服务器支持在企业基础设施上运行开放权重模型。以阿里巴巴的Qwen和Z.ai的GLM为例,此类部署有望显著降低相比托管前沿模型的推理成本。

然而,迁移至自管基础设施要求企业具备相应的操作系统技术能力,并确保应用表现良好,这使得模型选择与基础设施决策紧密关联。

路由成为控制层

在此背景下,推理路由进入架构设计核心。Watt将红帽的“模型即服务”层描述为推理网关或路由器,负责决定请求去向:托管的前沿模型、企业数据中心内的开放权重模型,或边缘设备上的模型。

这一决策不仅基于价格,还取决于模型在特定任务上的表现,以及部署环境对内存、延迟和吞吐量的限制。Watt以NVIDIA Jetson设备为例,指出内存是首要约束,若模型无法装入可用内存则无法运行;其次是延迟,其分析的边缘设备平均速率约为每100毫秒20个token。

而在数据中心,大型模型如月之暗面(Moonshot AI)最新推出的Kimi K3,则需要支持万亿级参数规模的复杂硬件配置。红帽的llm-d项目旨在分发推理组件,以更可预测的吞吐量运行大规模模型。

Watt展示了两个内部原型以验证该方法的經濟可行性。名为“Price Tag”的原型对请求进行语义分析并确定路由。在一个简单示例中,发送至顶级前沿模型的“你好”请求成本约20美分,而发送至自托管开放权重模型的成本不到1美分,仅涉及电力、冷却等常规数据中心开销。

另一个名为“Side-Eye”的原型利用前沿模型监督较便宜的开放权重模型。在编码工作流中,廉价模型制定计划,前沿模型审查并提供反馈。由于前沿提供商对输入token的定价通常仅为输出token的25%,这种将大型详细计划作为输入、仅获取简短审查作为输出的工作流,有效降低了整体成本。

混合AI

一旦引入请求路由,部署位置便成为统一计算的一部分。部分工作负载适合外部托管的前沿模型,其他则适合企业基础设施上的开放权重模型。

Watt表示,目前大多数混合式自管推理涉及可在单台服务器上运行的小型模型。对于需要复杂系统的大型模型,“模型即服务”基础设施可提供额外的路由层,在不同环境间分配请求。“混合只是拥有控制的另一种说法,”Watt评论道。

他建议企业假设需求会随时间变化。若底层基础设施能在不重建应用的情况下调整,公司便可灵活应对模型性能、成本或硬件要求的变化,避免反复承担切换成本。

成本与安全并行

同一基础设施层对安全性同样至关重要。Watt指出,CIO和CEO最关心的两大问题是成本与安全。当智能体在企业系统内行动时,权限提升等安全风险加剧,包括智能体获得超出预期的权限。

红帽的OpenShell项目旨在对智能体进行沙箱隔离,限制其对网络和文件的访问。这将成本与安全置于同一基础设施层:企业不仅需控制接收请求的模型,还需管控模型或智能体在处理请求后的行为权限。

因此,新兴架构的核心不再仅是为企业AI寻找单一模型,而是专注于控制AI请求的路径。