机器人的“大脑”应置于何处?

人工智能正从屏幕后的聊天机器人走向物理世界,机器人成为其最大载体。然而,行业尚处早期,硬件、模型及经济模型均未定型。与大语言模型(LLM)“模型优先、硬件适配”的逻辑不同,机器人领域受限于实时控制的时间约束和大规模部署的成本约束,必须让模型适应固定的廉价硬件。

具身智能的挑战与模型演进

当前通用机器人模型参数量多在数十亿级别,如Physical Intelligence的π0系列(30-50亿)、字节跳动GR-3(40亿)及英伟达DreamZero(140亿)。模型大小并非由缩放定律单一决定,而是受限于数据获取难度及硬件延迟要求。前沿模型已超出单体机器人承载能力,导致延迟和抖动成为核心瓶颈。

业界正探索混合路径:部分功能本地运行,部分卸载至数据中心。英伟达RoboTTT等新技术通过测试时训练(TTT)减小模型体积以适配端侧,但长远来看,利用数据中心共享算力摆脱端侧功耗限制更具潜力。

供应链现实:硅片与内存的效率博弈

供应链倾向于数据中心芯片。英伟达Blackwell系列占据主导,而机器人专用的Jetson产品线产量低、利润率较低,且在先进制程节点上需与数据中心GPU竞争产能。此外,DRAM资源日益被HBM挤占,使得依赖LPDDR的端侧方案面临扩展瓶颈。

效率分析显示,当每块GPU服务超过5-7台机器人时,共享数据中心方案在硅片和DRAM消耗上均优于每台机器人独立配备芯片。这意味着在大规模部署下,云端方案更具可扩展性。

总拥有成本(TCO)裁决:B300 vs Jetson Thor

基于英伟达RoboTTT模型的基准测试对比了三种情景:

  • B300卸载情景:单GPU服务12台机器人,综合TCO为18.63美元/小时。
  • RTX 6000 Pro卸载情景:单GPU服务4台机器人,综合TCO为15.61美元/小时。
  • Jetson Thor端侧情景:每台机器人独立部署,综合TCO为14.97美元/小时。

虽然端侧初始TCO略低,但利用率是关键变量。工业机器人利用率约40%,而共享GPU服务器利用率可达90%。计入利用率后,B300卸载方案的每PFLOP TCO仅为端侧方案的46%。除非部署规模极小,否则云端推理在成本上更具优势。

部署战场:各大厂商的策略分野

Boston Dynamics:拆分架构应对“太大的大脑”

为实现通用性,Boston Dynamics采用分层架构。System 1(视觉运动策略)在本地Jetson Thor上运行,满足低延迟要求;System 2(高层推理)卸载至Google TPU云端。这种拆分解决了前端模型过大无法装入机器人的问题,但也引入了网络可靠性挑战。

Agility Robotics & Verne Robotics:坚守端侧

Agility Robotics认为工厂无线环境恶劣,且安全认证要求决策本地化,因此将计算保留在机器人端,仅将编排等非实时任务上云。Verne Robotics同样因任务无需开放世界推理,选择端到端策略完全本地运行,以避免对外部连接的依赖。

Sunday Robotics & Weave Robotics:家庭场景的妥协

Sunday Robotics初期尝试云推理,但因家庭WiFi抖动严重导致成功率下降,最终转向完全本地推理。Weave Robotics亦选择在本地运行模型,同时利用上行链路上传数据用于训练和远程接管,以应对家庭网络的不可靠性。

攀爬“网络墙”:解锁云端推理的关键

网络是将推理移出机器人的最大障碍,主要体现为具身性带来的射频干扰、上行链路设计缺失及环境动态变化。要突破这一瓶颈,需从以下方面入手:

  • 修复环境:部署机器人感知型接入点,实施上行链路优先调度、位置感知波束成形及集中式计时,确保低延迟切换和多链路冗余。
  • 减轻负载:优化主板以支持4x4上行链路MIMO,并通过感知堆栈减少传输数据量。
  • 时间同步:实现车队亚毫秒级时间同步,使数据中心GPU能高效批量处理多机器人观测数据,最大化算力效率。

随着网络技术的进步和车队规模的扩大,云端推理的经济性和能效优势将愈发显著,推动更多部署从端侧向云端迁移。