针对AI智能体在实际部署中面临的高延迟与高昂Token成本问题,Unreal Labs推出了Unreal Agent框架。该框架通过完全异步的方式管理工具调用,消除了底层模型在处理等待、轮询和心跳信号时的负担,从而显著提升成本效率。

据官方数据,在真实工作负载和智能体基准测试中,Unreal Agent相较于Codex最高可节省40%的成本,相较于Pi最高可节省20%。其核心优势在于允许用户在不等待工具调用完成的情况下引导智能体,并在模型调用间隙调度更多工具任务,实现更高的并行度与资源利用率。

技术架构与设计理念

当前主流的智能体SDK往往基于本地会话或子进程假设,难以直接适配生产环境,且存在依赖树复杂、兼容性维护成本高等问题。Unreal Agent旨在构建一个领域无关的轻量级框架,通过极简的提示词工程和Token优化的工具结果,减少模型认知负荷。

在异步运行机制下,当Unreal Agent发出工具调用时,系统会立即记录“进行中”状态并继续后台执行,待任务完成后再将结果追加至会话日志并触发大语言模型(LLM)调用。这种设计在不破坏缓存的前提下,实现了低延迟的用户交互与高效的工具并行处理。

成本效率分析

Unreal Agent的成本优势主要源于两方面:一是极简的框架足迹,避免了子智能体或复杂工作流带来的额外开销;二是每回合模型执行更多的工具工作。通过清晰的异步调用模型,智能体能在单次模型调用中发起更多重型工具请求,避免在轮询等待中浪费Token。

基准测试表现

在使用GPT-6 Astra xhigh模型进行的多项基准测试中,Unreal Agent在保持竞争力的通过率同时,显著降低了总费用与输入Token数量。

Terminal-Bench 4.0

在该测试中,Unreal Agent与Codex的通过率均为57.9%,但总费用仅为1428美元,远低于Codex的2350美元和Pi的1827美元。其每轮输入Token数为1.73M,优于Pi的2.83M。

SWE-Atlas Codebase QnA

Unreal Agent以65.8%的通过率领先于Codex(63.3%)和Pi(64.0%),总费用控制在936美元,大幅低于Codex的1303美元和Pi的1033美元。

DeepSWE 1.1

在DeepSWE 1.1测试中,Unreal Agent取得72.4%的通过率,高于Codex的69.0%和Pi的69.6%。其总费用为1367美元,同样低于竞争对手。

Agents’ Last Exam · ALE-CLI

在此项测试中,Unreal Agent的完整通过率为30.0%,平均分为59.7,总费用217美元,均优于或持平于Codex和Pi的表现。

开发者支持

目前,Unreal Agent SDK已提供Go语言库,支持直接集成至代码库;同时提供类似claude -pcodex exec的可执行运行器,以及兼容Harbor的基准测试运行器。开发者可通过GitHub仓库获取相关资源并进行复现验证。