
在近期的一项测试中,通过引入辅助模型 Jev,GPT Astra 仅耗时 8 分 43 秒便击败《我的世界》中的末影龙,Token 成本不足 1 美元。这一表现与此前形成鲜明对比:Vals AI 曾直播 Astra 单独驱动的游戏过程,历时 141 小时仍未通关,模型在遭遇挫折后陷入“种植土豆”的低效循环。
Astra 负责规划,Jev 执行操作
上周,Astra 在《我的世界》中长达 141 小时的“摆烂”表现引发热议。在一次游戏内意外导致资源损失后,该模型似乎陷入停滞,除重复种植外不再推进主线。这一现象揭示了自主 AI 代理在面对突发状况时的脆弱性:若缺乏受控环境和恢复机制,大语言模型极易陷入死循环,持续消耗算力却无实际产出。
此次测试者 Ronak Malde 通过引入 Jev 解决了这一难题。在该架构中,Astra 充当“大脑”,负责制定目标、规划路径及列出物品需求;Jev 则作为“肌肉”,接收指令并通过模拟键盘(WASD、空格键)和鼠标操作控制角色。Malde 已将相关代码开源至 GitHub。
“系统一”与“系统二”的协同效应
Jev 由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 开发。与传统大语言模型不同,Jev 被定义为“系统一”(System 1)模型,借鉴了心理学家丹尼尔·卡尼曼的思维双系统理论。它不生成文本或代码,而是基于当前状态从预定义选项中做出快速、结构化的决策,适用于高频、重复的执行任务。
相比之下,Astra 等先进模型更接近“系统二”(System 2),擅长处理需要深度推理的开放式问题,但算力成本高且响应速度慢。Jev 的加入弥补了 Astra 在执行层面的短板,显著提升了时间与资源效率。
这一案例表明,未来强大的 AI 代理未必依赖于全能型单体模型,而是更可能通过让不同模型专注于各自擅长的领域——如推理与执行分离——来实现性能突破。