该产品架构主要由一个智能体文件、三个核心工具以及交互表单构成。底层基础设施由 OpenComputer 支撑,负责调度智能体运行、管理微虚拟机(microVM)、处理模型网关请求,并通过会话 API 实现页面轮询。

核心组件与技术栈

智能体层:采用无服务器架构,使用 TypeScript 编写,通过 opencomputer deploy 命令直接部署。该设计摒弃了传统框架、消息队列或自建服务器的需求,实现了轻量化运行。

模型调用:经由 OpenComputer 模型网关接入 anthropic/claude-opus-5.5。单次视频生成任务约消耗 9 万输入 token 和 1.5 万输出 token,其中输出内容主要为 HTML 代码结构。

运行时环境:每个作业均在独立的微虚拟机中作为会话执行。环境基于 Amazon Linux 2023(arm64 架构),配置为 4 vCPU 和 8 GB RAM,预装 Node.js 22。作业启动时,首个工具调用会安装 Playwright 的无头 Chromium 浏览器及静态版 ffmpeg(耗时约一分钟),任务结束后虚拟机即刻销毁,确保环境隔离与安全。

工具链与渲染机制

工具定义:系统包含三个通过 defineTool 定义的函数:web_fetch 用于抓取页面文本、标题、主色调及字体信息;check_scene 负责加载页面并检测 JavaScript 错误及特定时间点的可见文本;render_video 则承担最终的渲染与上传任务。

确定性渲染:该方案不依赖视频生成模型。通过用虚拟时钟替换页面的 requestAnimationFrame、定时器、Date 对象及 CSS/Web Animations 时钟机制,确保每一帧均为确定性操作。视频规格为 1920x1080 分辨率、30 fps 帧率,JPEG 帧流经 libx264 管道处理,CRF 值设为 18。

存储与控制平面

安全存储:智能体本身不持久化任何密钥。表单生成仅限单一路径、有效期三小时的 Vercel Blob 上传令牌,并存入作业清单。工具通过作业 ID 获取令牌,最终生成的 MP4 文件以公开 Blob URL 形式提供。

控制流程:前端页面复用与 CLI 相同的 API 逻辑,通过创建会话、发送交互指令,并轮询 tool.started、tool.completed 及 turn.completed 等事件流来实时显示进度,直至检测到 Blob 中出现 MP4 文件即判定任务完成。