
Google Cloud 今日正式推出 Gemini Agent。这是一款统一的 AI 助手,具备自主行动与代码生成能力,可在网页、移动设备及桌面端等各类设备上完成任务。
Gemini Agent 旨在实现“无处不在”的智能体验。用户可通过命令行、Google Workspace、Microsoft 365 或 Slack 等任意渠道随时访问,甚至无需专用界面即可在第三方应用中运行。
Google Cloud 首席执行官 Thomas Kurian 表示,Gemini 不仅能回答问题、处理知识性工作,还能创建图像媒体或将想法转化为成品。“你给予它目标而非指令,委派结果后即可查看完成的工作。”他指出,为实现这一能力,智能体需深度连接用户的个人工作流程、记录系统及企业控制措施。
持久化记忆与多模型编排
遵循 AI 行业持久化执行的趋势,Gemini Agent 在所有通信渠道及子智能体间保持单一的记忆、上下文和个人化设置。它如同记住用户所有对话的队友,并能衍生出拥有专属身份、专业知识、独立邮箱(@agents.company.com)及持久存储空间的子智能体。这些子智能体仅能访问用户或团队授权的上下文。
在模型选择上,Gemini Agent 提供高度灵活性,根据任务类型自动匹配最优模型:简单日常任务由轻量快速的 Gemini Flash 处理,长期复杂工作则调用 Argon 等旗舰前沿模型。目前,Anthropic 的 Claude 模型也已接入,其他领先的私有和开源模型将在后续推出。
底层技术:深度融合企业数据
Kurian 强调,Google 致力于提供全面的业务背景理解。Gemini 能够观察并整合定价、产品组合及部门规范等机构知识,基于公司数据提供有据可依的答案。
该系统安全连接 Confluence、Microsoft Office、Teams、Slack 和 Workspace 等协作工具,并通过 Git、Jira 等操作开发流程,接入 Salesforce、ServiceNow 等企业平台,以及 BigQuery、Databricks、Postgres 和 Snowflake 等数据库和桌面文件。
用户可构建可重用的“技能”,即作为指令、知识和工作流的提示词,教导智能体执行特定的多步骤任务。除了开箱即用的全球技能库,用户还可向共享的公司注册中心发布自定义技能,或要求智能体将任务转换为可重用模板。
Gemini Agent 具备持续学习能力,会话记忆在数天的交谈、协作及文档阅读中保持活跃,并不断更新对用户工作方式的理解。Google 表示,系统花费在学习用户行为上的时间与使用工具的时间相当。
针对特定领域,Google 已提供专业技能。例如在数据领域,Gemini 可扩展机器学习和工具功能,服务数据科学家和工程师。用户只需用自然语言描述结果,Gemini 即可生成 PySpark 代码、提供编辑测试笔记本,并自行训练模型及排查故障。对于业务用户,Gemini 可利用 BigQuery 报告技能构建实时运营报告,保存后的团队查询不会产生额外令牌成本,且答案经过验证保持一致。
精细化成本控制
尽管自 2024 年以来每令牌价格大幅下降约 98%,但企业 AI 用量激增。为此,Google 于八月宣布的灵活支出选项今日正式上线。
通过内部多模型编排,系统将复杂任务分解,由快速模型处理简单部分,前沿模型攻坚难点,从而降低整体成本。智能路由自动对企业工作负载进行分类,确保每个任务都在性价比最高的模型上运行。
此外,用户可在 Cloud Billing Console 中设置 AI 支出的硬性限制。Gemini 会监控令牌使用情况,一旦触发上限,智能体将暂停工作。如需恢复,用户需在控制台批准并接受超出预算上限的后果。由于跟踪按项目进行,企业可将 AI 成本分摊至特定部门,实现更细粒度的预算审计与规划。