在 DevDay 2026 活动上,OpenAI 正式推出 GPT-6.1 Sol。这款新模型主打高性价比,官方数据显示,其在代理式编码、计算机操作及专业工作流中的表现几乎与旗舰模型 GPT-6 Astra 持平,但标准输入和输出 Token 价格仅为 Astra 的五分之一。

GPT-6.1 Sol 是今年 9 月 22 日随 Luna 廉价版模型一同发布的 GPT-6 Sol 的升级版本。目前,ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise 及 Edu 用户均已可用,但主 ChatGPT 聊天界面尚未开放。开发者可通过 API 以 gpt-6.1-sol 的名称调用该模型。

“以五分之一的价格获得接近 Astra 的智能水平。”OpenAI 在公告中写道。

定价与速度

在 API 层面,GPT-6.1 Sol 的输入 Token 价格为每百万个 2 美元,输出 Token 为每百万个 10 美元。用于跨请求重用上下文的缓存输入价格为每百万个 0.10 美元,较标准输入价格低 95%,也仅为 GPT-6 Sol 缓存输入价格的一半。

此外,OpenAI 将在未来几天内于其 Ultrafast 层级提供速度更快的 Sol 版本。公司表示,Codex 中的 Token 生成速度最高可提升八倍。

基准测试表现

在针对真实代码库软件工程任务的 DeepSWE v1.1 测试中,Sol 以约五分之一的成本达到了与 Astra 相当的水平,成绩比 GPT-6 Sol 的最佳表现高出 6.4 个百分点。

在测试多步骤商业工作流的 AutomationBench 中,Sol 的成绩比 Anthropic 的 Opus 5.5 高出 2.2 分,而成本仅为其三分之一。在 OSWorld 2.0 计算机操作测试中,Sol 的成绩与 Astra 相差 2.1 分,但每项任务的成本约为 Astra 的七分之一。

在 Terminal-Bench Science 0.1 测试中,Sol 在最大努力模式下的平均任务成本为 5.47 美元,远低于 Opus 5.5 的 23.21 美元和 Astra 的 23.80 美元。尽管 Astra 仍以 68.1% 的最高分数领先,OpenAI 建议将其用于最困难的科学研究任务。

需要注意的是,上述测试由 OpenAI 在其研究环境或通过 API 运行自身模型完成,竞争对手数据则引用自对方公开报告。

准确率与安全性

在低推理努力下,OpenAI 表示 Sol 将包含事实性错误的回答比例从 11.4% 降至 7.7%。该测试使用了故意设置的难题,此前用户曾标记过早期模型在这些题目上的错误。

在一项安全测试中,Sol 有 2.1% 的情况未能告知用户其搜索工具出现故障,优于 GPT-6 Sol 的 4.9%,但略逊于 Astra 的 1.5%。OpenAI 指出,未发现 Sol 试图绕过自动安全审查员的行为,详细信息可参阅模型的系统卡附录。

背景方面,OpenAI 于 9 月 3 日发布了 GPT-6 Astra。由于未通过安全测试,该公司已取消原定于 10 月发布的 GPT-6.1 Astra 计划。