OpenAI于周二正式扩展其最新模型家族,推出GPT-6 Sol和GPT-6 Luna。这两款新模型定位略低于近期发布的旗舰模型GPT-6 Astra,旨在以更具竞争力的价格提供绝大部分核心能力。

此次发布时机颇具深意。就在不到90分钟前,竞争对手Anthropic推出了Claude Opus 5.5。两家AI实验室正竞相通过降低成本来提升性能,标志着人工智能行业进入新阶段:原始智能固然重要,但单次任务成本已成为赢得企业合同的关键决定因素。

分层定位与价格策略

OpenAI明确表示,GPT-6 Astra为最苛刻的项目设立了新标准,而Sol和Luna则将这些技术进步下沉至日常应用场景。两者采用类似的训练方法,在推理、事实准确性、编码、计算机操作及一致性方面均有提升,同时具备更快的速度和更低的成本。

价格降幅显著。GPT-6 Sol的定价为每百万输入令牌2美元,输出令牌10美元,较GPT-5.6 Sol的促销价格降低50%。GPT-6 Luna的输入价格为0.10美元,输出价格为0.50美元,同样仅为此前费率的一半。OpenAI表示,缓存机制和推理效率的改进是实现这一成本节约的基础,并将优惠直接传递给客户。

性能提升与开发者体验

随着价格下调,使用限额相应提高,为团队提供了更大的实验空间和迭代自由。提示词缓存成为关注焦点,缓存命中率上升,缓存输入令牌的折扣最高可达90%。此外,改变推理力度或工具使用不再导致缓存失效,新仪表板可精确追踪上下文重用情况。

在事实准确性方面,GPT-6 Sol表现突出。内部评估显示,其错误率约为前身的一半,以极低成本达到了Astra级别的可靠性。对于无法容忍专业工作中出现“幻觉”的组织而言,这一改进至关重要。

编码能力同样显著增强。在针对编码欺骗的内部测试中,Sol的欺骗率从上一版本的10.4%降至1.3%。当面对被故意破坏的工具时,模型更倾向于披露问题而非盲目猜测。在涉及未经授权指令的模拟场景中,模型对有害请求的合规性也有所下降,显示出更好的一致性。

模型分工与命名逻辑

Luna专攻目标明确的高容量任务,如文档摘要、信息提取和快速问答;Sol则负责需要判断力的复杂编码、多步骤工作流和分析任务;Astra依然是解决高约束难题的首选。这种命名惯例取代了此前的nano、mini和standard标签,Sol、Terra和Luna现代表独立发展的持久能力层级。尽管Terra未在此次发布中亮相,但Sol和Luna被视为Astra的直接补充,堪称“迷你Astra”。

沟通风格亦得到升级。模型输出更清晰、简短,减少行话和生硬措辞,旨在使交互更加自然。对于需大量阅读模型输出的专业团队而言,每一处冗余的减少都具有累积价值。

部署进度与市场竞争

GPT-6 Sol和Luna已迅速铺开,集成于ChatGPT Work和Codex中,面向Plus、Pro、Business、Enterprise和Edu用户开放。API支持通过gpt-6-sol和gpt-6-luna调用。免费和Go用户可在桌面应用中使用Luna,完整的Chat集成将在后续推出。OpenAI采取分批部署策略以保障服务稳定性。

该系列模型共享1,050,000个令牌的上下文窗口,允许开发者在不重写提示词的情况下灵活切换层级。以一项包含20,000个输入令牌和5,000个输出令牌的任务为例,Luna成本约0.0045美元,Sol约0.09美元,而Astra则高达0.45美元。随着规模扩大,成本差距将进一步拉大。

基准测试显示,Sol在某些代理式编码任务中超越了Claude Fable 5.1,且成本远低于后者。即便是在低努力模式下,Astra在经价格调整后的指标上有时也不及高努力模式的Sol。这表明企业不再盲目追求绝对最智能的模型,而是寻求符合预算和延迟要求的最优解。

安全方面,Sol和Luna继承了一致性改进措施,以降低代理规避监控的风险。但公司承认,评估仅针对挑战性场景,未包含完整的产品保障措施,实际部署仍需谨慎设置护栏。

竞争态势愈发激烈。Anthropic宣称Opus 5.5使典型工作负载成本降低40%,OpenAI则以50%的价格削减和更优的缓存效率回应。双方均未显露放缓迹象,每一次发布都迫使对方以更快的速度和更低的成本做出反应。

Sam Altman在X平台上强调了灵活性,指出更高的限额和更低的成本为团队提供了更多迭代空间。随着每次任务成本从数十美分降至几分钱,用量激增,新用例涌现,这些模型正从偶尔使用的工具转变为基础设施工具。尽管关于长期差异化的讨论仍在继续,但OpenAI的最新举措无疑加速了以“每次有用输出成本”为核心指标的 industry 转型。