
本周,OpenAI不再单纯强调下一代模型的智力上限,转而推销更廉价的思考能力。周二,该公司正式推出GPT-6 Sol和GPT-6 Luna两款新模型,定位均低于上月发布的旗舰产品GPT-6 Astra。尽管技术叙事并无新意,但其商业策略却极具攻击性:API价格较前身GPT-5.6的促销价直接减半,且这并非限时优惠,而是新的标准定价。
具体而言,GPT-6 Sol的输入价格为每百万Token 2美元,输出价格为10美元;GPT-6 Luna则更为低廉,输入仅需0.10美元,输出为0.50美元,其中输出成本降幅接近58%。OpenAI CEO Sam Altman直言,这些模型实现了“每Token半价,甚至每项任务成本更低”。这一动作时机微妙,恰逢Anthropic发布Claude Opus 5.5并同步降价。行业共识认为,竞争焦点已从突破智能天花板转向压低代理(Agent)的运行成本底线。
三级梯队:从昂贵专家到海量数据处理
GPT-6家族现已形成清晰的三级梯队。GPT-6 Sol作为主力机型,专为复杂编码、长期运行的代理任务、调试及数据分析设计;GPT-6 Luna则定位为处理海量数据的“机器”,适用于摘要、提取、分类及简短问答;而GPT-6 Astra仍作为昂贵的专家模型,处理最高难度的多模态和科学工作。
TechRepublic指出,这种划分直击工程痛点:更低的模型和缓存成本,使得让代理持有更多上下文、运行更长时间并在发票成为限制前尝试更多步骤变得切实可行。长期以来,高昂的Token消耗是代理项目的“无声杀手”,团队往往因重试成本过高而非模型愚蠢放弃项目。半价策略虽未根除这一问题,但显著移动了成本红线。
定价陷阱:27.2万Token的断崖效应
headline中的低价背后隐藏着复杂的计费逻辑。在GPT-6系列中,输出价格通常是输入价格的五倍,且缓存读取成本仅为新输入率的10%。然而,所有三款模型均存在一个关键的“断崖点”:一旦输入超过27.2万个Token,整个请求将重新定价,输入和缓存费率翻倍,输出价格上涨50%。
FinOps LLM的分析显示,当输入从27万Token增至30万Token(增幅11%)时,成本可能激增74%。对于不加监控任由历史记录增长的代理,这一红线极易触发。在实际对比中,一步包含20万输入Token(90%缓存)和2万输出Token的操作,Luna成本约0.014美元,Sol约0.276美元,而Astra高达1.38美元。若运行一万步,Luna总成本仅138美元,Sol为2,760美元,Astra则达13,800美元。相比之下,Claude Opus 5.5每步成本约0.52美元。这种算术差异使得模型路由成为关键的产品决策。
性能与争议:半价是否等于更高性价比?
OpenAI声称GitHub已通过更好的缓存机制获益,Copilot在处理数十亿次请求时,超半数提示词Token无需重新处理。在基准测试方面,OpenAI数据显示GPT-6 Sol在AutomationBench和Agents’ Last Exam中,以更低的成本击败了Claude Opus 5。例如在DeepSWE v1.1中,Sol得分68.8%,略低于Claude Fable 5的69.9%,但成本低约80%。
然而,独立测试结果更为复杂。Artificial Analysis发现,Sol和Luna的智能指数大致维持GPT-5.6水平,成本分别降低约50%和60%,但这主要源于价格下调而非效率提升。事实上,两模型每项任务产生的输出略多,且在部分知识工作集(GDPval-AA)上出现性能下滑,表现为交付物缩短。ZDNET亦指出,OpenAI常将新模型的最大努力状态与对手的温和设置对比,存在“赛马”嫌疑。Sol在全力冲刺下仅勉强匹敌以一半努力运行的旧版Opus 5,其核心优势在于用五分之一的钱完成类似工作。
在事实准确性和对齐性方面,OpenAI称GPT-6 Sol的错误率约为GPT-5.6 Sol的一半,Luna在较高努力下以极低成本匹配了前代可靠性。对齐性测试显示,Sol执行未经授权行动的比例从52%降至11%,Luna试图绕过限制的行为率从77%降至42%。尽管有所改善,但部署至生产环境仍需人工介入。
市场影响:杰文斯悖论与预算现实
GPT-6 Sol和Luna正逐步向Plus、Pro及企业级用户开放,免费用户可在桌面应用中使用Luna。AWS Bedrock也同步上线这两款模型,定价与OpenAI直接费率一致。值得注意的是,原GPT-5.6中的中间层模型Terra暂时缺席,其负载可直接迁移至成本更低的Sol。
这场价格战并非孤立事件。Anthropic、xAi及中国实验室均在推出廉价智能模型。Ramp首席经济学家Ara Kharazian指出,这是一场双线价格战:中间层模型更便宜,高端模型直接降价。Citadel Securities报告称,Token成本下降足以推动用量增加,从而提升整体AI支出。这意味着期望AI预算减半的企业可能会失望:单位价格下降,但工作量扩大,总预算可能保持不变甚至上升,这正是数据中心里的“杰文斯悖论”。
对于开发团队而言,策略应转向衡量“每个接受结果的成本”而非“每百万Token成本”。建议将Luna用于提取和路由,Sol作为默认编码代理,仅在Sol失败时启用Astra。同时,必须将缓存优化作为首要设计选择,并密切关注27.2万Token的定价界限。
GPT-6家族的发布标志着一个文化转变:行业争论的焦点已从“代理是否准备好”转向“犯错的成本”。半价并未让工作免费,而是让工作变得连续。未来一年的竞争,不在于谁能思考得更艰难,而在于谁能思考得足够便宜,以至于企业停止关闭代理。
【星途科讯 图文丨周鑫雨 首发于ZAKER科技,转载请注明出处】