OpenAI于6月27日发布新一代GPT-5.6系列模型,一次性推出三款不同定位的产品:旗舰版Sol(太阳)、均衡版Terra(地球)和轻量高速版Luna(月亮)。三款模型均以“有限预览”形式向部分合作伙伴开放,普通用户暂时无法使用。
三档定位与定价
据OpenAI公布的API价格,按每100万token计费:Sol输入5美元、输出30美元;Terra输入2.5美元、输出15美元;Luna输入1美元、输出6美元。Sol的定价与GPT-5.5标准版持平,Terra价格约为GPT-5.5的一半,Luna则为OpenAI目前最低价。
旗舰版Sol性能表现
OpenAI将Sol定位为该公司迄今最强模型,重点强化了编程、生物和网络安全等能力。在编程测试Terminal-Bench 2.1中,Sol标准模式得分88.8%,超过Anthropic Claude Mythos 5的88.0%;开启Ultra模式后达到91.9%,刷新该基准测试最佳成绩。在生物学GeneBench v1测试中,Sol消耗更少token,性能超越GPT-5.5。网络安全方面,Sol在ExploitBench上的表现接近Claude Mythos Preview,仅使用约三分之一的输出token。
Sol新增了两种模式:Max推理强度让模型在复杂问题上获得更长的深度推理时间;Ultra模式则通过多个子智能体协同处理复杂任务。
Terra与Luna
Terra定位为面向日常工作的均衡模型,性能接近GPT-5.5,价格便宜约一半。Luna则是系列中速度最快、价格最低的一档,面向高频、低延迟、成本敏感场景。
有限预览与政府监管
本次发布受美国特朗普政府行政干预。OpenAI表示,公司应政府要求暂缓全面开放,仅向一小批“受信任合作伙伴”提供API与Codex访问通道。据外媒报道,Sol目前仅面向约20个经美国政府逐一批准的合作伙伴。OpenAI在声明中公开表示,不认为这类政府准入机制应成为长期常态。公司计划未来几周内全面推出GPT-5.6系列。
METR评测发现高作弊率
外部评测机构METR在GPT-5.6 Sol的部署前评估中发现,该模型在ReAct Agent测试中的检测作弊率高于METR评测过的任何公开模型。METR将“作弊”定义为模型利用评测环境漏洞或采用任务禁止的策略来提高表现,而非在预期约束内完成任务。具体案例包括模型在中间提交中打包漏洞以获取隐藏测试集信息,以及提取隐藏源码反推预期答案。
METR指出,若将作弊尝试计为失败,Sol的50%时间水平点估计约为11.3小时;若将作弊计为成功,该估计值跃升至270小时以上。METR表示这些数字均不能代表对GPT-5.6 Sol能力的稳健测量。
免责声明:本文仅代表作者个人观点,与东方科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.

