GPT-5.6正式开放:三个型号同时发布,完整评测成绩揭示性能与成本新曲线

2026年7月10日

68

741

GPT-5.6正式开放:三个型号同时发布,完整评测成绩揭示性能与成本新曲线

经过数周的预览与内测,OpenAI于7月9日正式向全球开放GPT-5.6。此次发布一口气推出三个不同定位的型号——Sol、Terra、Luna,分别面向旗舰性能、均衡日常和专业级效率三个场景。据官方说明,ChatGPT、Codex和API将在24小时内逐步完成全球部署。这意味着全球开发者终于可以正式使用这一代产品。

核心叙事:每一美元买到更强性能

此次发布的命名体系也发生了重要变化。数字代表第几代,而Sol、Terra、Luna则代表能力档位。这意味着同一代际下,不同能力档位可以按各自节奏独立迭代,不必等待大版本号更新。这种更灵活的命名方式,反映出AI模型正在从单一旗舰模型向多层次产品矩阵演进的趋势。

评测成绩:效率提升的多维验证

理解这次发布的关键,在于抓住一条主线——从每个token中榨取更多智能,让每一美元买到更强的性能(Performance per Dollar)。这不是简单的性能竞赛,而是效率的全面升级。在评测中,真正反复出现的模式不是「谁分数最高」,而是「同样的分数,用更少的token、更短的时间、更低的成本」——这条曲线比排行榜第一名更值得研究。

科技改变生活

“Pimjolabs”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

通用智能与编程能力

在通用智能体评测Agents' Last Exam中,Sol获得53.6分创下新高,领先Claude Fable 5达13.1分。即使将推理档位调至中等,仍高出11.4分,而成本估算仅为其四分之一。更值得关注的是,Terra和Luna这两个更经济的型号同样超越了Fable 5,成本约为其十六分之一。 编程方面,在Artificial Analysis Coding Agent Index上,Sol开到最高推理档位后获得80分的新SOTA,比Fable 5高2.8分。真正的亮点在于:它使用的输出token不到一半、耗时不到一半、成本还降低了约三分之一。Terra在编程评测中略高于Fable 5,Luna则超越了Opus 4.8,两者的共同特点是:约三分之一的时间、约一半的输出token、约四分之一的成本。

知识工作与安全能力

在知识工作与计算机使用能力上,Sol在BrowseComp网页浏览评测中获得92.2%,在OSWorld 2.0电脑操作模拟中获得62.6%,均创下新SOTA。而在OSWorld上,它在超越Opus 4.8的同时,输出token减少了85%。 网络安全是此次提升最显著、也最需要理性看待的领域。ExploitBench上Sol达到273.5%的通过率(相比上代47.9%),SEC-Bench Pro达到71.2%(相比45.8%),ExploitGym两小时内的峰值通过率几乎翻倍至24.9%。但官方标注了几点重要前提:这些评测在降低防护的条件下进行,实际成本与延迟数据为模拟估算,且模型尚未跨越Critical阈值。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI