全新 GPT-5.6 系列:Luna、Terra、Sol
原文由 Simon Willison 于 发布,订阅该博客
OpenAI 最新旗舰模型于今早正式全面上线,提供三种规格:Luna、Terra 和 Sol(按规模从小到大)。
新模型的定价按每百万输入/输出 token 计费,Luna 为 1 美元/6 美元,Terra 为 2.5 美元/15 美元,Sol 为 5 美元/30 美元。作为对比,Claude Opus 系列为 5 美元/25 美元,Claude Fable 5 为 10 美元/50 美元,不过就同一任务而言,不同模型消耗的推理 token 数量可能相差甚远,如今单看每百万 token 的价格其实说明不了太多问题。
三款模型的知识截止日期均为 2026 年 2 月 16 日,上下文窗口为 100 万 token,最大输出为 12.8 万 token。
OpenAI 最主要的基准测试亮点在于长程智能体能力,有一项基准测试显示三款新模型均超越了 Claude Fable 5:
我们训练 GPT-5.6 的目标是让每一个 token 都产生更多有用的成果。在涵盖 55 个领域的长程专业工作流评测 Agents’ Last Exam 中,GPT-5.6 Sol 以 53.6 分创下新高,比 Claude Fable 5(自适应推理)高出 13.1 分。即便在中等推理强度下,它仍以约四分之一的预估成本领先 Fable 5 11.4 分。这种效率优势也延续到了更小的模型上——而小模型对于让智能更普及、更可负担至关重要:GPT-5.6 Terra 和 GPT-5.6 Luna 以约十六分之一的成本超越了 Fable 5。
有趣的是,在 SWE-Bench Pro 这一项自报基准测试中,Fable 5 却大幅碾压了 GPT-5.6 系列——Fable 5 得分为 80%,而 GPT-5.6 Sol 仅为 64.6%。这或许可以解释,为什么 OpenAI 昨天专门发表了这篇文章,点名指出他们在审计该基准时发现的问题:
鉴于这些结果,我们估计 SWE-Bench Pro 中约 30% 的任务存在缺陷,建议模型开发者仔细审视相关结果
我已提前试用了 GPT-5.6 Sol——它无疑非常强大,不过就我一直在用 Anthropic 模型处理的那类复杂编程任务而言,目前还没觉得它比 Fable 更胜一筹。
和往常一样,GPT-5.6 模型使用指南里包含了最值得关注的细节。其中有不少新的 API 功能有待我进一步探索(也可能会在 LLM 中加入相应支持),包括:
- Programmatic Tool Calling 允许模型“编写并运行用于编排工具调用的 JavaScript”——在我看来,这或许有助于弥合 MCP 与能够以实用方式组合 CLI 工具的完整终端会话之间的鸿沟。这也让人联想到 Anthropic 为其网页搜索工具新增的 dynamic filtering 机制,该机制允许在单轮模型调用中对网页结果执行代码。
- Multi-agent 能让模型“启动子智能体以并行、专注地完成工作”——子智能体模式如今已被直接内置到核心 API 中。
- Prompt cache breakpoints 将 Claude 那套提示缓存机制带到了 OpenAI,让你可以明确指定缓存断点的位置,而不必依赖 API 自动检测。就我个人而言,我更偏好自动检测(OpenAI 仍支持),不过如果愿意在这方面多花些功夫,想必能节省一定的优化成本。
- 现在你可以在图像请求中设置 detail: original,从而在处理前完全避免对图像进行缩放。
这里有一个包含 18 种不同鹈鹕的完整页面——涵盖三款模型在 none、low、medium、high、xhigh 和 max 六档推理强度下的生成结果。页面还列出了各自的 token 消耗和计算出的成本——最便宜的是 gpt-5.6-luna 在 none 档位下的 0.71 美分,最贵的是 gpt-5.6-sol 在 max 推理档位下的 48.55 美分。

还有一则鹈鹕相关的趣闻,如果你跳到今早的直播的 17:50 处,就能看到 OpenAI 亲自演示的 3D 鹈鹕——分别骑着三轮车、自行车、小马和另一只鹈鹕!

随机一篇博客
评论
登录后参与讨论