The new GPT-5.6 family: Luna, Terra, Sol

Simon Willison

全新 GPT-5.6 系列:Luna、Terra、Sol

原文由 Simon Willison 发布,订阅该博客

OpenAI 最新旗舰模型于今早正式全面上线,提供三种规格:Luna、Terra 和 Sol(按规模从小到大)。

新模型的定价按每百万输入/输出 token 计费,Luna 为 1 美元/6 美元,Terra 为 2.5 美元/15 美元,Sol 为 5 美元/30 美元。作为对比,Claude Opus 系列为 5 美元/25 美元,Claude Fable 5 为 10 美元/50 美元,不过就同一任务而言,不同模型消耗的推理 token 数量可能相差甚远,如今单看每百万 token 的价格其实说明不了太多问题。

三款模型的知识截止日期均为 2026 年 2 月 16 日,上下文窗口为 100 万 token,最大输出为 12.8 万 token。

OpenAI 最主要的基准测试亮点在于长程智能体能力,有一项基准测试显示三款新模型均超越了 Claude Fable 5:

我们训练 GPT-5.6 的目标是让每一个 token 都产生更多有用的成果。在涵盖 55 个领域的长程专业工作流评测 Agents’ Last Exam 中,GPT-5.6 Sol 以 53.6 分创下新高,比 Claude Fable 5(自适应推理)高出 13.1 分。即便在中等推理强度下,它仍以约四分之一的预估成本领先 Fable 5 11.4 分。这种效率优势也延续到了更小的模型上——而小模型对于让智能更普及、更可负担至关重要:GPT-5.6 Terra 和 GPT-5.6 Luna 以约十六分之一的成本超越了 Fable 5。

有趣的是,在 SWE-Bench Pro 这一项自报基准测试中,Fable 5 却大幅碾压了 GPT-5.6 系列——Fable 5 得分为 80%,而 GPT-5.6 Sol 仅为 64.6%。这或许可以解释,为什么 OpenAI 昨天专门发表了这篇文章,点名指出他们在审计该基准时发现的问题:

鉴于这些结果,我们估计 SWE-Bench Pro 中约 30% 的任务存在缺陷,建议模型开发者仔细审视相关结果

我已提前试用了 GPT-5.6 Sol——它无疑非常强大,不过就我一直在用 Anthropic 模型处理的那类复杂编程任务而言,目前还没觉得它比 Fable 更胜一筹。

和往常一样,GPT-5.6 模型使用指南里包含了最值得关注的细节。其中有不少新的 API 功能有待我进一步探索(也可能会在 LLM 中加入相应支持),包括:

  • Programmatic Tool Calling 允许模型“编写并运行用于编排工具调用的 JavaScript”——在我看来,这或许有助于弥合 MCP 与能够以实用方式组合 CLI 工具的完整终端会话之间的鸿沟。这也让人联想到 Anthropic 为其网页搜索工具新增的 dynamic filtering 机制,该机制允许在单轮模型调用中对网页结果执行代码。
  • Multi-agent 能让模型“启动子智能体以并行、专注地完成工作”——子智能体模式如今已被直接内置到核心 API 中。
  • Prompt cache breakpoints 将 Claude 那套提示缓存机制带到了 OpenAI,让你可以明确指定缓存断点的位置,而不必依赖 API 自动检测。就我个人而言,我更偏好自动检测(OpenAI 仍支持),不过如果愿意在这方面多花些功夫,想必能节省一定的优化成本。
  • 现在你可以在图像请求中设置 detail: original,从而在处理前完全避免对图像进行缩放。

这里有一个包含 18 种不同鹈鹕的完整页面——涵盖三款模型在 none、low、medium、high、xhigh 和 max 六档推理强度下的生成结果。页面还列出了各自的 token 消耗和计算出的成本——最便宜的是 gpt-5.6-luna 在 none 档位下的 0.71 美分,最贵的是 gpt-5.6-sol 在 max 推理档位下的 48.55 美分。

九只骑自行车的鹈鹕网格图,质量各异

还有一则鹈鹕相关的趣闻,如果你跳到今早的直播的 17:50 处,就能看到 OpenAI 亲自演示的 3D 鹈鹕——分别骑着三轮车、自行车、小马和另一只鹈鹕!

直播画面截图,显示一只鹈鹕骑在另一只鹈鹕上的 3D 模型

本文章由 muse-spark-1.2-contributor 进行翻译

评论