The new GPT-5.6 family: Luna, Terra, Sol

Simon Willison

全新 GPT-5.6 家族:Luna、Terra、Sol

原文由 Simon Willison 發布,訂閱此部落格

OpenAI 最新旗艦模型今天早上正式全面上線,並推出三種尺寸:Luna、Terra 與 Sol(由小到大)。

新模型的定價以每百萬個輸入/輸出 token 計算,分別為 Luna 1 美元/6 美元、Terra 2.50 美元/15 美元、Sol 5 美元/30 美元。相比之下,Claude Opus 系列為 5 美元/25 美元,Claude Fable 5 則為 10 美元/50 美元,不過現在每百萬 token 的價格已不太能說明什麼,因為同一項任務在不同模型之間所消耗的推理 token 數量可能差異很大。

三款模型的知識截止日皆為 2026 年 2 月 16 日,皆有一百萬 token 的上下文視窗,以及最高 12.8 萬 token 的輸出上限。

OpenAI 最主要的效能宣稱聚焦於長時間代理任務的表現,其中一項評測顯示三款模型皆超越了 Claude Fable 5:

我們訓練 GPT-5.6,讓每個 token 都能完成更多有用的工作。在Agents’ Last Exam 這項涵蓋 55 個領域、評估長時間專業工作流程的評測中,GPT-5.6 Sol 以 53.6 分創下新高,超越 Claude Fable 5(adaptive reasoning)達 13.1 分。即使在中等推理強度下,它仍以約四分之一的預估成本領先 Fable 5 達 11.4 分。這種效率也延伸到更小的模型,而這正是讓智慧更普及、更可負擔的關鍵:GPT-5.6 Terra 與 GPT-5.6 Luna 以約十六分之一的成本就超越了 Fable 5。

有趣的是,Fable 5 在一項自行公布的評測中倒是大幅輾壓了 GPT-5.6 家族,那就是 SWE-Bench Pro,Fable 5 拿下 80%,而 GPT-5.6 Sol 僅有 64.6%。這或許可以解釋為何 OpenAI 會選在昨天發表這篇文章,特別點出他們在審核該評測時發現的問題:

鑑於這些結果,我們估計 SWE-bench Pro 中約有 30% 的任務是有缺陷的,並建議模型開發者仔細檢視結果

我已搶先試用過 GPT-5.6 Sol——它確實非常能幹,不過就我目前用 Anthropic 模型處理的那類複雜程式任務而言,還沒讓我覺得它比 Fable 更強。

和往常一樣,GPT-5.6 的模型使用指南裡有最有趣的細節。有不少新的 API 功能我還需要深入研究(大概也會加入到LLM 中),包括:

  • Programmatic Tool Calling 讓模型能夠「撰寫並執行用來編排工具呼叫的 JavaScript」——在我看來,這或許有助於彌合 MCP 與完整終端機工作階段之間的落差,讓模型能以有用的方式組合 CLI 工具。這也讓人聯想到 Anthropic 在其網頁搜尋工具中加入的dynamic filtering 機制,該機制允許在單一模型回合中針對網頁結果執行程式碼。
  • Multi-agent 讓模型能「啟動子代理以進行平行、專注的工作」——現在這種子代理模式已直接內建於核心 API 之中。
  • Prompt cache breakpoints 把 Claude 那套提示快取模式帶到了 OpenAI,讓你可以明確指定快取斷點的位置,而不必依賴 API 自動偵測。就我個人而言,我還是更偏好自動偵測(OpenAI 仍有支援),但想必如果你願意花心思設定,在最佳化成本上還是能省下一筆。
  • 現在你可以在圖片請求中設定detail: original,讓圖片在處理前完全不會被重新縮放。

這裡有一整頁共 18 張不同的鵜鶘圖——涵蓋三款模型在 none、low、medium、high、xhigh 與 max 六種推理強度下的成果。頁面上也列出了各自的 token 數量與換算成本——最便宜的是 gpt-5.6-luna 在 effort none 下僅 0.71 美分,最貴的則是 gpt-5.6-sol 在最高推理等級下達 48.55 美分。

九隻騎著腳踏車的鵜鶘拼貼圖,品質參差不齊

還有更多鵜鶘消息,如果你跳到今天早上的直播 17:50 的位置,就會看到 OpenAI 自家展示的 3D 鵜鶘,分別騎著三輪車、腳踏車、小馬,還有另一隻鵜鶘!

直播畫面截圖,顯示一隻鵜鶘騎在另一隻鵜鶘身上的 3D 模型

本文章由 muse-spark-1.2-contributor 進行翻譯

留言