The new GPT-5.6 family: Luna, Terra, Sol

Simon Willison

新しいGPT-5.6ファミリー:Luna、Terra、Sol

原文は Simon Willison により に公開されました。 このブログを購読する

OpenAIの最新フラッグシップモデルが今朝一般提供を開始し、小さい順にLuna、Terra、Solの3つのサイズで登場した。

新モデルの料金は100万トークンあたりの入力/出力で、Lunaが1ドル/6ドル、Terraが2.50ドル/15ドル、Solが5ドル/30ドルとなっている。比較までに、Claude Opusシリーズは5ドル/25ドル、Claude Fable 5は10ドル/50ドルだが、同じタスクでもモデルによって推論トークン数が大きく異なるようになった今、100万トークンあたりの単価だけではあまり参考にならない。

3モデルとも知識カットオフは2026年2月16日、コンテキストウィンドウは100万トークン、最大出力トークン数は12万8000となっている。

OpenAIが最も強調しているベンチマークの主張は、長時間にわたるエージェント性能に関するもので、あるベンチマークでは3モデルすべてがClaude Fable 5を上回っているという。

我々はGPT-5.6を、1トークンあたりからより有用な仕事を引き出せるように訓練した。55分野にわたる長時間のプロフェッショナルなワークフローを評価するAgents’ Last Examにおいて、GPT-5.6 Solは53.6という新記録を達成し、Claude Fable 5(adaptive reasoning)を13.1ポイント上回った。中程度の推論(medium reasoning)でも、推定コスト約4分の1でFable 5を11.4ポイント上回っている。この効率性は小型モデルにも及んでおり、知能をより豊富で手頃なものにするために不可欠だ。GPT-5.6 TerraとGPT-5.6 Lunaは、約16分の1のコストでFable 5を上回っている。

面白いことに、Fable 5がGPT-5.6ファミリーを圧倒したとされる自己申告のベンチマークが一つあった。SWE-Bench Proで、Fable 5が80%を記録したのに対し、GPT-5.6 Solは64.6%だった。このことが、OpenAIが昨日、SWE-Bench Proを監査して見つかった問題点を指摘するこちらの記事をわざわざ公開した理由を説明しているのかもしれない。

これらの結果を踏まえ、我々はSWE-bench Proのタスクの約30%が破損していると推定し、モデル開発者には結果を慎重に精査することを推奨する

私はGPT-5.6 Solに一足早く触れる機会があったが、確かに非常に優秀ではあるものの、これまでAnthropicのモデルで試してきたような複雑なコーディングタスクにおいて、Fableより優れているという印象は今のところ受けていない。

例によって、GPT-5.6の使い方に関するモデルガイダンスに最も興味深い詳細が載っている。試してみる必要がある(そしておそらくLLMでもサポートを追加する必要がある)新しいAPI機能がいくつかあり、例えば以下のようなものがある。

  • Programmatic Tool Callingは、モデルが「ツール呼び出しをオーケストレーションするJavaScriptを構成して実行する」ことを可能にする。個人的には、これがMCPと、CLIユーティリティを有用な形で組み合わせられる本格的なターミナルセッションとの間の溝を埋めるのに役立ちそうに思える。また、Anthropicがウェブ検索ツールに追加したdynamic filteringの仕組みも思い起こさせる。これは単一のモデルターン内でウェブ検索結果に対するコード実行を可能にするものだ。
  • Multi-agentは、モデルが「並列で集中的な作業のためにサブエージェントを立ち上げる」ことを可能にする。サブエージェントパターンがコアAPIに組み込まれた形だ。
  • Prompt cache breakpointsは、Claude流のプロンプトキャッシュをOpenAIにもたらすもので、APIによる自動検出に頼るのではなく、キャッシュの区切りを明示的に指定できるようになる。個人的には自動検出(OpenAIでも引き続きサポートされている)の方が断然好みだが、手間をかければ最適化によるコスト削減が期待できるのだろう。
  • 画像リクエストでdetail: originalを指定できるようになり、処理前に画像がリサイズされるのを完全に回避できる。

18種類のペリカンを並べたフルページも用意した。3つの異なるモデルそれぞれについて、推論effortをnone、low、medium、high、xhigh、maxに振ったものだ。トークン数と計算上のコストも併記しており、最も安かったのはgpt-5.6-lunaのeffort noneで0.71セント、最も高かったのはgpt-5.6-solの最大推論レベルで48.55セントだった。

自転車に乗る9羽のペリカンがグリッド状に並んだ画像。品質はさまざま

さらにペリカン関連のニュースとして、今朝のライブストリームの17:50まで飛ばすと、三輪車、自転車、ポニー、そして別のペリカンに乗る3Dペリカンという、OpenAI自身によるデモを見ることができる。

ライブストリームの一場面、別のペリカンに乗るペリカンの3Dモデルが映っている

この記事は「muse-spark-1.2-contributor」を使用して翻訳されました。

コメント