The new GPT-5.6 family: Luna, Terra, Sol

Simon Willison

새로운 GPT-5.6 패밀리: Luna, Terra, Sol

원문은 Simon Willison님이 에 게재했습니다. 이 블로그 구독하기

OpenAI의 최신 플래그십 모델이 오늘 아침 정식 출시됐다며, Luna, Terra, Sol 세 가지 크기로 제공된다(작은 순).

새 모델의 가격은 입력/출력 토큰 100만 개당 Luna $1/$6, Terra $2.50/$15, Sol $5/$30이다. 비교하자면 Claude Opus 시리즈는 $5/$25, Claude Fable 5는 $10/$50이지만, 이제는 같은 작업이라도 모델에 따라 추론 토큰 수가 크게 달라질 수 있어 토큰 100만 개당 가격만으로는 별로 알 수 있는 게 없다.

세 모델 모두 지식 컷오프는 2026년 2월 16일이며, 100만 토큰 컨텍스트 윈도우와 최대 12만 8천 토큰 출력을 지원한다.

OpenAI가 가장 크게 내세우는 벤치마크 주장은 장시간 에이전트 성능에 관한 것으로, 한 벤치마크에서는 세 모델 모두 Claude Fable 5를 앞섰다:

우리는 GPT-5.6이 토큰 하나하나에서 더 유용한 작업을 뽑아내도록 훈련했습니다. 55개 분야에 걸친 장시간 전문 워크플로를 평가하는 Agents’ Last Exam에서 GPT-5.6 Sol은 53.6점으로 최고 기록을 세우며 Claude Fable 5(adaptive reasoning)를 13.1점 차로 앞섰습니다. 중간 수준 추론에서도 예상 비용의 약 4분의 1로 Fable 5를 11.4점 차로 이깁니다. 이러한 효율성은 더 작은 모델로도 이어지며, 이는 지능을 더 풍부하고 저렴하게 만드는 데 필수적입니다. GPT-5.6 Terra와 GPT-5.6 Luna는 약 16분의 1 비용으로 Fable 5를 능가합니다.

재미있게도 Fable 5가 GPT-5.6 패밀리를 압도했다고 자체 보고한 벤치마크 중 하나는 SWE-Bench Pro로, Fable 5가 80%를 기록한 반면 GPT-5.6 Sol은 64.6%에 그쳤다. 이는 OpenAI가 어제 이 글을 공개해 해당 벤치마크를 감사하는 과정에서 발견한 문제점을 들어 SWE-Bench Pro를 specifically 지적한 이유를 설명해 줄지도 모른다:

이러한 결과를 고려할 때 SWE-bench Pro 작업의 약 30%는 결함이 있는 것으로 추정되며, 모델 개발자들이 결과를 면밀히 검토할 것을 권고합니다

나는 GPT-5.6 Sol을 미리 써볼 기회가 있었는데, 확실히 매우 유능하긴 하지만 지금까지는 Anthropic 모델로 해오던 종류의 복잡한 코딩 작업에서 Fable보다 낫다는 인상은 받지 못했다.

여느 때처럼 GPT-5.6 사용을 위한 모델 가이드에 가장 흥미로운 세부 정보가 담겨 있다. 살펴봐야 할(그리고 아마 LLM에서도 지원해야 할) 새로운 API 기능이 여러 가지 있는데, 예를 들면 다음과 같다:

  • Programmatic Tool Calling은 모델이 “툴 호출을 오케스트레이션하는 JavaScript를 작성하고 실행”할 수 있게 해준다 — 내 생각에는 MCP와 CLI 유틸리티를 유용하게 조합할 수 있는 완전한 터미널 세션 사이의 간극을 메우는 데 도움이 될 수 있을 것 같다. 또한 Anthropic이 웹 검색 툴에 추가한 dynamic filtering 메커니즘도 떠올리게 하는데, 이는 단일 모델 턴 안에서 웹 검색 결과에 대해 코드 실행을 허용한다.
  • Multi-agent는 모델이 “병렬적이고 집중적인 작업을 위해 서브 에이전트를 생성”할 수 있게 해준다 — 이제 서브 에이전트 패턴이 핵심 API에 내장된 셈이다.
  • Prompt cache breakpoints는 Claude식 프롬프트 캐싱을 OpenAI로 가져온 것으로, API가 자동으로 감지하도록 두는 대신 캐시 중단점을 어디에 둘지 명시적으로 지정할 수 있게 해준다. 개인적으로는 자동 감지(OpenAI에서 여전히 지원)를 훨씬 선호하지만, 공을 들인다면 최적화를 통한 비용 절감 효과가 있을 것이다.
  • 이제 이미지 요청 시 detail: original을 설정해 처리 전에 이미지가 전혀 리사이징되지 않도록 할 수 있다.

18가지 펠리컨이 담긴 전체 페이지가 여기 있다 — 세 모델 각각에 대해 추론 수준 none, low, medium, high, xhigh, max로 나눈 것이다. 토큰 수와 계산된 비용도 함께 나와 있는데, 가장 저렴한 것은 추론 수준 none의 gpt-5.6-luna로 0.71센트였고, 가장 비싼 것은 최대 추론 수준의 gpt-5.6-sol로 48.55센트였다.

자전거를 타는 아홉 마리 펠리컨이 격자 형태로 배열된 이미지, 품질은 제각각

펠리컨 관련 추가 소식으로, 오늘 아침 라이브스트림의 17분 50초 지점으로 가면 세발자전거, 자전거, 조랑말, 그리고 또 다른 펠리컨을 타는 3D 펠리컨에 대한 OpenAI 자체 데모를 볼 수 있다!

다른 펠리컨을 타고 있는 펠리컨의 3D 모델을 보여주는 라이브스트림의 한 장면

이 글은 muse-spark-1.2-contributor 모델을 사용해 번역했습니다.

댓글