GPT-5.6 が、3つのモデルからなるファミリーとして Zero に組み込まれました。最も難しいマルチエージェント業務には Sol、日常的な実行にはバランス型の Terra、高速かつ大量の処理には Luna を選べます。
幅広いエージェント業務を振り分けるチームにとって、これは単一の新しいフラッグシップモデルよりも便利な選択肢になり得ます。すべての工程で最大の推論コストを払うのではなく、仕事に合ったモデルを選びながら、接続済みツール、ファイル、ブラウザアクセス、分離された実行環境、スキル、最後までやり切る仕組みを備えた同じ Zero 環境を使い続けられます。
Built-in ルートを選ぶと、VM0 がモデルへのアクセスを管理し、利用量をクレジットで計算します。すでに OpenAI API キーや ChatGPT/Codex サブスクリプションを利用しているチーム向けに、Zero はそれらのルートにも対応しています。
1つのファミリー、3つの使い分け
OpenAI は GPT-5.6 を、継続的に進化する能力階層として設計しました。数字はモデルの世代を表し、Sol、Terra、Luna は知能、速度、コストの異なるバランスを表します。

GPT-5.6 Sol:最難関の仕事向け
Sol はフラッグシップモデルです。より良い計画、丁寧な検証、並列作業によって成果が大きく変わる難しい仕事で選びます。
Zero の GPT-5.6 Sol 統合では、標準で Ultra 推論を使用します。OpenAI によると、Ultra は標準で4つのエージェントを並列に動かし、その結果を統合します。そのため Sol は、複数の独立した作業を含む次のような依頼に適しています。
- 大規模なコードベースを移行し、互換性をテストして結果を文書化する。
- 多数の情報源から市場を調査し、結果を批判的に検証して、意思決定に使えるブリーフを作る。
- プロダクトブリーフから完成度の高い UI を構築し、レンダリング結果を確認して、視覚面と機能面の問題を修正する。
- ログ、コード、チケット、ブラウザの状態を横断して本番障害を調査し、修正案を提示する。
Sol の VM0 Built-in 階層は $$$ です。短い返答すべてに使うのではなく、判断を誤ったときのコストが高い仕事に使ってください。
GPT-5.6 Terra:バランス型の主力
Terra は、繰り返し行う専門業務の有力な出発点です。OpenAI は Terra をバランス型の階層と位置づけ、公開 API のトークン単価が半分でありながら、GPT-5.5 と競争力のある性能を報告しています。
推論やツール利用は必要でも、Sol の最大計算量までは必要ない仕事に Terra を使います。
- 日々のリサーチ、競合モニタリング、複数ソースの要約。
- 定型的なコード変更、プルリクエスト分析、問題調査。
- レポート、ローンチ計画、顧客向けブリーフ、業務文書の作成。
- より抑えたコストで長いコンテキストを確実に扱う必要があるエージェントワークフロー。
Terra の VM0 Built-in 階層は $$ です。Zero がすべての環境で Terra を標準に固定するわけではありませんが、多くの汎用ワークフローで最初に試しやすいモデルです。
GPT-5.6 Luna:速度と処理量
Luna はファミリーで最も高速かつ低コストのモデルです。最大の深さよりもスループットや応答速度が重要な仕事に向いています。
Luna に適した処理の例は次のとおりです。
- 大量のチケット、リード、メッセージを分類して振り分ける。
- 形式が一定の文書から構造化フィールドを抽出する。
- 一次トリアージを行い、曖昧なケースだけ Terra や Sol に引き上げる。
- 短い要約や変換を大量に実行する。
Luna の VM0 Built-in 階層は $ です。ただし、安価に処理したいすべての仕事に適するわけではありません。OpenAI の長文コンテキスト評価では、非常に大きな入力からの情報検索において、上位2モデルとの差が大きくなっています。量が多く曖昧なコンテキストは Terra または Sol に任せてください。
ベンチマークから分かること、分からないこと
OpenAI はファミリー全体で高い結果を報告しています。しかし重要なのは単一の順位ではなく、モデルごとにどのようなトレードオフがあるかです。

コマンドラインのエージェントワークフローを評価する Terminal-Bench 2.1 で、OpenAI は Sol Ultra 91.9%、Sol 88.8%、Terra 87.4%、Luna 84.7% と報告しています。BrowseComp では、Sol Ultra 92.2%、Sol 90.4%、Terra 87.5%、Luna 83.3% です。
ルーティング上、より重要なのは長文コンテキストの結果です。OpenAI MRCR v2、8-needle、256K~512K では、Sol が 91.5%、Terra が 89.6% である一方、Luna は 41.3% でした。Luna は短く反復的な処理では優れた選択肢ですが、あらゆる業務で「小型の Sol」として扱うべきではありません。
これらはベンダーが公表した特定の評価であり、普遍的なランキングではありません。ベンチマークの結果は、テスト環境、ツール、推論設定、予算によって変わります。実際のワークフローでは順序が逆転する可能性もあるため、本番エージェントを切り替える前に、代表的なタスクで再評価してください。
GPT-5.6 と GPT-5.5、Claude Fable 5 の比較
実務で考えるべき問いは「どのモデルが勝つか」ではなく、「この工程で、どの挙動にコストを払う価値があるか」です。
| モデル | Zero での主な用途 | 特徴 | VM0 Built-in 階層 |
|---|---|---|---|
| GPT-5.6 Sol | 計画、並列実行、デザイン判断、検証が成果を左右する難しい多段階業務 | Zero では標準で Ultra を使用。コーディング、コンピューター操作、デザイン、リサーチ、長いコンテキストに最も強い GPT-5.6 階層 | $$$ |
| GPT-5.6 Terra | 信頼できる推論とツール利用を必要とする日常の専門業務 | 品質、速度、コストのバランス。長いコンテキストにも強い | $$ |
| GPT-5.6 Luna | 入力が一定で、必要に応じて上位モデルへ移しやすい高速・大量処理 | ファミリーで最も低遅延かつ低コスト。トリアージ、抽出、一括処理に最適 | $ |
| GPT-5.5 | すでに検証済みで、まだ再評価の必要がない既存の OpenAI ワークフロー | 慣れたフロンティアモデルの挙動と、現行エージェントの安定した比較基準 | 利用可否はワークスペース設定による |
| Claude Fable 5 | 特に Claude Code の挙動に合わせて調整済みの、最も難しい Anthropic ワークフロー | 長時間のタスクに向くプレミアム推論と、独自のプロバイダー/ツール特性 | $$$$ |
OpenAI の報告では、Agents' Last Exam と Artificial Analysis Coding Agent Index で Sol が Fable 5 を上回る一方、GDPval-AA v2 では Fable 5 がわずかに上回ります。だからこそ「最高のモデル」という表現は広すぎます。OpenAI のエージェント型コーディング、コンピューター操作、デザイン、マルチエージェント性能を重視するなら Sol が有力です。一方、最上位の Anthropic ワークや Claude Code に合わせて調整済みのワークフローでは、Fable も引き続き有効な選択肢です。
多くの GPT-5.5 ワークロードでは、Terra がより直接的なアップグレード候補になります。OpenAI は、公開 API のトークン単価が半分でありながら GPT-5.5 と競争力のある性能を報告しています。Luna の最適化対象は速度と規模です。最大ベンチマーク値だけでなく、1ドルまたは1分あたりに完了できる仕事量で比較してください。
Zero における Built-in の意味
Built-in を使うと、GPT-5.6 の導入は認証情報を管理するプロジェクトではなく、単純なルーティングの選択になります。VM0 Managed プロバイダーを選べば、Zero がアクセスを管理し、該当する VM0 クレジット階層で利用量を計算します。このルートでは、別途 OpenAI API キーを作成・管理する必要はありません。
独自のプロバイダー契約を使いたいチームは、引き続き OpenAI API キーや ChatGPT/Codex サブスクリプションを接続できます。モデル名は同じで、請求経路とプロバイダー設定だけが変わります。VM0 のクレジット階層($、$$、$$$)と OpenAI が公開する API トークン価格は別のものです。
Zero で GPT-5.6 を有効にする方法
GPT-5.6 は、プロンプトに「use GPT-5.6」と書くのではなく、モデル設定から選択します。
- Settings を開き、サイドバーで Models を選択します。
- Personal セクションで、GPT 5.6 Sol、GPT 5.6 Terra、または GPT 5.6 Luna を追加します。
- VM0 Managed ルーティングを使う場合は Built-in を選びます。OpenAI API または ChatGPT/Codex の接続済みプロバイダーも選択できます。
- チャットまたは Run を開始し、モデルピッカーから使用したい階層に切り替えます。
- ワークフローが安定したら、エージェントまたはスキル単位で適切なモデルを設定し、定型業務が意図したルートで一貫して動くようにします。
実践的なルーティング指針
まず、次の3つを確認します。
- 誤った回答のコストはどれほど高いか。 大きな手戻り、リスク、後工程への影響が生じる場合は Sol を使います。
- コンテキストはどれほど深く、曖昧か。 照合や統合が必要な大規模で雑多な入力には Terra または Sol を使います。
- この処理を何回実行するか。 予測しやすい大量処理には Luna を使い、例外だけを上位モデルに引き上げます。
混合ルーティングも試す価値があります。Luna が入力を絞り込み構造化し、Terra が主要な作業を進め、最大の推論が必要な少数の判断だけを Sol に任せます。1つのモデルですべてを処理する必要はありません。それぞれの工程に十分なモデルを使えばよいのです。
GPT-5.6 では、この使い分けが明確です。Sol、Terra、Luna は、同じ Zero のエージェント環境に3つの動作点を提供します。必要なときは能力を引き上げ、不要なときはコストを抑えられます。


