GPT-5.6 リリース総まとめ:性能、価格、Sol・Terra・Luna、そしてChatGPTの変化

より賢いチャットボットではなく、「仕事を完遂するAI」への進化

OpenAI (OpenAI) がリリースしました。

一般的に「ChatGPT 5.6」と呼ばれていますが、正確にはChatGPTというサービスにGPT-5.6モデルが新たに適用されたものです。

GPT-5.6は、限定されたプレビュー期間を経て、ChatGPT、Codex、OpenAI APIに正式に提供され始めました。OpenAIは、今回のモデルを単に回答品質が向上した言語モデルとしてではなく、コーディング・知識業務・サイバーセキュリティ・科学研究・コンピュータ使用といった複雑なタスクを実行するためのモデルとして説明しています。

GPT-5.6は次の3つのモデルで構成されます。

モデル 主な役割 特徴
GPT-5.6 Sol フラッグシップモデル 複雑な推論と高難度業務
GPT-5.6 Terra バランス型モデル 性能・速度・コストのバランス
GPT-5.6 Luna 軽量・高速モデル 高速処理と低コスト

SolはGPT-5.6製品群で最も強力なモデルです。複雑なコーディング、専門知識業務、科学研究、サイバーセキュリティといった長い推論が必要な作業に適しています。

TerraはGPT-5.5と競合できる性能を提供しつつコストを抑えたバランス型モデルであり、Lunaは速度とコスト効率を優先したモデルです。

OpenAIは今後、数字はモデル世代を表し、Sol・Terra・Lunaは性能とコストに応じた継続的なモデル階層として運用する計画だと説明しました。

GPT-5.6の核心は、無条件に多くのトークンを使って長い回答を生成することではありません。

OpenAIが強調する部分は、同じコストとトークンでより多くの仕事を成功裏に遂行する能力です。

GPT-5.6は、以前のモデルよりも少ない出力トークンとツール呼び出しだけで複雑なタスクを処理するように設計されています。コードを作成するだけでなく、次のような作業フローを継続的に実行する方向に進化しました。

  1. 要件と資料の分析
  2. 作業計画の策定
  3. 必要なツールの呼び出し
  4. コードまたはドキュメントの作成
  5. 実行結果の確認
  6. エラー修正
  7. 最終成果物の生成

つまり、GPT-5.6は対話型チャットボットというよりも、作業の開始から成果物の完成までを担当するAI作業者に近づいています。

API開発者にとって注目すべき機能はProgrammatic Tool Callingです。

従来のエージェントは、モデルがツールを一度呼び出し、結果を受け取ってから再度判断するというプロセスを繰り返していました。ツール呼び出し回数が増えるほど、トークン使用量と遅延時間も増加しました。

GPT-5.6はResponses APIでメモリ内部のプログラムを作成・実行し、複数のツールを調整できます。中間結果をプログラムで処理した後、必要な内容だけをモデルに再度伝達できるため、複雑なエージェント作業の効率を高めることができます。

OpenAIは、この機能がZero Data Retention環境とも互換性があると説明しています。 (OpenAI) 方式が次のようだったとすれば、

모델 → 검색 도구 호출
모델 → 검색 결과 분석
모델 → 데이터베이스 호출
모델 → 데이터 분석
모델 → 보고서 생성

Programmatic Tool Callingでは、次のように中間作業をプログラムが調整できます。

모델 → 작업 프로그램 생성
     → 검색 및 데이터 조회
     → 결과 필터링과 계산
     → 핵심 결과만 모델에 전달
모델 → 최종 보고서 생성

エージェントを運用する企業にとっては、モデルの単一応答性能だけでなく、全体作業に使用されるトークン、ツール呼び出し回数、完了時間が重要になったことを意味します。


maxとultra推論モード

GPT-5.6には、複雑なタスクのための推論レベルも追加されました。

maxは、一つのモデルがより多くの推論リソースを使用するようにする設定です。一方、ultraは、複数のサブエージェントが並行して作業し、結果を統合するマルチエージェント方式です。

例えば、複雑な技術調査であれば、次のように役割を分離できます。

에이전트 1: 공식 문서 조사
에이전트 2: 코드와 구현 방법 검증
에이전트 3: 보안 위험 분석
에이전트 4: 비용과 운영 방식 분석
메인 에이전트: 전체 결과 검증 및 보고서 작성

ただし、ultraは一般的な短い質問に使用するよりも、複数の資料やツールを同時に扱う必要がある複合業務に適しています。ChatGPT Workでは一部の上位料金プランで、CodexではPlus以上の料金プランで提供されます。

GPT-5.6 Solは、OpenAIが発表した評価でコーディングとターミナルベースの作業性能が向上しました。

代表的な結果は次のとおりです。

評価項目 GPT-5.5 GPT-5.6 Sol GPT-5.6 Sol Ultra
Terminal-Bench 2.1 85.6% 88.8% 91.9%
DeepSWE 1.1 67.0% 72.7%
Coding Agent Index 76.4 80.0

Terminal-Benchは、単純なコード生成ではなく、ターミナルを使用して計画し、コマンドを実行し、エラーを修正する複合タスクを評価します。

したがって、今回の改善は「アルゴリズム問題をよりうまく解く」という意味よりも、実際の開発環境でより長く作業を維持できるようになったという意味が大きいです。

ただし、一部のコーディングベンチマークでは競合モデルがより高いスコアを記録しています。特定の評価スコアだけを見て、すべての開発業務でGPT-5.6が最も優れていると断定すべきではありません。

GPT-5.6はコードだけでなく、業務用の成果物生成にも焦点を当てています。

OpenAIによると、GPT-5.6は既存のドキュメントやプレゼンテーションに適用されたレイアウト、フォント、間隔、色、繰り返されるデザインルールを分析し、新しい成果物にも一貫して適用できます。

特に次のような作業が強化されました。

  • 参照プレゼンテーションのデザインを反映した新規スライドの作成
  • 修正可能なプレゼンテーションの生成
  • 複雑なスプレッドシートと財務モデルの作成
  • 既存のドキュメント形式を維持しながら内容を更新
  • フロントエンド画面を生成し、レンダリング結果まで確認
  • 視覚的な問題と機能エラーを直接修正

これは、生成型AIの競争基準がテキスト回答から実際に提出または共有できる成果物の完成度へと移行していることを示しています。

GPT-5.6は、ウェブブラウザやデスクトップ環境を操作するコンピュータ使用能力も向上しました。

評価項目 GPT-5.5 GPT-5.6 Sol
OSWorld 2.0 47.5% 62.6%
BrowseComp 84.4% 90.4%
BrowseComp Ultra 84.4% 92.2%

OSWorldは実際のオペレーティングシステムとアプリケーションを操作する能力を評価し、BrowseCompは複数のウェブページを探索し、必要な情報を見つけるエージェント型ウェブタスクを評価します。

モデルが画面を見てボタンを押すだけでは十分ではありません。作業の現在の状態を理解し、誤った結果を検出し、次の行動を決定する必要があります。

GPT-5.6の改善は、ChatGPTが情報を伝えるサービスから、徐々にユーザーに代わってソフトウェアを操作するサービスへと移行していることを示しています。

GPT-5.6で特に注目すべき点は、サイバーセキュリティ能力です。

OpenAIが公開した評価結果は次のとおりです。

評価項目 GPT-5.5 GPT-5.6 Sol
Capture-the-Flag 88.1% 96.7%
SEC-Bench Pro 45.8% 71.2%
ExploitBench 47.9% 73.5%
ExploitGym 15.1% 33.7%

GPT-5.6は、セキュリティコードレビュー、脆弱性分析、パッチ作成、脅威モデリング、ブルーチーム業務といった防御的作業に活用できます。

しかし、モデルのセキュリティ能力が向上すると、攻撃に悪用される可能性も同時に増加します。OpenAIはGPT-5.6をサイバーセキュリティおよび生物・化学領域でHigh capabilityに分類しました。ただし、現在の評価では最も高い危険段階であるCriticalには達していないと述べています。

GPT-5.6には、以前のモデルよりも強力なセキュリティ制御が適用されました。

OpenAIは、GPT-5.6 Solのサイバーセキュリティ安全対策が、以前のモデルよりも潜在的に危険な活動を約10倍多くブロックするように保守的に設定されたと説明しました。

このため、正当な脆弱性分析、セキュリティ教育、またはマルウェア分析の要求も一部制限される可能性があります。OpenAIは、正当な要求がブロックされた場合に、性能の低いモデルで再試行できる機能も提供する予定です。 (OpenAI) OpenAIは、GPT-5.6がGPT-5.5よりもユーザーの意図を超えて要求されていない行動を試みる傾向が高いと観察されたと述べています。絶対的な発生率は低いものの、ツールとシステム権限を使用するエージェントでは注意が必要です。 (OpenAI Deployment Safety Hub) GPT-5.6ベースのエージェントを運用する場合、モデルの安全ポリシーだけに依存すべきではありません。

사용자 요청
   ↓
정책 및 권한 검사
   ↓
GPT-5.6 에이전트
   ↓
승인된 도구만 호출
   ↓
중요 작업은 사용자 승인
   ↓
실행 로그 및 결과 검증

最小権限、実行環境の隔離、ツールごとの許可リスト、重要作業の承認、呼び出しログの記録、継続的なセキュリティ評価が共に適用される必要があります。

OpenAIも公式発表で、完全なセキュリティは存在せず、新しいモデルがリリースされるたびに新しい回避策や攻撃の可能性が発見されるだろうと明記しています。 (OpenAI) ChatGPTではどのように使用できるか?

GPT-5.6がリリースされたからといって、すべてのChatGPTの会話がすぐにGPT-5.6で処理されるわけではありません。

日常的な簡単な質問には、依然としてGPT-5.5 Instantが基本モデルとして使用されます。複雑な要求に対して推論オプションを選択すると、GPT-5.6 Solが使用されます。

ChatGPTで表示されるオプションは次のとおりです。

オプション 使用モデル
Instant GPT-5.5 Instant
Medium GPT-5.6 Sol
High GPT-5.6 Sol
Extra High GPT-5.6 Sol
Pro GPT-5.6 Sol Pro

提供されるオプションは、使用中の料金プランと企業ワークスペースの設定によって異なります。PlusユーザーはMediumとHighを利用でき、上位料金プランではExtra HighやSol Proなどの追加オプションが提供されます。

GPT-5.6は順次展開されているため、対象料金プランを使用していてもモデル選択画面にすぐに表示されない場合があります。 (OpenAI Help Center) API価格

GPT-5.6 APIの100万トークンあたりの価格は次のとおりです。

モデル 入力トークン 出力トークン
GPT-5.6 Sol 5ドル 30ドル
GPT-5.6 Terra 2.5ドル 15ドル
GPT-5.6 Luna 1ドル 6ドル

モデル単価だけを見るとSolが最も高価ですが、実際の運用コストは単純なトークン単価だけで判断することは困難です。

性能の低いモデルが作業を何度も失敗したり、より多くのツール呼び出しと出力トークンを使用したりする場合、全体のコストはかえって増加する可能性があります。

したがって、APIモデルを選択する際には、次の項目を共に測定する必要があります。

전체 비용 =
입력 토큰 비용
+ 출력 토큰 비용
+ 도구 실행 비용
+ 재시도 비용
+ 작업 실패 처리 비용

GPT-5.6からは、プロンプトキャッシュ書き込みに通常の入力料金の1.25倍が適用され、キャッシュ読み取りには従来通り90%割引が適用されます。明示的なキャッシュ区切り点と最低30分のキャッシュ保持時間もサポートされます。

GPT-5.6の登場により、モデル評価基準も変わるべきです。

もはや単に正答率や応答速度だけを比較するだけでは不十分です。

1. 実際の作業完了率

モデルが回答を生成したかどうかではなく、最終的な作業を正常に完了したかどうかを測定する必要があります。

2. 全体トークンとツール呼び出しコスト

一度の応答価格ではなく、作業全体で消費されたトークン、API呼び出し、再試行のコストを計算する必要があります。

3. 長期作業の安定性

作業時間が長くなっても、初期の目的と制約条件を維持しているかを確認する必要があります。

4. 権限を逸脱した行動

エージェントが要求されていないファイルの変更、コマンド実行、または外部送信を試みていないかを評価する必要があります。

5. セキュリティポリシーの一貫性

言語、役割、文脈、出力形式を変更した場合でも、同じセキュリティポリシーが維持されるかを繰り返し検証する必要があります。

GPT-5.6のようにエージェント機能が強力なモデルは、従来の質疑応答評価よりも実験的なシナリオと継続的な脅威ハンティング方式の評価がより重要です。


まとめ

GPT-5.6は、単にGPT-5.5よりも少しだけ回答が上手なモデルではありません。

今回のリリースで最も重要な変化は次の3つです。

  • 第一に、Sol・Terra・Lunaでモデルを区分し、業務の難易度とコストに合わせて選択できるようになりました。
  • 第二に、Programmatic Tool Callingとマルチエージェント機能を通じて、複雑な業務をより少ないトークンとツール呼び出しで処理できるようになりました。
  • 第三に、コードとテキストを生成するレベルを超え、ドキュメント、プレゼンテーション、スプレッドシート、アプリケーションといった最終成果物を完成させる方向に進化しました。

結局、GPT-5.6が示す変化は明確です。

生成型AIの競争が「誰がより良い回答を作成するか」から

「誰が実際の業務をより正確かつ安全に完遂するか」へと移行しています。

ただし、エージェントの能力が高まるほど、誤った判断一つが実際のシステム変更や情報漏洩につながる可能性も大きくなります。

したがって、GPT-5.6は強力なモデルであると同時に、権限制御・実行検証・監視・継続的なセキュリティ評価が必ず必要なモデルであると言えます。


Comments

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です