技術約6分で読めます

Gemini 4 Argon・GPT-6.1 Sol・Opus 5.5の性能と提供状況を比べた

いけさん目次

M4 Mac miniのAntigravity(AGY)では、Gemini 4 Argonがまだ利用できない状態だった。 一方でGPT-6.1 SolとClaude Opus 5.5はCLIから呼び出せたため、公式の性能評価を調べ、小さなコード生成と資料照合を試してみた。

SolとOpusは、それぞれの上位モデルに近い性能をより安価に使える。 Gemini 4 ArgonはGoogleの新しい最先端モデルで、10月1日時点では限定提供にとどまる。

AGYでの提供状況

2026年10月1日、M4 Mac miniで agy models を実行して確認した。 Gemini系の最新は3.8 Flashで、High・Medium・Lowの3種類が表示された。3.1 Proもあったが、4やArgonを含むモデル名は見当たらなかった。

gemini-3.8-flash-high    Gemini 3.8 Flash (High)
gemini-3.8-flash-medium  Gemini 3.8 Flash (Medium)
gemini-3.8-flash-low     Gemini 3.8 Flash (Low)

Googleは9月30日にGemini 4 Argonを発表した。 発表時点の提供先は、Fairwindプログラムに参加するサイバー防御の担当者などに限られている。一般提供は有料API利用者とGoogle AI Ultra加入者から順次始まる予定だ。

この環境ではArgonを直接呼び出せないため、CLIのテストにはAGYで利用可能なGemini 3.8 Flash Highを参考として加えた。

公式の位置づけと価格帯

OpenAIのモデル選択ガイドは、Astraを最高性能、Solを速度・価格・性能のバランス型、Lunaを高速・低価格と分けている。 Anthropicのモデル一覧にもFable、Opus、Sonnet、Haikuがあり、日常的な作業にはOpus、高度な推論や長時間の作業にはFableを案内している。

モデル発表・展開日公式の位置づけ
Gemini 4 Argon9月30日新しい最先端モデル。限定提供から展開
GPT-6.1 Sol9月29日Astraに近い性能を、より低い価格で使う
Claude Opus 5.59月22日多くの作業でFable 5.1に匹敵すると説明

Solの展開日はCodexとChatGPT Workの変更履歴、Opusの発表日とFableとの関係はAnthropicの発表に記載がある。 Solは中位モデルの刷新にあたる。一方Opus 5.5は最上位のFableより安価だが、下位にSonnetやHaikuがあるため、全モデルの中間というより主力の上位モデルに近い。

API単価と出力上限

APIの料金計算に使われるトークンは、入力がモデルへ読み込ませるテキスト、出力が生成されるテキストに対応する。 下表の価格は、通常のAPIで100万トークンを処理した際の米ドル単価をまとめたもの。CLIの定額利用料や1回のセッション全体の費用とは異なる。

モデル入力(100万トークン)出力(100万トークン)出力上限
Gemini 4 Argon・導入価格$2$10100万トークン
Gemini 4 Argon・導入期間後$4$20100万トークン
GPT-6.1 Sol$2$10128,000トークン
Claude Opus 5.5$4$20128,000トークン

Argonの数値はGoogleの発表、SolとOpusはそれぞれの公式モデル仕様(Solの仕様、Opusの仕様)に基づく。 Solの単価は入力272,000トークン以下の通常処理が対象で、長文コンテキストや高速モードでは料金体系が変わる。

Argonの100万トークンは一度に出力できる最大長であり、コンテキストウィンドウ(入力長)ではない。 Googleは従来の64,000から上限を引き上げ、長い推論や長文生成を継続できるとしている。Opusの128,000トークンは通常リクエストの上限で、別途300,000トークンまで出力可能なバッチ処理のベータ機能も用意されている。

Opus 5.5のトークン単価はOpus 5と比べて20%引き下げられた。 Anthropicの発表にある「タスクあたり40%低コスト」という数字は、単価の改定に加えて処理に必要なトークン数の削減なども加味した同社環境での試算値となる。

公表ベンチマークの比較

各社が公表している評価スコアのうち、Googleの比較表からArgonとOpus 5.5が直接並んでいる項目を整理した。なお、OpenAIのSol 6.1はこの表に含まれていない。

評価測る作業Gemini 4 ArgonOpus 5.5
DeepSWE v1.1長いソフトウェア開発の作業77.9%74.2%
Terminal-Bench 4.0ターミナルでの複数段階の作業57.4%66.4%
Vals Finance Agent v2複数段階の金融調査65.4%58.6%
LVBench長い動画の理解91.7%83.7%

ArgonはDeepSWEや金融調査でスコアが高く、Terminal-BenchではOpusが上回る。 ただし評価方法の資料によれば、Googleが自ら計測した値と他社の公表値が混在している。いずれも高い推論設定が用いられているものの、評価を実行したハーネス(周辺スクリプト)は共通ではない。

動画理解(LVBench)の入力条件にも差があり、Geminiが毎秒1フレームで入力しているのに対し、OpusはAPI制限に合わせて600フレーム固定で測定されている。 同一の実行環境でモデルだけを入れ替えた比較にはなっていない。

なおSol 6.1は「Astraに近い性能」と説明されているものの、今回の仕様ページには同一ベンチマークの具体的スコアが掲載されていなかった。上位モデルであるAstraの数値をそのまま当てはめることは避けている。

CLI環境での小テスト

各モデルの実際の挙動を確かめるため、ローカルマシンのCLIから同じテストプロンプトを送信した。

検証環境

項目設定・バージョン
マシンM4 Mac mini(メモリ16 GiB / macOS 26.5.2)
GPT-6.1 SolCodex CLI 0.159.2(推論量: medium)
Claude Opus 5.5Claude Code 2.1.285(推論量: medium)
Gemini 3.8 Flash High(参考)AGY 1.2.14(推論量: High)

各CLIを空の一時ディレクトリから立ち上げ、外部検索やツール実行を無効化した上で、コードと回答をJSON形式で返すよう指示した。 使用した入力プロンプトと採点スクリプトは、LiltingChannelLaboの実験用ディレクトリに保存してある。

課題採点方法
Pythonの区間統合関数重なりだけを統合し、端点が接する区間は分ける。型・空区間・巨大整数など24ケースで実行
イベント集計9行のログからIDごとの最新データを選び、支払い済みレコードのみを通貨別に集計
資料と主張の照合架空の仕様資料に対し、入力と出力、限定提供と一般公開、価格条件を正しく区別できるか判定する3問

小テストの実行結果

各モデルへプロンプトを2回ずつ実行した結果はこんな感じ。 イベント集計(2試行とも正解)と資料照合(3問全問正解)は3モデルともすべて正答したため、下表では差が出たコード生成の通過数と経過秒数を並べている。

モデルコードテスト通過数経過秒数(1回目 → 2回目)
GPT-6.1 Sol (medium)24/24 → 24/2420.8秒 → 18.3秒
Claude Opus 5.5 (medium)24/24 → 24/2418.5秒 → 19.8秒
Gemini 3.8 Flash High(参考)23/24 → 23/2462.4秒 → 99.3秒

SolとOpusは今回のテスト範囲において同等の成績となった。試行回数は各2回と少ないため厳密な速度比較ではないが、応答までの待ち時間はおおむね20秒弱でほぼ同じだった。

差がついたのはPythonの区間統合関数における巨大整数(10**400)の扱いで、Gemini 3.8のコードのみ2回とも OverflowError が発生した。 生成されたコードを確認すると、入力された数値を math.isfinite() でバリデーションしていた。Pythonの整数型自体は任意精度のためどれだけ大きな桁数でも保持できるが、math.isfinite() は判定時に引数を浮動小数点数(float)へ暗黙変換する。そのためfloatの上限値(約1.8 × 10³⁰⁸)を超える 10**400 でオーバーフローを起こしていた。

# Gemini 3.8 Flash Highの生成コード
if not (math.isfinite(start) and math.isfinite(end)):
    raise ValueError("endpoints must be finite numbers")

SolとOpusは小数の場合のみ有限性チェックを行うか、明示的な型判定を挟んでいたためエラーを回避していた。通常の数値範囲や、境界が接する区間を分離する処理については3モデルとも正常にパスしている。