- Gemini 4 Argonは19件中13件のベンチマークで首位と主張
- 出力上限は業界初の100万トークン。ただし計測方法に注意点
- 当面はFairwind Programの政府・サイバー防衛担当者のみ利用可能
何が発表されたのか
Google DeepMindは新モデル「Gemini 4 Argon」を発表しました。コーディング、企業のナレッジワーク、サイバー防衛という用途が示されています。同社がFlashより大きいモデルを投入するのは2月の3.1 Pro以来で、その後は3.x系Flashの小刻みな更新と、先月の経営陣の刷新が続いていました。その間、競合各社はFableやAstraクラスのモデルを投入しており、GDMがいつ追いつくかが最大の焦点となっていました。
性能面では、公開された19件のベンチマークのうち13件で首位を取ったと主張されています。ただし公開時点で試せる範囲は限定的です。まずFairwind Programに参加する政府ユーザーと、信頼されたサイバー防衛の担当者が対象になります。Googleはガードレールを調整したうえで、開発者・企業・消費者へ「できるだけ早く」開放するとしています。
出力100万トークンと価格
Googleは出力トークンの上限を業界初の100万トークンと説明しています。従来は64Kでした。ここには計測上の注意点があります。Valsは最大出力を262Kと記載しており、Artificial Analysisは「Long Decode Continuation」という新しいAPI機能を通じて100万トークンに到達したと報告しています。これは長い応答を一時停止し、複数の呼び出しにまたがって再開させる仕組みです。
価格は入力・出力それぞれ100万トークンあたり$4/$20です。50%の導入割引が適用されると$2/$10になりますが、終了日は告知されていません。キャッシュされた入力には95%の割引が適用されるとされています。
ベンチマーク上の位置づけ
Artificial Analysisの評価では、Argonはインテリジェンス指数で53を記録し、GPT-6 Astraの53と並び、GPT-6.1 Solの52をわずかに上回りました。導入割引時のタスクあたりコストは$1.99で、Astraの$3.26を下回ります。ただしこの差は価格によるもので、効率によるものではありません。Argonはタスクあたり平均62Kの出力トークンを使い、Astraの27Kを大きく上回っています。
Valsの評価ではVals Indexで68.9%と首位、タスクあたり平均コストは$15.68でした。Vibe Code Benchでは30個のアプリを完璧に構築し、Opus 5の25個、Astraの24個を上回っています。Terminal-Bench 4.0は19.0%から57.6%へ上昇し、CyberBenchの概念実証タスクで70%、IOI 2024〜2026で100%とされています。
一方でトレードオフも報告されています。AA-Omniscienceの幻覚率は15%とAstraの51%より低いものの、正確性は50%対63%とAstraに劣ります。またCode ArenaのWebDevでは1679で8位、Terminal Bench 4では57%と、Sonnet 5.5やOpus 5.5、Astraの後塵を拝しています。
Googleが報告する社内導入
Googleは社内での利用実績も公表しています。Argonのエージェントがデータセンターのメモリを300TiB以上解放し、80万行を超えるC/C++のカーネルコードをRustへ移行しているとしています。ビデオデコーダでは、32K行のSIMDコードを安全なRustに置き換え、既存のRustポートを同一の出力のまま2.7倍高速化したとのことです。
研究用途では、Argon上に構築した社内のエージェントループがCK予想の完成に寄与したとチームは述べています。こうした数値はいずれもGoogle側の報告であり、外部による再現は示されていません。
懐疑的な見方と現時点の制約
公開された数値には疑問の声も上がっています。法務ベンチマークでは、Argonの19.6%がMuse Spark 1.2の25.42%を下回ると指摘されました。選好データによるベンチマーク最適化の可能性や、DeepSWEを含む一部の数値に対する異論も示されています。
加えて、提供開始時点ではサイバーセキュリティ領域の限定的なプレビューにとどまります。一般の開発者や企業が実際に試して評価を積み上げるのはこれからで、現時点の数値だけで実運用への適合性を判断するのは早いと考えられます。
| 項目 | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| インテリジェンス指数 | 53 | 53 |
| タスクあたりコスト(導入割引時) | $1.99 | $3.26 |
| タスクあたり平均出力トークン | 62K | 27K |
| AA-Omniscienceの幻覚率 | 15% | 51% |
| AA-Omniscienceの正確性 | 50% | 63% |
We like the experimental Long Decode Continuation, which increases output tokens up to 1M as an industry first.
実験的なLong Decode Continuationは、業界初として出力トークンを最大100万まで増やすもので、注目に値する。
今後の見通し
最初の焦点は、Googleが予告した「できるだけ早く」の時期が具体的にいつになるかです。開発者・企業向けに開放されれば、独立系の評価機関による検証が進み、社内報告の数値が一般的なワークロードにどこまで当てはまるかが明らかになるとみられます。特に、100万トークンの出力が単一の呼び出しで使えるのか、Long Decode Continuation経由に限られるのかは実装設計を左右します。導入割引の終了時期、日本からの提供条件、既存のGemini 3.x系からの移行方法が公表されれば、採用判断がしやすくなります。
日本の開発者・IT企業にとっての意味
日本のIT企業にとって、まず押さえるべきは「性能は高いが今すぐ使えない」という点です。当面のアクセスはFairwind Programに限られるため、Argonを前提とした提案や検証計画を直ちに立てるのは現実的ではありません。一方で、100万トークンあたり$4/$20という価格と50%の導入割引、キャッシュ入力95%割引は、大規模なバッチ処理や長文生成を手がけるチームのコスト試算に影響し得ます。また、80万行規模のコード移行や300TiB超のメモリ解放をエージェントで進めたという報告は、レガシーコードのモダナイズやRust移行の工数見積もりを検討する際の参考になります。ただし幻覚率と正確性のトレードオフがあるため、用途ごとに評価軸を分けて判断することが求められます。
気になる点
- 日本からGemini 4 Argonは使えますか
- 公開時点では使えません。アクセスはまずFairwind Programの政府ユーザーと信頼されたサイバー防衛担当者に限られます。Googleは開発者・企業・消費者向けにガードレールを調整したうえで「できるだけ早く」開放するとしていますが、時期や日本国内での提供条件は公表されていません。
- 料金はいくらになりますか
- 標準価格は入力・出力それぞれ100万トークンあたり$4/$20です。50%の導入割引が適用されると$2/$10になりますが、割引の終了日は告知されていません。キャッシュされた入力には95%の割引が適用されるとされています。
- 出力100万トークンは通常のAPI呼び出しで使えますか
- そこは測定方法によって扱いが異なります。Valsは最大出力を262Kと記載しており、Artificial AnalysisはLong Decode ContinuationというAPI機能を通じて100万トークンに到達したと報告しています。応答を一時停止して複数の呼び出しにまたがって再開する仕組みで、単一呼び出しとは条件が異なるとみられます。
用語解説
- Long Decode Continuation
- 長い応答を途中で一時停止し、複数のAPI呼び出しにまたがって再開させる仕組み。実質的に長い出力を可能にする。
- Fairwind Program
- Gemini 4 Argonの初期アクセスを提供するプログラム。政府ユーザーと信頼されたサイバー防衛担当者が対象とされている。
- SOTA
- State of the Artの略。あるベンチマークにおいて、現時点で最高の性能を意味する。
- SIMD
- 1つの命令で複数のデータを同時に処理するCPU命令の方式。動画デコーダなどの高速化に用いられる。
- インテリジェンス指数
- Artificial Analysisが複数の評価結果をまとめて算出する、モデル能力の総合指標。
出典
[AINews] Gemini 4 Argon: GDM’s answer to Astra/Fable, with 1M output
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する