AI

Google「Gemini 4 Argon」発表。まずはサイバー防御向けに限定提供

Google DeepMindがGemini 4世代のフロンティアモデル「Gemini 4 Argon」を発表した。まずはFairwind Programを通じて防御側の組織へ限定提供。コーディングや専門業務で高いスコアを出す一方、全項目トップではない。100万トークン出力、厳重な安全対策、Google社内での実務利用、導入価格まで整理する。

Stark
大きな「Gemini 4 Argon」の文字の左で、スタークが「アルゴン!強そう…😳」と驚き、右でゆながタイトルを手で示しているサムネイル

Google DeepMindが2026年9月30日、新しいフロンティアAIモデル 「Gemini 4 Argon(アルゴン)」 を発表した。

確かに名前からして妙に強そうなのだが、中身を見てみるとかなり本気だ。

Gemini 4 Argonは、ソフトウェア開発、法律・金融などの専門業務、サイバーセキュリティ防御といった、複雑で長時間にわたるワークフローを想定したGemini 4世代のフロンティアモデル。Google DeepMindは「複雑なワークフローにおけるフロンティア性能」をうたい、長い多段階のタスクを続けて処理できることを大きな特徴にしている。出力上限も最大100万トークンに広がった。

ただし、ひとつ大きな特徴がある。

発表されたのに、まだ普通には使えない。

まず使えるのは「信頼されたサイバー防御組織」

Argonは、最初から一般ユーザーへ一斉公開されるわけではない。

Googleはまず、信頼できる防御側の組織に高度なAIを先行提供する 「Fairwind Program」 を通じて、Argonを展開している。

Fairwind Programは2026年9月2日に始まった限定アクセスの制度で、対象は政府機関や各国のサイバー当局、医療・通信・エネルギー・金融などの重要インフラ事業者、多くの人が使う主要なテクノロジー企業など。Googleによれば、世界で650を超える組織が参加している。AIによる攻撃能力が広まる前に、防御側がシステムを固める時間を確保することが目的だ。

「Gemini 4 Argonはまず限定公開」と題した図解。政府機関、重要インフラ、サイバー防御組織の3つからFairwind Programの盾へ矢印が集まり、「信頼できる防御側の組織に限定」としてGemini 4 Argonへつながる。一般ユーザーは鍵マーク付きで点線の先に置かれ、ゆなが「信頼できる防御側の組織に先行提供されます」、スタークが「一般公開は今後順次展開されます」と説明している

その理由のひとつが、Argonの強力な サイバー能力 だ。Googleによれば、Argonはソフトウェアの重大な脆弱性を自律的に発見し、検証し、修正できる。

さらに興味深いのが、Fairwind Programの信頼された防御組織とGoogle社内のチームには、サイバー向けのガードレールを外した状態でArgonを提供する とされている点だ。

もちろん、誰でも自由に使えるという意味ではない。Fairwind Programでは参加組織を絞り込み、ツールを使えるのも社内のセキュリティ・インシデント対応・ペネトレーションテストのチームに限るなど、運用上の制限を設けている。強力な能力を広く解放するのではなく、まず防御側だけにフル性能を渡すという考え方だ。

コーディング、法律、金融でもかなり強い

Argonはサイバーセキュリティ専用モデルではない。Googleが公開したベンチマークでは、ソフトウェア開発や企業の専門業務でも高い数字を出している。

たとえば、実際のソフトウェア開発に近い長いタスクを評価する DeepSWE v1.1 では、

  • Gemini 4 Argon:77.9%
  • Claude Opus 5.5:74.2%
  • GPT-6 Astra:74.1%
  • Claude Fable 5.1:67.4%

Zapierの業務自動化ベンチマーク AutomationBench でも、Argonは 51.3% で、Claude Opus 5.5(42.5%)やGPT-6 Astra(41.4%)を上回った。金融業務を評価するVals Finance Agent v2では65.4%、Harvey's Legal Agent Benchmarkでは19.6%と、どちらも比較対象の中でトップだ。

GoogleはArgonを、チャットAIというより専門業務を長時間こなすAIエージェントとして強く意識しているように見える。

ただし、ここは少し冷静に見たい。

「全部最強」というわけではない

ベンチマーク表をよく見ると、Argonがすべての項目でトップというわけではない。

たとえば FrontierSWE v2 では、

  • GPT-6 Astra:65.5%
  • Claude Opus 5.5:62.3%
  • Claude Fable 5.1:56.3%
  • Gemini 4 Argon:55.0%

と、比較された4モデルの中でArgonがいちばん低い。Terminal-bench 4.0 でも、Claude Opus 5.5の66.4%に対してArgonは57.4%。科学・数学系の Terminal-Bench Science 0.1 では、GPT-6 Astraの68.1%、Claude Opus 5.5の63.3%に対して、Argonは57.6%だった。

「Gemini 4 Argonはかなり強い。ただし全項目トップではない」と題した表。AutomationBenchはArgon 51.3%、GPT-6 Astra 41.4%、Claude Fable 5.1 31.4%、Claude Opus 5.5 42.5%。DeepSWE v1.1はArgon 77.9%、Astra 74.1%、Fable 67.4%、Opus 74.2%。FrontierSWE v2はArgon 55.0%、Astra 65.5%、Fable 56.3%、Opus 62.3%。Terminal-bench 4.0はArgon 57.4%、Astra 58.2%、Fable 57.9%、Opus 66.4%。Terminal-Bench Science 0.1はArgon 57.6%、Astra 68.1%、Fable 52.6%、Opus 63.3%。各項目のトップが青く強調され、ArgonがトップなのはAutomationBenchとDeepSWE v1.1の2つ

ベンチマークは評価環境や使うエージェント基盤によって結果が変わる。数字だけで「最強」と言い切るよりも、かなり強いが万能トップではない と見るのが自然だ。

サイバー防御では3モデルが68%で並ぶ

脆弱性の修正能力を測る CWE-bench v1 では、

  • Gemini 4 Argon:68%
  • GPT-6 Astra:68%
  • Grok 4.7:68%
  • Claude Opus 5.5:67%
  • Claude Fable 5.1:58%

となり、Argon、GPT-6 Astra、Grok 4.7の3モデルが68%で並んでいる。Googleの発表も「1位タイ」という表現だ。

ここで重要なのは、Argonが単に「サイバー系ベンチで高得点だった」というだけではないこと。GoogleはArgonを、防御的サイバーセキュリティを重点領域のひとつとするモデル として明確に位置づけている。その能力の強さが、今回の慎重な段階展開にもつながっている。

強くした分、安全対策もかなり厳重

広く提供するArgonには、複数の安全対策が組み込まれる。Googleが挙げているのは、

  • サイバー攻撃やCBRN(化学・生物・放射性物質・核)関連の有害な依頼を拒否する設計
  • これまでで最も強い、間接プロンプトインジェクションへの耐性
  • リスクの高い学習・評価の前に、サンドボックス環境を隔離・封鎖する
  • モデルの推論過程(chain-of-thought)と行動の監視

などだ。特に最後が興味深い。

GoogleはArgonの chain-of-thoughtと行動を監視し、必要な場合には実行を止める 仕組みを導入している。単純に「危ない単語が出たら止める」という話ではなく、タスクを進める途中でモデルが意図しない行動や、依頼の範囲を超えた逸脱を起こしていないかを見る考え方だ。

AIエージェントが長時間、自律的に作業するようになるほど、何を答えたか だけではなく、途中で何をしようとしているか まで監視する必要が出てくる。Argonは、その方向性がかなりはっきり見えるモデルでもある。

出力上限は100万トークン

Argonには、もうひとつ目を引く仕様がある。最大100万トークンの出力 だ。

これまでの64Kトークンから大きく引き上げられ、Googleは「業界最高水準」としている。

ここはかなり重要だと思う。

AIエージェントがコードを書き、ツールを操作し、結果を確認し、失敗したら直してまた試す。そんな処理を延々と続けるようになると、必要なのは「100万トークンの小説を書けること」ではない。

ひとつの仕事を、途中で息切れせずどこまで続けられるか。 そのための100万トークンと考えたほうが分かりやすい。

すでにGoogle社内では仕事をしている

Argonはまだ一般ユーザーには提供されていないが、Google社内ではすでに実務に使われている。

面白いのが、Googleのデータセンターでのメモリ最適化だ。Argonのエージェントのチームが、データセンター全体のプロファイリング・テレメトリを分析し、メモリの最適化を自律的に見つけて適用した。展開が終わると 300TiB以上のメモリが空き、最終的には合計500TiB〜1PiBの削減が見込まれているという。

さらに、C/C++で書かれたコードベースをRustへ移行する作業にもArgonのエージェントが使われている。re2やlibgav1のような数万行規模のライブラリから、Fuchsia OSの Zirconカーネル(80万行以上) まで規模を広げている。

ベンチマークだけでなく、実際の巨大なコードやインフラを相手に使われ始めているのは、Argonを見るうえでかなり面白いポイントだ。

値段は意外と安い

そして気になる価格。Googleが示している 導入価格(introductory pricing) は、

入力:100万トークンあたり2ドル
出力:100万トークンあたり10ドル

キャッシュ済みの入力は、入力価格から95%引きになる。フロンティア級のモデルとしては、かなり攻めた価格だ。

ただし、これはあくまで導入価格。Googleは、導入期間が終わったあとは 入力4ドル / 出力20ドル になると明記している。導入期間がいつまでなのかは、現時点では発表されていない。「Argonはずっと2ドル / 10ドル」と受け取らないほうがいい。

また、安ければそのまま実用的とも限らない。実際のコストは、1タスクあたりどれだけ長く推論し、どれだけトークンを使うかでも変わる。ここはAPIが広く開放されたあとに見たいところだ。

で、いつ使えるの?

現時点では、Fairwind Programに参加するサイバー防御組織と、一部の信頼されたテスターが先行して使っている段階だ。

Googleは具体的な一般公開日を発表していない。ただ、次の展開は見えている。Argonは「まもなく(soon)」、有料APIの利用者とGoogle AI Ultraの加入者 から順に提供される予定だという。

日付はまだ分からない。使えるようになったら、そのとき改めて実際の性能を試してみたい。

「Gemini 4 Pro」との関係は?

ここは現時点では分からない。

9月21日の記事「Gemini 4、強いより「安い」のが怖い。OpenAIとAnthropicはどうする?」で取り上げたリーク情報では、「Gemini 4 Pro」という名前が出ていた。でも今回Googleが正式に発表した名称は Gemini 4 Argon だ。

今後、Argonとは別に「Pro」「Flash」などのGemini 4シリーズが出てくるのか。あるいはモデルの体系そのものが変わっていくのか。公式な発表はまだないので、変に推測せず次の発表を待ちたい。

Gemini 4、最初に出てきたのは「Argon」

Gemini 4 Argonは、

ソフトウェア開発。
法律・金融。
サイバー防御。
長時間のエージェント処理。
100万トークンの出力。
そして、AI自身の行動を監視する安全対策。

単純に「Geminiがまた少し賢くなりました」というモデルではなさそうだ。GoogleがArgonで見せているのは、

高度なAIに、どこまで長く・安全に仕事を任せられるか。

という次の競争だと思う。

もちろん、ベンチマークがどれだけ良くても、実際の使いやすさは触ってみるまで分からない。一般公開されたら、そのときが本当の実力チェックだ。

でも今のところは、

という第一印象。……意外と間違ってないかもしれない。


※2026年10月1日時点の公開情報をもとにしています。
※ベンチマークの数値はGoogle DeepMindの公表値です。CWE-bench v1のGrok 4.7の数値は、Googleの発表内のグラフを伝えた報道によります。
※価格は導入価格(introductory pricing)です。導入期間の長さは発表されていません。
※この記事はAIとの対話をもとに作成しています。

参考・出典