チャエン

株式会社デジライズ 代表取締役

チャエン

Geminiがついに「4」の世代に入りました。Google DeepMindが米国時間9月30日(日本時間10月1日早朝)に発表した新しいフロンティアモデル、Gemini 4 Argonです*1。

1回に出力できるトークンの上限は100万に広がりました。Googleが公表したベンチマーク表では、19項目中14項目で首位(同率1位を含む)に立っています。ひと言でいうと、仕事の実務に強いAIです。

ただし、今これを使えるのは Fairwind Program に参加している一部のサイバー防御者だけで、一般向けの提供時期は決まっていません。この記事では、Argonで何が変わるのか、ベンチマークの読み方、料金と使える範囲、そして今日あなたが使えるGeminiを整理します。


今なら、生成AIの基礎知識から社内導入の6ステップ・定着のポイントまでを1冊にまとめた「はじめての生成AI社内導入ガイド」を無料で配布中!何から始めればいいか分からない方でも、これ1冊で導入の流れがつかめます。

Gemini 4 Argonとは|Geminiが「4」の世代に入った

Gemini 4 Argonとは|Geminiが「4」の世代に入った

Gemini 4 Argonは、GoogleがGeminiの「次の時代」と位置づけるフロンティアモデルです。長く複雑なワークフローの中でも、深い推論を保ったまま作業を続けることを狙って作られています。

得意分野として挙がっているのは、実務のソフトウェア開発、法務や金融といった知識労働、サイバー防御の3つです。あわせて、創作の文章にも強いとしています。

項目内容
発表元Google DeepMind
発表日米国時間2026年9月30日(日本時間10月1日早朝)
位置づけGeminiの次世代を担うフロンティアモデル
得意分野実務のソフトウェア開発/法務・金融などの知識労働/サイバー防御/創作
出力トークンの上限100万トークン(従来は64K)
今使える人Fairwind Program の一部のサイバー防御者と、Google社内
一般公開有料APIユーザーと Google AI Ultra 加入者から。時期は未定

数字の出典はいずれもGoogleの発表です。性能と料金だけ見ると「すぐ試したい」となりますが、一般のユーザーや開発者が今日触れるモデルではない点を先に押さえておいてください。

出力100万トークンで何が変わるのか

出力100万トークンで何が変わるのか

これまでのGeminiは、1回に出力できるトークンが64Kまででした。Argonではこれが100万トークンに広がります。何十万トークンもの思考と生成を、1回の流れの中で続けられる枠ができたということです。

出力の上限が低いと、長い作業は途中で切れてしまいます。そのたびに続きを頼み直すと、前半の文脈が崩れたり、作業の一貫性が落ちたりします。上限が上がれば、長くて多段階の問題を一度に扱える余地が広がります。

あなたの仕事に置き換えると、次のような場面で差が出やすくなります。

  1. 大きなコードの書き換え — 何万行規模の移行のように、出力そのものが長くなる作業。Google自身もC/C++からRustへの移行に使っている(次の章で紹介)
  2. 長い調査・分析 — 多くの手順を踏む分析を、途中で区切らずに最後まで進める
  3. 長いドキュメントの作成 — 章ごとに分けて頼み直す手間が減る可能性がある

ここは割り引いて読む 1. 出力上限は「出せる量の天井」で、長い成果物の品質を保証するものではない 2. APIで保証される入力コンテキストの正式な上限は、まだ公表されていない(評価では256K〜100万トークンの長文脈ベンチも測っている*2) 3. 出力は課金対象。導入価格で出力100万トークンを使い切ると、出力だけで10ドルかかる計算になる

長い報告書を1回で完成品まで出せる、とまでは言い切れません。第三者の評価や実際の使い方の報告が出てくるまでは、「長い作業を途切れさせずに進められる枠ができた」くらいに受け止めるのが妥当です。

「まずは何ができるか知りたい」といった情報収集段階でのご相談も大歓迎です。導入の流れや具体的な支援内容をまとめた資料を以下よりご覧いただけますので、ぜひお気軽にご活用ください。

Gemini 4 Argonの性能|公式ベンチ19項目の読み方

Gemini 4 Argonの性能|公式ベンチ19項目の読み方

Googleは、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5と並べたベンチマーク表を公開しています。表を見る前に、数字の前提を押さえておきます。

このベンチマークを読む前提 1. この章の表は、Googleが公表した表をそのまま書き起こしたもの 2. 他社モデルの数字は、原則として各社の自己申告値。Vals AIやZapierなど第三者のリーダーボードから引いた項目もある 3. Argonの数字は、Gemini APIで思考の設定を最も高くしたときのもの 4. LVBench(長尺動画の理解)は、モデルごとに読み込ませたフレーム数が違う

>

外部リーダーボード由来の数字は含まれていますが、Googleの比較表全体を第三者が独立に再現した評価は、まだ出ていません。

数字の出どころは項目ごとに違う

評価方法の資料によると、どこで測った数字かはベンチマークごとに分かれます。

出どころ該当するベンチマーク
第三者のリーダーボードVals Index・Vals Finance Agent v2・Harvey’s Legal Agent Benchmark・Vibe Code Bench(Vals AI)/AutomationBench(Zapier)/FrontierSWE(Proximal)/RiemannBench・Chartography(Surge)/CWE-bench v1(公式リーダーボード)
Argonは Google が測定(他社は公開リーダーボード・各社のシステムカードや公式ブログから引用)DeepSWE v1.1・Terminal-bench 4.0・Terminal-Bench Science 0.1・Agent’s Last Exam・OSWorld-2.0
全モデルを Google が測定PostTrainBench・LABBench 2・GraphWalks・LVBench

LVBenchは、Geminiが1秒1フレーム、GPT-6 Astraが800フレーム、Claude Fable 5.1が300フレーム、Claude Opus 5.5が600フレームという条件です。各社APIの制限によるもので、条件が揃った比較ではありません。

19項目の一覧

Googleが公表した表の全項目です。太字が各項目の首位です。

分野ベンチマークGemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5
知識労働Vals Index68.9%63.1%65.8%67.0%
知識労働AutomationBench51.3%41.4%31.4%42.5%
知識労働Vals Finance Agent v265.4%53.5%58.9%58.6%
知識労働Harvey’s Legal Agent Benchmark19.6%5.4%6.7%3.8%
コーディングDeepSWE v1.177.9%74.1%67.4%74.2%
コーディングFrontierSWE v255.0%65.5%56.3%62.3%
コーディングVibe Code Bench91.9%89.6%90.3%90.3%
コーディングTerminal-bench 4.057.4%58.2%57.9%66.4%
ML工学PostTrainBench45.3%44.3%40.2%49.3%
科学・数学Terminal-Bench Science 0.157.6%68.1%52.6%63.3%
科学・数学LABBench 288.8%85.4%68.6%73.1%
科学・数学RiemannBench76.0%72.0%65.6%69.6%
長文脈GraphWalks 〜128k BFS99.7%98.7%91.4%90.6%
長文脈GraphWalks 256k〜1M BFS84.2%71.8%65.0%66.8%
PC操作Agent’s Last Exam39.5%34.2%—38.2%
PC操作OSWorld-2.0(Offline subset partial)69.2%72.6%——
マルチモーダルChartography71.6%71.0%46.2%66.3%
マルチモーダルLVBench91.7%87.5%79.7%83.7%
サイバーCWE-bench v168.0%(同率)68.0%(同率)58.0%67.0%

「—」の欄は比較できる公開値が無いところです。OSWorld-2.0はAnthropicが条件を分けた数字を出していないため、Agent’s Last ExamはClaude Fable 5.1が公開リーダーボードに載っていないため、空欄になっています。

Argonが首位なのは19項目中14項目です(CWE-bench v1の同率1位を含む)。知識労働の4項目はすべて首位で、法務のHarvey’s Legal Agent Benchmarkでは他の3モデルに大きな差をつけています。金融・法務・業務自動化といった、実務に近い評価で強さが目立つ結果です。

Argonが首位ではない5項目

一方で、他社モデルが明確に上回っている項目もあります。

ベンチマーク首位のモデル首位のスコアArgon
FrontierSWE v2GPT-6 Astra65.5%55.0%
Terminal-Bench Science 0.1GPT-6 Astra68.1%57.6%
OSWorld-2.0GPT-6 Astra72.6%69.2%
Terminal-bench 4.0Claude Opus 5.566.4%57.4%
PostTrainBenchClaude Opus 5.549.3%45.3%

一部のコーディング評価(FrontierSWE v2・Terminal-bench 4.0)、科学系の端末作業、PC操作、ML工学では、GPT-6 AstraやClaude Opus 5.5が上回っています。「すべてでGPT-6 AstraやClaudeを上回った」わけではありません。

GeminiがGPTやClaudeを抜いて1位の座に返り咲いた、と言いたくなる結果です。ただし、これはあくまでGoogleが公表した表における話です。第三者の独立した評価が出るまでは、「Googleの表では多くの項目で首位」と受け止めておくのが正確です。

Google社内での使われ方

Argonはすでに、数千人のGoogle社員が社内で使っています。発表では、具体的な成果がいくつか紹介されました。

用途内容
量子アルゴリズムの最適化ある例で、公表済みのベースラインを数分で40%上回った
メモリ効率の改善ロールアウト時点で、データセンター全体の300TiB超のメモリを解放。総削減は500TiB〜1PiBの見込み
C/C++からRustへの移行re2やlibgav1のような数万行規模から、FuchsiaのZirconカーネル80万行超まで。本番投入前の監査・テスト・レビュー中
動画デコーダの書き換えlibgav1で、既存Rust版のSIMDコード3.2万行を置き換え。出力は同一のまま、Rust版比2.7倍の速さのメモリ安全なデコーダに

Rust移行は、まだ本番に入る前の段階です。とはいえ、80万行を超える規模のコードを扱えていることは、前の章で触れた出力上限の拡大とも合っています。

サイバー防御に強いモデルとして出てきた理由

サイバー防御に強いモデルとして出てきた理由

Argonの最初の提供先は、一般ユーザーではなくサイバー防御者です。Fairwind Program を通じて、信頼済みの防御者に段階的に展開されています。

Fairwind Program は、政府・医療機関・通信事業者のような優先度の高い防御者に、先進的なモデルへの早期アクセスを提供するGoogle DeepMindのプログラムです*3。信頼済みの防御者とGoogle社内のチームには、サイバー用途のガードレールを外した状態でArgonが提供されています。

一般公開より先に、守る側が強いモデルを手にして脆弱性を見つけ、直せる形になっています。

脆弱性の発見と修正での実績

サイバー領域で発表された実績は、次のとおりです。

  1. CWE-bench v1(脆弱性の修正) — 68%で首位タイ(GPT-6 Astraなどと同率)
  2. 脆弱性の発見 — 20言語のソースコードを調べるGoogle社内のベンチで85.8%(Gemini 3.8 Flash Cyberは71.0%)、ソースコードなしでWebの脆弱性を突くWiz社内のベンチで70.9%(同58.2%)
  3. プロンプトインジェクションへの耐性 — Gray Swan の間接プロンプトインジェクションのベンチで、15回試行時の攻撃成功率が0.7%と比較モデル中で最も低い(低いほど良い)
  4. 実地での発見 — セキュリティ企業Wizが「Scan for Good」の取り組みで使い、世界の病院で使われている医療ソフトの重大な脆弱性を見つけた。機微な個人情報が漏れうるもので、従来のフロンティアモデルは見逃していたという

安全対策の4分野

強いサイバー能力を持つモデルなので、Googleは安全対策もあわせて説明しています。

  1. 悪用の防止 — サイバー攻撃やCBRN(化学・生物・放射性物質・核)への悪用を、モデル内部の活性化を監視して防ぐ
  2. 間接プロンプトインジェクション対策 — 同社のモデルで最も耐性が高い
  3. ミスアラインメントの監視 — 思考の過程と行動を監視し、必要なら止める
  4. サンドボックス環境の強化 — モデルが動く環境そのものを固める

公開の進め方も慎重です。米国政府による公開前のモデルアクセスの自主的な枠組みに参加しながら段階的に広げ、早期テスターの意見をもとにガードレールを改善してから、開発者・企業・一般ユーザーへ「できるだけ早く」届けるとしています。

Gemini 4 Argonの料金と使える範囲

Gemini 4 Argonの料金と使える範囲

料金はすでに発表されています。導入価格と、導入期間が終わった後の価格の2段構えです。

100万トークンあたり導入価格導入期間の終了後
入力$2$4
出力$10$20
キャッシュ入力入力単価の95%オフ記載なし

導入期間がいつ終了するかは、まだ明らかにされていません。期間終了後は、入力も出力も単価が2倍になります。

今使えるGeminiとの料金の差

参考として、現行の主力 Gemini 3.8 Flash と並べます*4。

100万トークンあたりGemini 4 Argon(導入価格)Gemini 3.8 Flash(導入期間中)
入力$2$0.75
出力$10$3.75
導入価格の期限未公表2026年12月31日まで
今使えるか一部のサイバー防御者のみ開発者・企業・Google AI Pro/Ultra 加入者

単価はArgonのほうが高く設定されていますが、現時点では一般利用できません。料金を比べるのは、Argonが一般に開放されてからで十分です。

一般公開の順番と、まだ分かっていないこと

一般公開は、有料のAPIユーザーと Google AI Ultra 加入者から始まる予定です。ただし、日付は示されていません。

発表の時点で公表されていない項目は、次のとおりです。

項目状況
一般公開の日付未公表(「できるだけ早く」)
導入価格の終了日未公表
入力コンテキストの正式な上限未公表
APIのモデルID未公表
ナレッジカットオフ未公表
日本での提供未公表
日本語の品質未公表

日本での提供や日本語の品質が分からない以上、現段階で業務への組み込みを決めるのは時期尚早です。公開の範囲が広がった時点で、これらの項目を確認してから判断してください。

今日使えるGeminiは何か|まずGemini 3.8 Flashで

今日使えるGeminiは何か|まずGemini 3.8 Flashで

Argonが届くまでの間、あなたが今日使えるGeminiの主力は Gemini 3.8 Flash です。米国時間9月2日に公開された、Googleの現行モデルです。

使う人使える場所
開発者Google AI Studio・Android Studio
企業Gemini Enterprise
Google AI Pro / Ultra 加入者Geminiアプリ・Google検索のAI Mode・Googleスプレッドシート

Google AI Pro か Ultra に加入している方は、Geminiアプリやスプレッドシートからそのまま使えます。

Argonが来るまでの使い分け

現時点での現実的な活用方法を、順番に整理します。

  1. 日常の業務は Gemini 3.8 Flash で回す — 資料の要約、メールの下書き、スプレッドシートでの集計補助など、今の業務に使える
  2. 開発者は AI Studio で 3.8 Flash を試しておく — Argonが有料APIユーザーに開放されたとき、同じ仕組みの上でモデルを切り替えて比べやすい
  3. 長く複雑な仕事は、今ある他社の上位モデルも候補に入れる — Googleの表でもGPT-6 AstraやClaude Opus 5.5が上回る項目があるため、用途に合わせて選ぶ
  4. Argonの一般公開を待つ — 有料APIか Google AI Ultra から開放される予定なので、使いたいならこのどちらかを前提に準備しておく

なお、サイバー防御向けの Gemini 3.8 Flash Cyber も、Argonと同じく Fairwind Program の信頼済み防御者だけが使えるモデルです。一般のユーザーが選べる対象ではありません。

Gemini 3.8 Flashの性能や使い方は、以下の記事で詳しく解説しています。

Gemini 3.8 Flashの有意義な使い方|AIが書いた文章の「添削役」に回すと効く、安くて速いモデルの活かし方

Gemini 3.8 Flashの有意義な使い方|AIが書いた文章の「添削役」に回すと効く、安くて速いモデルの活かし方

ここまで読んで「Geminiを自社の業務システムに組み込みたい」と感じた方へ。法人向けAI研修の導入社数No.1*の弊社デジライズが、AIコンサルティング&開発のサービス資料を無料でお送りしています。既製のAIサービスでは要件が満たせず、自社に合わせたシステム構築や環境の検討が必要な場合の進め方をまとめています。

※出典:株式会社東京商工リサーチ「法人向けリスキリングサービスに関する調査」(2026年5月/調査期間:2026年3月26日〜4月17日/調査方法:デスクリサーチおよびヒアリング/2026年3月末時点)

まとめ

まとめ

Gemini 4 Argonのポイントをまとめます。

  1. 位置づけ — Geminiの「4」世代のフロンティアモデル。実務のソフト開発・知識労働・サイバー防御に強い
  2. 出力上限 — 64Kから100万トークンへ。長くて多段階の作業を1回の流れで進められる枠ができた
  3. 性能 — Googleが公表した表では19項目中14項目で首位(同率を含む)。ただし5項目はGPT-6 AstraやClaude Opus 5.5が上で、第三者の評価はまだ無い
  4. 料金と提供範囲 — 導入価格は入力$2・出力$10(100万トークンあたり)。今使えるのは一部のサイバー防御者だけで、一般公開の時期は未定

Argonが一般に開放されるまでは、Gemini 3.8 Flashで日々の業務を回しておくのが現実的です。公開が始まったら、日本での提供と日本語の品質を確かめたうえで、あなたの仕事で試してみてください。

比較の相手として何度も出てきたGPT-6 Astraがどんなモデルなのかは、以下の記事で詳しく解説しています。

GPT-6 Astraとは?「賢い回答」からPC作業の代行へ。仕様・料金・使える範囲を一次ソースで整理

GPT-6 Astraとは?「賢い回答」からPC作業の代行へ。仕様・料金・使える範囲を一次ソースで整理

参考資料

この記事の著者 / 編集者

チャエン

株式会社デジライズ 代表取締役

チャエン

法⼈向けのAI研修、及び企業向けChatGPTを開発する株式会社デジライズをはじめ、他数社の代表取締役。一般社団法人生成AI活用普及協会評議員を務めながら、GMO AI & Web3株式会社など他数社の顧問も兼任。NewsPicksプロピッカーも兼任。Twitterはフォロワー16万⼈。⽇本初AIツール検索サイト「AI Database」やAIとの英会話ができる「AI英会話」など複数のAIサービスも開発。ABEMAやTBSテレビなどメディア出演も多数。