チャエン

株式会社デジライズ 代表取締役

チャエン

Googleが音声対話モデル Gemini 3.8 Live と、その上位版 Gemini 3.8 Live Extended Thinking を公開しました。発表は米国時間2026年9月15日です。

売りは「会話が止まらないこと」です。文の途中で割り込んでも途切れず、カメラを向けた対象をほぼリアルタイムで理解し、裏でツールを呼んでいる間も話し続けます。

そしてもうひとつ大きな変化は、この音声モデルがGmail・Googleドキュメント・Google Keepの中で動くようになった点です。専用のAIアプリを開いて話しかけるのではなく、毎日開いているメールとメモの中で音声が使えるようになりました。

今なら、生成AIの基礎知識から社内導入の6ステップ・定着のポイントまでを1冊にまとめた「はじめての生成AI社内導入ガイド」を無料で配布中!何から始めればいいか分からない方でも、これ1冊で導入の流れがつかめます。

Gemini 3.8 Liveとは|「黙り込まない」音声AIが2モデルで登場

Gemini 3.8 Liveとは|「黙り込まない」音声AIが2モデルで登場

今回出たのは2つのモデルです。名前は似ていますが、役割ははっきり分かれています。普段づかいのモデルと、難しい課題を任せるモデルという関係です。

Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
位置づけ規模とコスト効率を重視した常用モデル難度の高い課題向けの上位モデル
Googleの説明会話の知性と、流れるような対話・視覚の把握を組み合わせたモデル知性を高め、複数ステップの推論を行うモデル
話し方の特徴会話のテンポを優先する推論と発話を並行し、作業の進捗を口頭で実況しながら進める
向いていそうな使い方検索しながらの質問、その場の手順案内複数ステップの裏作業を抱えたままの会話

(出典: Google公式ブログ

差が出るのは「考えている時間」の扱いです。従来の音声AIは、裏で検索やツール実行が走ると返事が止まり、ユーザーは黙って待つ必要がありました。Extended Thinkingは推論と発話を並行させ、進捗を口に出しながら作業を進めます。

両モデルに共通する機能は次の4つです。

  1. 推論の強化 — 推論性能が引き上げられている
  2. ほぼリアルタイムの視覚理解 — カメラに映っているものを見ながら会話する
  3. 97言語の自動検出 — 会話の途中で言語が変わっても、設定を触らずに切り替わる
  4. バックグラウンドのツール呼び出し — 会話を妨げずに裏で処理を走らせる

(出典: Google公式ブログGoogle DeepMind公式X(@GoogleDeepMind)

Gemini 3.8 LiveでGmail・Googleドキュメント・Keepはどう変わるか

Gemini 3.8 LiveでGmail・Googleドキュメント・Keepはどう変わるか

ここは順番を取り違えやすいので、先に時系列を整理します。音声機能そのものは今回の発表より前から動いており、変わったのはその裏側のモデルです。

日付何が起きたか
2026年9月3日Gmail・Googleドキュメント・Google Keepの音声機能(Gmail Live/Docs Live/Keep Live)が先行公開
2026年9月15日(米国時間)これらがGemini 3.8 Live Extended Thinkingで動くようになると発表

(出典: Google公式ブログ「Voice features in Gmail, Docs and Keep」Google公式ブログ

Gmail Live|受信トレイを会話で検索する

「フライトの搭乗ゲートは何番?」のように話しかけると、受信トレイを探して答えます。「今週、子どもの学校で何がある?」といった、件名では検索しづらい質問にも答えられるのが特徴です(Google公式ブログより)。

Docs Live|話しながら文書を組み立てる

会話しながら、構成の整った文書をその場で作っていきます。許可すればGmail・Google Drive・Google Chat・ウェブから関連情報を引いてきて、文書に反映します。白紙から書き出す前の、考えがまとまっていない段階を任せる使い方になります。

Keep Live|とりとめのない話をメモに変える

思いついた順に話した内容を裏で処理し、構造化されたリストやメモに整えます。こちらが入力する必要はありません。移動中や作業中に出てきた断片を、後から読める形にして置いておく役割です。

Google Workspace側でAIをどう業務に組み込むかという話は、以下の記事でも扱っています。

Google Workspace Studioとは?使い方・料金・活用事例30選を徹底解説

Google Workspace Studioとは?使い方・料金・活用事例30選を徹底解説

今だけ12大特典を無料プレゼント中。ChatGPTやGeminiの実践テクニックをまとめた限定コンテンツを、LINE登録だけでお届けしています。

Gemini 3.8 Liveはどのプランで使えるか

Gemini 3.8 Liveはどのプランで使えるか

提供先はモデルごとに分かれています。発表に書かれている範囲を、使う場所ごとに並べると次のようになります。

使う場所動くモデル使える人
Google検索のSearch LiveGemini 3.8 Live消費者向けに提供(加入条件の記載なし)
GeminiアプリのGemini LiveExtended Thinking消費者向けに提供
Gmail・Google KeepExtended ThinkingGoogle AI Plus・Pro・Ultra加入者
GoogleドキュメントExtended ThinkingGoogle AI Pro・Ultra加入者
Google Workspaceの法人アカウントExtended Thinking近日提供(時期は未発表)
Gemini API・Google AI Studio両モデル開発者向けのパブリックプレビュー
Gemini Enterprise両モデル企業向けのプライベートプレビュー

(出典: Google公式ブログGoogle公式ブログ「Voice features in Gmail, Docs and Keep」

注意したいのは、会社のGoogle Workspaceアカウントは「近日提供」に入っている点です。個人で加入しているGoogle AIプランでは使えても、仕事用アカウントでは表示されないという状態が起こり得ます。

日本から使えるか、日本語で話せるかは、使う場所ごとに状況が違います。発表ページには地域も言語の内訳も書かれていませんが、ヘルプと開発者向けドキュメントで次の2点が確認できます。

  1. Gmail Live — Google AI Plus・Pro・Ultra加入者ならすべての国・地域で使える。ただし対応言語は英語のみで、使えるのはiOSとAndroidのアプリ(Gmailヘルプより)
  2. Gemini APIのLive API — 対応する97言語の一覧に日本語が入っている(Live API 機能ガイドより)

Docs LiveとKeep Liveの対応言語は確認できていません。日本語での聞き取りや話し方の品質も、今回の発表からは判断できません。Gmailで試すなら、今は英語で話しかける前提になります。自分の環境で確かめる手順は次のとおりです。

  1. 自分のGoogle AIの加入プランを確認する(Plus・Pro・Ultraのいずれか)
  2. スマートフォンのGmail・Google Keep・Googleドキュメントで、音声の操作が出てきているかを見る
  3. 仕事用アカウントで見つからない場合は「近日提供」の対象なので、個人アカウントと混同しないようにする

Gemini 3.8 Liveのデモに見る「話しながら」の使いどころ

Gemini 3.8 Liveのデモに見る「話しながら」の使いどころ

公開されたデモを見ると、Googleがどの場面を想定しているかが分かります。発表と同時に示されたのは次の4つです。

  1. カメラを向けて直し方を聞く — Search Liveで、壊れた自転車のチェーンや水漏れしている配管にカメラを向け、手順ごとに音声で案内を受ける
  2. プログラミングの個人指導役 — Extended Thinkingがプログラミングの家庭教師役を務める様子を実演
  3. 複数ステップの裏作業を抱えたまま話す — イベント計画のような段取りを裏で進めながら、会話の流れを切らさない
  4. 言語をまたぐ会話 — 会話の途中で97言語を自動検出して切り替える

(出典: Google公式X(@GoogleAI)Google DeepMind公式X(@GoogleDeepMind)

並べてみると、共通しているのはキーボードの前に座っていない時間です。工具を持っている、手が汚れている、画面を見ながら別の作業をしている。そういう状態で「今どうすればいい?」と聞ける相手がいる、という状況を作れます。

もうひとつは、頭の中がまだ整理できていない段階です。Keep Liveのようにとりとめのない話をメモに変える機能は、書き出す前の段階を引き受けるものと言えます。

手が離せない時間と、考えがまとまっていない時間。この2つは、これまでAIに渡しにくかった領域です。音声が効くとすればここだろう、というのが今回のデモから読み取れる方向性です。

音声で仕事を速くするという観点では、Mac向けの音声入力ツールを扱った記事もあわせてご覧ください。

Superwhisper(スーパーウィスパー)とは?料金・買い切り・使い方を徹底解説【2026年最新】

Superwhisper(スーパーウィスパー)とは?料金・買い切り・使い方を徹底解説【2026年最新】

Gemini 3.8 Liveと他の音声AIの位置づけ

Gemini 3.8 Liveと他の音声AIの位置づけ

Googleは発表記事の中で、第三者が測定したベンチマークの値を引用しています。以下はいずれもExtended Thinking側の数値です。

指標何を測るかGemini 3.8 Live Extended Thinking
Artificial Analysis「Speech to Speech Quality Index」音声対話の総合的な品質82.6(Googleは総合1位と説明)
τ-Voice音声でのタスク遂行68.6%
Sierra「τ-Voice-banking」銀行業務を模したタスク遂行35.1%
Big Bench Audio音声での推論97.7%

(出典: Google公式ブログ。いずれもGoogleの発表記事が引用している第三者測定の値です)

ここは「世界1位のモデルが出た」と単純化しないほうがいい部分です。音声AIは指標ごとに首位が入れ替わる分野で、総合指数、タスクの成功率、応答の速さ、人が聞いて好ましいと感じるか——どれを見るかで結果が変わります。

競合として並ぶのはOpenAIのGPT-Live-1と、xAIのGrok Voice Think Fast 2.0です。各社とも更新の間隔が短いので、比較を見るときはいつ測ったどの世代かを確認した上で判断してください。

APIから使う場合の仕様と料金

開発者向けにはGemini APIとGoogle AI Studioでプレビュー提供されています。Gemini 3.8 Liveの仕様は次のとおりです。

項目内容
モデルIDgemini-3.8-live
入力できるものテキスト・画像・音声・動画
出力テキスト・音声
入力の上限131,072トークン
出力の上限65,536トークン
料金(音声)無料枠: 無料/有料枠: 入力 $0.005/分・出力 $0.018/分

(出典: Google「Gemini 3.8 Live」モデル仕様Gemini API 料金ページ。料金はGemini 3.8 Liveの値です)

同じGoogleの音声系モデルでも、読み上げ(音声合成)は別系統のモデルが担当しています。そちらの仕組みと使い方は以下の記事で解説しています。

Gemini 3.1 Flash TTSとは?料金・使い方・日本語ナレーション生成を徹底解説

Gemini 3.1 Flash TTSとは?料金・使い方・日本語ナレーション生成を徹底解説

まずは情報収集からでも歓迎です。導入の流れや支援内容をまとめた資料をこちらからご覧いただけます。

まとめ|Gemini 3.8 Liveを使えるようになる前に準備しておけること

まとめ|Gemini 3.8 Liveを使えるようになる前に準備しておけること

今回の発表を短く整理します。

ポイント内容
何が出たか音声対話モデルのGemini 3.8 Liveと、上位版のExtended Thinking
いちばんの変化音声が専用アプリの外に出て、Gmail・Googleドキュメント・Google Keepの中で動くようになった
使える人Gmail・KeepはGoogle AI Plus・Pro・Ultra加入者、ドキュメントはPro・Ultra加入者
待ちになる人Google Workspaceの法人アカウントは「近日提供」で時期は未発表
分かっていないことDocs Live・Keep Liveの対応言語と、日本語での使い心地(Gmail Liveは現時点で英語のみ)

自分の画面に出てくるのを待つ間にできる準備は、次の3つだと考えています。

  1. 声で頼みたい仕事を書き出す — 移動中の指示出し、現場での確認、思いつきのメモ。手が離せない時間と、考えがまとまっていない時間に当たる仕事を先に洗い出しておく
  2. 自分のプランを確認する — Gmail・KeepはPlus以上、ドキュメントはPro以上です。どこまで使えるかはプラン次第です
  3. 会社のアカウントは分けて考える — 法人向けは「近日提供」です。個人アカウントで試せた機能を、そのまま社内展開の前提にしない

音声で操作できる範囲が広がると、変わるのは「AIに何を頼むか」より「いつ頼むか」のほうです。机の前に戻ってから入力していた依頼を、その場で口に出して済ませられるか。準備しておく価値があるのは、この切り替えだと私は考えています。

この記事の著者 / 編集者

チャエン

株式会社デジライズ 代表取締役

チャエン

法⼈向けのAI研修、及び企業向けChatGPTを開発する株式会社デジライズをはじめ、他数社の代表取締役。一般社団法人生成AI活用普及協会評議員を務めながら、GMO AI & Web3株式会社など他数社の顧問も兼任。NewsPicksプロピッカーも兼任。Twitterはフォロワー16万⼈。⽇本初AIツール検索サイト「AI Database」やAIとの英会話ができる「AI英会話」など複数のAIサービスも開発。ABEMAやTBSテレビなどメディア出演も多数。