この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 音声対話向けの2モデルを同時発表。会話を中断せずツール実行や視覚処理を並行して行う
  • Extended ThinkingはSpeech to Speech Quality Index 82.6で総合1位、τ-Voiceは68.6%
  • 97言語を会話中に自動切替。生成音声にはSynthIDのウォーターマークを付与

発表の概要

Google DeepMindは2026年9月15日、音声対話に特化した2つのモデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表した。同社はこれを「これまでで最も先進的なライブ対話モデル」と位置づけ、知性と並列推論の大幅な強化によって音声だけで複雑なタスクを実行しやすくなったとしている。発表はGemini Audio Teamを代表して、プリンシパルエンジニアのMalini Jaganathan氏らが担当した。

両モデルは、複雑な推論、リアルタイムの視覚コンテキスト、バックグラウンドでのタスク実行を、会話を中断せずに処理する。提供は同日から順次始まり、開発者向けにはGemini APIとGoogle AI Studio、一般向けにはSearch LiveやGemini Live、企業向けにはGemini Enterpriseのプライベートプレビューなどが挙げられている。Google WorkspaceやSearchでの利用も案内されている。

2モデルの役割分担

Gemini 3.8 Liveは、スケールとコスト効率を重視して設計されたモデルである。流暢な対話と視覚的なグラウンディング(視覚情報を会話の文脈に結びつける仕組み)を組み合わせ、手頃な価格で多くの音声エージェントを動かす用途を想定しているとみられる。原文では、開発者や企業が信頼できる本番向けの音声エージェントを構築するための構成要素を提供すると説明されている。

一方のGemini 3.8 Live Extended Thinkingは高複雑度タスク向けで、マルチステップの推論を担う。推論しながら同時に発話し、「Let me check that…」のような早期の口頭サインで依頼を自然に受け止め、バックグラウンド処理の進捗を実況する点が特徴として挙げられている。両モデルはバックグラウンドでツールやAPI呼び出しを進め、その間も会話を継続できる。

Gemini 3.8 Liveは視覚入力をほぼリアルタイムで処理し、会話の途中で97のサポート言語を自動検出して切り替える。原文では、従業員オンボーディングの案内やチェスの対局、Reactコンポーネントの生成、複数ステップの予約調整といったデモが示されている。

ベンチマーク結果

Gemini 3.8 Live Extended Thinkingは、Artificial AnalysisのSpeech to Speech Quality Indexで82.6を記録し総合1位になったとしている。エージェントタスクの完了ではτ-Voiceで68.6%、Sierraのτ-Voice-bankingで35.1%を記録し、推論能力ではBig Bench Audioで97.7%をスコアした。同時に、他のフロンティアモデルと比べて競争力のある価格帯を維持していると述べられている。

Gemini 3.8 LiveはSpeech Agent Arenaで2位につけ、ユーザーからの支持が高いとされる。あわせてコスト効率にも優れ、スケール向けに設計されたモデルだと説明されている。ServiceNowのEVA-Benchでは、両モデルが精度と対話品質のバランスを取ることで複雑なワークフローのパレートフロンティアを押し広げたとしている。この測定はGemini Enterprise Agent Platform上のLive APIで実行されたとの注記がある。

開発者向けの提供体制

開発者向けには、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision AgentsといったプラットフォームがGemini Live APIを利用し、高性能な音声インターフェースを構築・展開できるとしている。これらのプラットフォームがリアルタイムのメディア配信基盤を裏側で担うことで、開発者はユーザー体験の設計に集中できるという整理である。

Salesforce、Genspark、Lumerisもパートナーとして名を連ね、低遅延性や流暢さ、ツール呼び出し能力を評価しているとされる。安全性の面では、AI製品が生成するすべての音声にSynthIDのウォーターマークが埋め込まれる。知覚できない形で音声出力に織り込まれ、AI生成コンテンツを検出可能に保つことで誤情報の防止に役立てる狙いだと説明されている。

現時点の留意点

料金体系は原文に記載がない。Extended Thinkingについては「他のフロンティアモデルと比べて競争力のある価格帯」と述べられているのみで、具体的な単価は示されていない。日本国内での提供開始時期や、企業向け機能の一般提供の時期も明らかにされていない。

ベンチマークの数値は各指標の提供元によるもので、比較条件や他社モデルのスコアは原文では示されていない。97言語がサポートされるとされているが、どの言語が対象で、日本語の精度がどの程度かは記載がない。既存のLive API実装からの移行手順や後方互換性にも触れられていない。

Gemini 3.8 LiveとExtended Thinkingの位置づけの比較
項目Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
設計の狙いスケールとコスト効率を重視高複雑度タスク向けのマルチステップ推論
主な評価結果Speech Agent Arenaで2位Speech to Speech Quality Index 82.6(総合1位)、τ-Voice 68.6%、Sierra τ-Voice-banking 35.1%、Big Bench Audio 97.7%
開発者向けの提供先Gemini API、Google AI StudioGemini API、Google AI Studio
一般向けの提供先Search LiveGemini Live、Google AI Pro・Ultra向けWorkspaceのDocs、全Google AI購読者向けGmail・Keep
原文からの引用
All audio generated by our AI products is watermarked with SynthID. This imperceptible watermark is woven directly into the audio output, ensuring AI-generated content remains detectable.

当社のAI製品が生成するすべての音声にはSynthIDによるウォーターマークが付与されます。この知覚できないウォーターマークは音声出力に直接織り込まれ、AI生成コンテンツを検出可能に保ちます。

今後の見通し

今後は、Gemini EnterpriseやGoogle Workspaceのビジネス顧客向け提供が「coming soon」とされている段階から、実際にどこまで広がるかが焦点になる。Extended Thinkingの推論品質と遅延のバランスが実運用でどうなるかは、公開されたベンチマークの数値だけでは判断しにくい。料金体系、日本語を含む各言語での精度、企業データの保存・処理場所、既存のLive API実装からの移行可否が明らかになれば、導入判断がしやすくなる。音声エージェントの競争は、ベンチマークの順位よりも長時間の対話でどれだけ安定してタスクを完了できるかに移っていくとみられる。

日本の開発者・IT企業にとっての意味

音声エージェントは、コールセンターの一次応対や予約受付、社内ヘルプデスクなど、日本のIT企業が受託・内製する案件で需要が伸びている領域である。今回の発表で注目すべきは、対話を止めずにツール呼び出しや多段階推論を進める設計が前面に出た点で、従来は待ち時間が出やすかった「聞く→考える→答える」の流れを、発話しながら処理する形に変えられる可能性がある。Agora、LiveKit、Pipecat、Vercelなど主要な音声基盤がGemini Live API経由で対応を表明しているため、リアルタイム配信基盤を自前で作らずに済む選択肢が増える。一方、料金や日本語精度、データの取り扱いは原文からは判断できず、見積もりや要件定義の前提を置くには情報が不足している。SynthIDによる音声ウォーターマークは、AI音声であることの開示が求められる場面で説明材料になり得る。

気になる点

日本からでも利用できますか。料金はいくらですか。
提供チャネルは原文に明記されており、開発者向けはGemini APIとGoogle AI Studio、一般向けはSearch LiveやGemini Liveなどで順次提供されます。ただし料金体系の記載はなく、Extended Thinkingは「競争力のある価格帯」とだけ述べられています。日本国内での提供開始時期や対応状況も現時点では公表されていません。
2つのモデルはどう使い分ければよいですか。
原文では、Gemini 3.8 Liveはスケールとコスト効率を重視し、流暢な対話と視覚的グラウンディングを組み合わせたモデルとされています。Extended Thinkingは高複雑度タスク向けで、推論しながら発話し、多段階処理の進捗を実況します。大量の定型応対にはLive、手順の多い業務処理にはExtended Thinkingが想定されているとみられます。
既存のGemini Live APIの実装をそのまま移行できますか。
原文には移行手順や後方互換性についての記載がなく、判断できる情報は示されていません。利用経路としてGemini APIとGoogle AI Studio、企業向けにはGemini Enterpriseのプライベートプレビューが挙げられているため、既存実装の扱いはモデルカードやAPIドキュメントの確認が必要になるとみられます。

用語解説

音声エージェント
音声で利用者と対話し、予約や問い合わせ対応などのタスクを実行するAIシステム。低遅延の応答が求められる。
Live API
リアルタイムの音声や映像を扱うためのGeminiのAPI。双方向の低遅延対話をアプリに組み込める。
τ-Voice
音声エージェントのタスク完了能力を評価するベンチマークの一つ。原文では評価方法の詳細には触れていない。
SynthID
Googleが提供する電子透かし技術。AI生成コンテンツに知覚できない印を埋め込み、検出可能にする。
グラウンディング
AIの応答を視覚情報などの実データに結びつけ、文脈に沿った回答をさせる手法。
パレートフロンティア
複数の評価軸で、一方を犠牲にせず他方を改善できない最良の組み合わせの境界を指す。

出典

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

Google DeepMind / 2026年9月16日

https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する