この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 誤認識率はリアルタイムで4.0%、録音済みで2.6%
  • 85以上の言語を自動判別し、多話者の識別にも対応
  • 最終文字起こし完了までの時間がChirp 3比で70%改善

発表の概要

Google DeepMindは、音声認識モデル「Gemini 3.5 Transcribe」を公開しました。従来型の音声認識が苦手とする背景ノイズや複雑な専門用語、言い間違いの処理を得意とし、生の音声を正確で整形されたテキストに変換します。

このモデルは、Gemini APIやGoogle AI Studio、Gemini Enterprise Agent Platformを通じて開発者向けに公開されています。すでにGeminiアプリやAndroid向けの機能「Rambler」などで採用され、macOS版Geminiアプリでも利用可能です。

技術的特徴

Gemini 3.5 Transcribeには、話し言葉をそのまま活かす「スマート文字起こし」機能があります。「火曜日、いや水曜日」のような自己修正を理解し、「えー」などのフィラーを除去し、テキストを自動整形します。

また、ほかのGeminiモデルを呼び出す関数呼び出しに対応し、音声で画像生成やファイル分析などの複雑なタスクを指示できます。カスタム語彙を登録すれば、専門用語や独自の表記にも対応します。

従来モデルとの比較

Googleは、このモデルが従来の音声認識モデル「Chirp 3」から大きく進化したと説明しています。Artificial Analysisの測定では、リアルタイム処理の平均誤認識率は4.0%、録音済み音声では2.6%となっています。

多言語ベンチマークFLEURSでは、ストリーミングで5.50%、非ストリーミングで5.04%の誤認識率を記録しました。最終的な文字起こしが完了するまでの時間はChirp 3と比べて70%改善したとされています。

提供方法と利用シーン

開発者向けには、2つのAPIが用意されています。Live APIは双方向ストリーミングに対応し、サブ秒の遅延でインタラクティブな音声アプリに利用できます。Interactions APIは、録音済みの音声を処理し、話者ごとの書き起こしと単語レベルのタイムスタンプを提供します。

AgoraやLiveKitなど複数の開発プラットフォームが対応を表明しており、音声エージェントやリアルタイム字幕、通話後分析などの用途が想定されています。現時点ではパブリックプレビューとして提供されています。

注意点と課題

一方で、正確な話者識別は最大3人までで、3人以上は実験的なサポートとされています。カスタム語彙は対応するものの、具体的な登録数や精度の条件は公開されていません。

料金体系も現時点では明らかにされていません。パブリックプレビューがいつ終了し、一般提供時の条件がどうなるかは、今後の発表を待つ必要があります。

Gemini 3.5 Transcribeの利用形態による性能比較
項目リアルタイム(Live API)録音済み(Interactions API)
モデル名gemini-3.5-transcribe-livegemini-3.5-transcribe
WER(Artificial Analysis)4.0%2.6%
FLEURS(多言語)5.50%5.04%
主な用途音声エージェント会議や通話ログの文字起こし
原文からの引用
Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.

背景ノイズや複雑な専門用語、言い間違いの整理に困難を抱える従来の音声認識モデルとは異なり、Gemini 3.5 Transcribeは生の音声を直接、正確で見栄えのよい整形済みテキストに変換します。

今後の見通し

今後、パブリックプレビューから一般提供へ移行するにあたり、価格設定や日本語を含む各言語の精度、APIの安定性が明らかになれば、日本企業でも導入を判断しやすくなるとみられます。また、カスタム語彙の登録上限や話者識別の拡張など、追加情報の発表が期待されます。

日本の開発者・IT企業にとっての意味

日本企業にとって、音声入力によるアプリ操作や会議の自動議事録、コールセンターの通話分析など、実用的なユースケースが広がる可能性があります。特に、日本語を含む多言語対応と専門用語のカスタム語彙は、製造業や医療、法務など分野固有の用語が多いシステムへの組み込みに有利とみられます。リアルタイムで誤認識率4.0%を達成しているため、対話型音声UIの品質も向上するでしょう。一方で、データ処理がクラウド経由になるため、社内情報の取り扱いやレイテンシ要件を確認した上で導入を判断する必要があります。

気になる点

利用するにはどうすればいいですか?
Gemini APIをGoogle AI StudioまたはGemini Enterprise Agent Platformから利用します。現在はパブリックプレビュー中で、利用料金は未公表です。
日本語の音声認識はどの程度の精度ですか?
85以上の言語に対応しており、地域のなまりや多様な方言を扱えるとしています。ただし、日本語単体の誤認識率は公表されていません。
既存のChirp 3から移行できますか?
互換性についての公式な記述はありませんが、同じAPI経路で新モデルを指定して利用する形になります。詳細はドキュメントで確認が必要です。

用語解説

WER
Word Error Rateの略。音声認識結果の単語誤り率で、低いほど正確。
FLEURS
多言語音声認識の評価ベンチマーク。多くの言語で共通のテストセットを使う。
Live API
リアルタイム双方向ストリーミング用API。サブ秒の応答が特徴。
Interactions API
録音済み音声を処理するAPI。話者識別やタイムスタンプを提供。
Chirp 3
Googleの従来の音声認識モデル。Gemini 3.5 Transcribeの比較対象。

出典

Intelligent transcription with Gemini 3.5 Transcribe

Google DeepMind / 2026年8月27日

https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する