この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • コーディング性能が大幅に向上し、複数のベンチマークでスコアが上昇
  • トークンあたりの料金が3.6 Flash当初の半額の導入価格
  • Gemini Sparkにも搭載され、Google Workspace連携が改善

発表の概要

Google DeepMindは2026年8月13日、Gemini 3.7 Flashを発表しました。これは、広く使われているFlashシリーズの最新モデルで、コーディングとエージェント向けに最適化されています。前モデルのGemini 3.6 Flashからわずか3週間でのリリースです。開発者からのフィードバックとアルゴリズムの革新を反映したものだとしています。

3.7 Flashは、ソフトウェアエンジニアリング、知識業務、ウェブ開発のワークフローで大幅な改善を実現しています。特に、コーディングとエージェントを「ワークホース(主力)」として使う開発者にとって、待望のアップデートと言えるでしょう。

ベンチマークで見る性能向上

コーディングタスクでは、デバッグや問題解決の能力が向上し、最初から正しく書けるコードの精度も高まりました。具体的には、FrontierCode 1.1 Mainで34.4%から43.6%へ、DeepSWE v1.1で49.0%から65.3%へスコアが改善しています。これらのベンチマークは、実践的なソフトウェア工学のタスクを評価するものです。

ウェブ開発では、より機能的なレイアウトや完全なアプリを少ないプロンプトで生成でき、UI生成のデザイン忠実度も向上しました。WebDev ArenaのEloスコアは1538から1588に上がっています。金融、法律、バイオサイエンスなどの知識集約型分野でも推論と正確性が向上し、GDP.pdfベンチマークでは22.0%から34.0%、AutomationBenchでは17.0%から30.4%に改善しています。

開発者体験と料金

開発者体験にも改善が見られます。3.7 Flashは、行き詰まりへの適応、意図の明確化、指示への忠実度が向上し、マルチステップの計画やツール呼び出しにもより多くの労力を割くようになりました。これにより、エンジニアリングワークフローでの手動監視やリトライの回数を減らせる可能性があります。

料金は、導入期間中は入力トークンあたり0.75ドル、出力トークンあたり3.75ドル(1Mトークンあたり)です。これは3.6 Flashの当初料金の半額で、性能向上と合わせて、プロダクション向けエージェントを低コストで運用できるとしています。早期の顧客フィードバックでも、低コストで3.6 Flashより顕著に良い結果が得られたということです。

Gemini Sparkへの搭載

Google AI Pro/Ultra契約者向けのAIエージェント「Gemini Spark」にも、本日から3.7 Flashが採用されます。Sparkは24時間稼働するパーソナルエージェントとして、ユーザーの指示のもとで自動的にアクションを実行します。モデル更新により、Google Workspaceアプリでのツール利用が改善され、複雑なマルチスキルワークフローでの精度と品質が向上する見込みです。

具体的には、ファイルの統合やメールの下書き、ステータス文書の更新などを効率的に行えるようになるとしています。対応国は160か国以上です。

安全性と提供開始

安全性に関して、Google DeepMindはフロンティア安全対策の適用範囲と堅牢性を改善し続けています。Gemini 3.7 Flashには、化学・生物・放射線・核(CBRN)やサイバー攻撃などにおける悪用防止策が更新されて搭載されています。一方で、有益な利用ケースは引き続き可能としています。

提供方法は、開発者向けにはGoogle AI StudioやAndroid Studioから、企業向けにはGemini Enterprise Agent PlatformとGemini Enterpriseアプリから利用できます。個人向けには、対応国のGoogle AI Pro/Ultra契約者がGeminiアプリのSpark経由でアクセスできます。

原文からの引用
Our most intelligent workhorse model yet for coding and agents.

コーディングとエージェント向けとして、これまでで最もインテリジェントなワークホースモデルです。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、このモデルの低価格と性能向上は、AIエージェントのプロトタイプ開発や本番運用のコストを下げられる可能性を示しています。ただし、ベンチマークは英語中心で、日本語の実務タスクでの性能は別途評価が必要です。また、リリース間隔が3週間と短いことは、モデル選定のサイクルも速くなっていることを示しており、定期的な評価とアップデートの仕組みが重要になるでしょう。具体的には、社内のコーディング支援や業務自動化に適用する際、料金体系と性能のバランスを検証し、自社のユースケースに合うかどうかを確認することが求められます。

用語解説

FrontierCode
コーディング性能を評価するベンチマークで、実用的なソフトウェア工学タスクを含む。
DeepSWE
ソフトウェアエンジニアリングの実践的なタスクを解く能力を測る評価指標。
WebDev Arena
ウェブ開発の生成結果を比較するアリーナ型のベンチマークで、Eloレーティングが用いられる。
GDP.pdf
複雑な文書の処理能力をテストする評価指標で、PDFなどのドキュメント理解を評価する。
AutomationBench
実業務のワークフローをどれだけ完遂できるかを測るベンチマーク。
トークン
AIモデルが処理するテキストの最小単位。日本語では1文字が複数トークンになることもある。

出典

Introducing Gemini 3.7 Flash

Google DeepMind / 2026年8月14日

https://deepmind.google/blog/introducing-gemini-3-7-flash

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する