この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • Vera Rubin NVL72は電力あたり最大30倍のスループット
  • トークンあたりコストは最大35分の1に低減
  • 実測はSemiAnalysis AgentXワークロードに基づく

発表の概要

NVIDIAは2026年8月24日、エージェント型AI向けの推論プラットフォーム「Vera Rubin NVL72」の性能データを公開した。それによると、電力あたりのスループットは現行のGB300 NVL72と比べて最大30倍、トークンあたりのコストは最大35分の1になるという。

測定にはSemiAnalysis AgentXというワークロードを使用した。これは実際のエージェント型コーディングセッションを記録したもので、コンテキストの増加やツール呼び出し、サブエージェントの生成などが再現されている。ただし、この結果はSemiAnalysisのレビュー待ちであり、最終的な数値は変わる可能性がある。

エージェント型AIの特性

エージェント型AIは、通常のチャットとは異なり、タスクを完了するまで推論を続ける。OpenRouterのデータによると、エージェント型AIのワークロードは単純なチャットの約15倍のトークンを消費する。

たとえば投資判断のために企業を調査するエージェントは、金融データベースへの問い合わせ、ニュースや書類の検索、サブエージェントによる競合比較や評価モデルの実行、その結果の統合といった一連のステップを実行する。各ステップで蓄積されたトークンは次のステップへの入力となり、コンテキストが数十万トークンに達することもある。

技術的な新しさ

Vera Rubin NVL72は、ソフトウェアとハードウェアを密結合した「コデザイン」によって推論効率を高めている。具体的には、プリフィルとデコードを分離するディスアグリゲーテッドサービングや、大規模エキスパート並列処理、分散KVキャッシングなどの技術を備える。

また、NVLinkの第6世代は既製イーサネットと比べてパケットレートが10倍、レイテンシが3分の1に向上している。さらに、NVIDIAはDSX MaxLPSによりGPU、ラック、ワークロードの各レベルで電力を管理し、同じ電力枠で最大40%多くのGPUを利用できるとしている。

注意点と今後の課題

今回の結果はVera Rubin NVL72の初期の性能を示すものであり、Vera CPUによるツール呼び出しの性能はまだ反映されていない。フルプラットフォームはVera CPU、Groq 3 LPU、NVLink 6 Switchなど7種類のチップで構成されるが、それらを含めた全体性能は今後明らかになる見通しだ。

また、NVIDIAはソフトウェアの最適化を継続することで、Vera Rubin NVL72とGB300 NVL72の両方の性能がさらに向上すると述べている。そのため、現時点の数値はあくまで初期のスナップショットとして捉えるのが適切だろう。

Vera Rubin NVL72とGB300 NVL72のエージェント型AI性能比較
指標GB300 NVL72Vera Rubin NVL72
電力あたりスループット基準(1x)最大30倍
トークンあたりコスト基準(1x)最大35分の1
原文からの引用
For power-constrained AI factories, throughput per megawatt determines AI factory revenue and cost per million tokens determines the profit margin on that revenue.

電力制約のあるAIファクトリーでは、メガワットあたりのスループットがAIファクトリーの収益を決定し、100万トークンあたりのコストがその収益の利益率を決定する。

今後の見通し

今後はSemiAnalysisによるレビュー結果や、実際の導入事例が注目される。Vera CPUを含むフルプラットフォームでの性能がどうなるかも焦点だ。GB300 NVL72もソフトウェア最適化で性能向上が見込まれるため、新旧プラットフォームの比較は今後も変わる可能性がある。また、電力あたりの性能がAIファクトリーの収益性に直結するため、電力制約の強い地域ではこの指標が採用判断の重要な基準となるだろう。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、エージェント型AIは顧客対応やソフトウェア開発などで実用化が進む一方、トークン消費量の多さから電力コストと応答レイテンシが課題になる。Vera Rubin NVL72の電力あたり性能向上は、AIファクトリーやデータセンターの運用コストを大幅に下げられる可能性を示す。特に電力供給に制約がある日本では、同じ電力でより多くのエージェント処理を実行できることは、サービス提供の拡大や採算性の向上につながる。また、トークンあたりコストの低減は、顧客への従量課金モデルや社内AI活用の敷居を下げる要因になるだろう。

気になる点

Vera Rubin NVL72はいつ導入可能か?
記事によれば、Vera Rubinはすでに量産に入っており、エコシステム全体に展開が進んでいます。ただし、具体的な出荷時期や価格は公表されていません。
電力あたり30倍という数字はどのように測定されたのか?
SemiAnalysis AgentXという実在のエージェント型コーディングセッションを記録したワークロードを使い、NVIDIAが測定しました。現在SemiAnalysisによるレビュー待ちであるため、最終的な数値は変わる可能性があります。

用語解説

エージェント型AI
ユーザーの目的を達成するために、ツールを呼び出したり複数のステップを自律的に実行したりするAIシステム。
スループット
単位時間あたりに処理できるデータ量やタスク数。ここでは電力あたりの推論処理効率を指す。
KVキャッシュ
推論中に計算したキーとバリューを保持し、同じコンテキストを再計算せずに再利用するための仕組み。
AIファクトリー
AIモデルの推論や学習を大規模に行う専用のデータセンター施設。

出典

Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents

NVIDIA / Shruti Koparkar / 2026年8月25日

https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する