
- KVキャッシュのスラッシングを防ぐプログラム抽象化
- OpenAI互換でprogram_idを追加するだけの導入容易性
- SkyRLやNVIDIA Dynamoにも採用され、オープンソースで公開
発表の概要
ThunderAgentは、Together AIとジョージア工科大学、イリノイ大学アーバナ・シャンペーン校、カーネギーメロン大学の共同研究として開発された、エージェント型推論のためのスケジューリング層です。ICML 2026のSpotlight論文として採択され、ソースコードはGitHubで公開されています。エージェントがツールを呼び出しながらタスクを進める際に発生する、メモリ管理の非効率を解消することを目的としています。
エージェント型LLMは、推論、ツール呼び出し、結果の確認、そして再度の推論というサイクルを何十回も繰り返します。こうしたマルチターンの振る舞いを学習するためには、エージェントの軌跡を含む合成データを大規模に生成する必要があります。ThunderAgentは、この合成データ生成を高速に行うための基盤技術として位置づけられています。
KVキャッシュ・スラッシングとは
既存の推論エンジンは、個々のLLM呼び出しを独立したリクエストとしてスケジュールします。そのため、エージェントがツールの応答を待っている間にKVキャッシュが追い出され、再開時に再度計算されるという問題が発生します。これをKVキャッシュ・スラッシングと呼びます。
高並列環境では、この追い出しと再計算の連鎖がスループットとレイテンシを大きく悪化させます。ノードを増やしても、エージェントのコンテキスト長が予測できないため、ノード間でメモリ負荷の偏りが生じます。また、CPUやディスクへのオフロードも、全体のキャパシティを超えると結局スラッシングが再発します。
ThunderAgentの仕組み
ThunderAgentは、エージェントのワークフロー全体を一つの「プログラム」として抽象化し、その実行フェーズ、KVキャッシュの使用量、配置ノードを追跡します。ノードのメモリ圧力を監視し、優先度の低いワークフローを一時停止させることで、同時にキャッシュを競合するプログラムの数を減らします。これにより、アクティブなワークフローのKVキャッシュヒット率が向上し、レイテンシが低減します。
再開時には、グローバルな待機キューから最も空き容量のあるノードへルーティングすることで、クラスタ全体の負荷を平準化します。また、KVキャッシュのオフロードとも併用可能で、GPU、CPUメモリ、ディスクを統合されたプールとして扱うことができます。クライアント側の変更は、リクエストにprogram_idフィールドを追加するだけです。
評価結果と採用状況
公開された評価では、8枚のH100を搭載した単一ノードで、バッチサイズ192のとき、SGLangのデフォルトスケジューラと比較してスループットが390トークン/秒から803トークン/秒に向上し、平均レイテンシは65秒から10.6秒に改善しました。多ノードでは、16GPUから64GPUまでスループットが671から2,248ステップ/分へとほぼ線形にスケールし、8ノード時点でSGLang Gateway比2.39倍の高速化を達成しています。この傾向はクラスタサイズが大きくなるほど高速化の幅が広がることを示しています。
ThunderAgentは、Together AIの社内合成データ生成パイプラインに統合されているほか、オープンソースのSkyRLやNVIDIA Dynamoにも採用されています。一方で、現時点で公表されている測定結果はH100クラスタに基づくものであり、他のハードウェアやワークロードでの性能は今後の検証が待たれます。また、論文では本稿で触れた以外の詳細な議論が参照されています。
The core shift is treating each agent workflow as a program rather than a series of unrelated requests.
中心となるのは、各エージェントのワークフローを、無関係な一連のリクエストではなく一つのプログラムとして扱うことです。
日本の開発者・IT企業にとっての意味
日本のIT企業にとって、エージェント型LLMを実際に運用する際のインフラコスト削減に直結する技術です。ThunderAgentはOpenAI互換のエンドポイントを備え、既存の推論エンジンの最適化(投機的復号など)と併用できるため、大規模な段階で導入しやすいと言えます。特に、エージェント向けの合成データ生成はデータ作成コストが課題となるため、同じハードウェアで2倍以上のスループットを得られる点は実務上のメリットが大きいでしょう。今後の発展として、プログラム抽象化の考え方がエージェント推論の新しい標準となる可能性があります。
用語解説
- KVキャッシュ
- LLMが生成した過去のトークンの鍵と値を保持するメモリ。再計算を避けるために使う。
- KVキャッシュ・スラッシング
- 限られたメモリ内でKVキャッシュの追い出しと再計算が繰り返され、性能が著しく低下する現象。
- 投機的復号 (speculative decoding)
- 小さなモデルで候補トークンを生成し、大きなモデルで検証することで生成を高速化する技術。
- プログラム抽象化
- エージェントの一連のやり取りを一つの実行単位として扱う考え方。ThunderAgentの中核。
出典
ThunderAgent: 2x Faster Agentic Inference for Synthetic Data Generation at Scale
企業のAI活用顧問を、いまなら無料で承っています
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて一緒に整理します。導入前の相談だけでも構いません。
無料でAI活用の相談をする