この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 公開済みのxhigh設定はフロンティア水準に到達、最上位はAnthropic
  • 最上位のmax設定は未提供で、一部ベンチマークではxhighを大きく上回る
  • 価格は1.2から据え置き、ツール呼び出し約20%・トークン使用約25%減

発表の概要と提供状況

米Metaはコード生成とAIエージェント向けの新モデル「Muse Spark 1.3」を発表した。ザッカーバーグCEOはXへの投稿で「フロンティア性能を、計測するのがもったいないほど安い価格で提供する」と述べ、コーディングとエージェント業務での「最大のジャンプ」としている。

ただし、最高性能を発揮する「max」という推論設定は、まだ追加の安全性テストを実施中だ。Metaは「まもなく」提供されるとしているが、第三者のベンチマーク機関であるArtificial Analysisは、限定プレビューでしか評価しておらず、現時点でこの設定をAPI提供する事業者は存在しない。

ベンチマークで見る性能差

Metaの評価レポートでは、maxとxhighの両方の結果が開示されている。代表的な指標ではmaxがxhighを上回るが、一部では逆転もある。コード生成評価であるGDPval-AA v2ではmaxが1754Elo、xhighが1709Elo、OSWorld 2.0では66.9対57.2、JobBenchでは64.9対61.2だ。一方、Terminal-Bench 2.1ではxhighが89.2、maxが88.8とxhighが上回る。

Artificial Analysisのインテリジェンス指数では、maxが62、xhighが61。xhighはGPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 highと同点に並ぶ。ただし、Anthropicの最上位モデルClaude Fable 5.1はmaxで66、xhighで65と、いまだ最上位を維持している。

つまり、実際に使えるxhigh構成はフロンティア集団に入る正当な性能を持つが、現時点のベンチマーク首位は別のモデルという位置づけだ。

前モデルからの改善点

前モデルのMuse Spark 1.2は、コード評価でAnthropicのClaude Opus 5に後れを取ることが多かった。例えばTerminal-Bench 2.1では1.2が82.9%、Opus 5が86.7%だった。だが1.3は、コード生成とエージェント評価の複数の指標でOpenAIやAnthropicと互角に渡り合うようになった。

Metaはまた、運用面の改善も強調している。長いスレッドで複数のワークフローを管理し、ツールで情報を集めながら計画の穴を見つけ、必要に応じてユーザーに確認を求める訓練が行われた。社内比較では、コーディング作業でのツール呼び出しが約20%、消費トークンが約25%少なくなった。

多数のエージェントループを回す企業にとっては、こうした行動の効率化がリーダーボード上の数字以上に重要になることがある。

価格と導入の判断材料

Muse Spark 1.3は価格改定を行わなかった。従来と同じく入力トークン100万あたり1.25ドル、出力トークン100万あたり4.25ドル、キャッシュ入力トークン100万あたり0.15ドルである。「ほぼ安すぎて測定できない」というCEOの発言は、性能あたりのコストの安さを指したものとみられる。

企業が採用を検討する際は、公開中のxhigh構成と未提供のmax構成の性能差を理解しておく必要がある。ベンチマーク上の最大値を前提にして設計すると、本番環境で期待とずれる可能性がある。まずは利用可能なxhigh構成で実タスクを検証するのが現実的だ。

Muse Spark 1.3のmaxとxhighの性能比較
指標max(未提供)xhigh(提供中)
GDPval-AA v2 (Elo)17541709
OSWorld 2.066.957.2
JobBench64.961.2
DeepSearchQA89.489.4
Terminal-Bench 2.188.889.2
Artificial Analysis Intelligence Index6261
原文からの引用
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter,

Muse Spark 1.3は本日から展開する。フロンティア性能でありながら、計測するのがもったいないほど低コストだ。

今後の見通し

max構成の提供が始まれば、実際の開発現場でxhighとの性能差がどれほどあるのか検証が進むとみられる。また、Metaが今後も価格を維持するのか、AnthropicやOpenAIがどう対抗するのかも焦点になる。現時点では、max構成の安全性テスト完了時期と、第三者による詳細な評価結果が明らかになれば、導入判断を下しやすくなるだろう。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、この発表は海外クラウドモデルの選択肢が広がることを意味する。特にエージェントを多数実行するサービスでは、ツール呼び出し数とトークン消費の削減が運用コストに直結する。また、コード実行環境を含む「Muse Code」ハーネスが提供されるため、既存の開発フローへの組み込みやすさも検討材料になる。一方、最上位のmax構成がまだ使えないことで、ベンチマークの数値と実際の利用環境の差を意識しなければならない。公開済みのxhigh構成をPoCで試し、自社のコーディングタスクやエージェント成功率を独自に評価することが有効とみられる。

気になる点

一般公開されているxhigh構成はどのレベルか?
Artificial Analysisのインテリジェンス指数では61を記録し、GPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 highと同水準です。ただしAnthropicの最上位モデルClaude Fable 5.1の65には及ばず、フロンティア集団の一角という位置づけです。
max構成はいつ使えるようになるか?
Metaは「まもなく」としていますが、具体的な日程は公表されていません。現在も安全性テスト中で、Artificial Analysisは限定プレビューで評価しており、API提供元はまだ存在しないと報告されています。

用語解説

フロンティアモデル
各社の最高水準のAIモデル群。独立系ベンチマークで最も高い性能を示すモデルを指す。
推論設定(reasoning configuration)
モデルが回答する際に計算量をどれだけ使うかの設定。maxやxhighなどがあり、高いほど精度が上がる一方でコストも増える。
エージェント業務
AIがツールやAPIを呼び出し、計画を立てて自律的にタスクを進める作業。コーディングやデータ分析で活用される。
ツール呼び出し
AIモデルが外部のツールや関数を利用するためのアクション。回数が少ないほど通信量が減り、コスト削減につながる。

出典

Meta says Muse Spark 1.3 has frontier performance — but its best results come from a model developers can’t broadly use yet

VentureBeat / carl.franzen@venturebeat.com (Carl Franzen) / 2026年9月4日

https://venturebeat.com/technology/meta-says-muse-spark-1-3-has-frontier-performance-but-its-best-results-come-from-a-model-developers-cant-broadly-use-yet

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する