この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • Metaの音声認識APIが1時間0.18ドルで登場
  • 20人以上の話者分離をリアルタイムで単一モデル処理
  • Speechmaticsは最大100人、Amazon Transcribeは最大30人に対応

発表の概要

米Metaは2026年9月2日、音声認識APIの新モデル「Muse Voice Transcribe」を発表しました。処理した音声1時間あたり0.18ドルという価格設定で、リアルタイムに話し言葉を文字起こしするサービスを提供します。開発元はMeta Superintelligence Labsです。

このモデルは、音声の再生が終わるのを待たずに認識するストリーミング方式に対応します。話者が20人以上いる場面でも区別でき、1時間を超える長時間音声も処理できるとされています。このほか、異なる言語が混ざるコードスイッチングの処理や、特定の言語・キーワードへの重み付けを設定できる点も特徴です。

技術の新しい点

従来の文字起こしと異なるのは、話者分離(だれが話したか)を文字起こしや発話区間検出と同時に扱う点です。音声は80ミリ秒単位で入力され、モデルは次の音声を取り込むか、テキストを出力するかを判断します。Metaはこれを「アダプティブディレイ」と呼び、発話が曖昧な場合は長く待ち、文脈が十分なら素早く出力できるようにしたと説明しています。

Metaの説明によると、話者の交代や発話の開始・終了を表す専用トークンを、文字起こしと同じ系列の中に置くことで、音声認識と話者分離、発話区間検出をまとめて学習しています。認識するたびに話者クラスタリングを別処理として行う従来方式とは異なる設計です。

競合との比較

話者分離の対応人数を比較すると、Museの「20人以上」は市場で高い水準にあるものの、最高ではありません。Speechmaticsはリアルタイム文字起こしサービスで、デフォルト50人、上限を引き上げれば100人まで識別できるとしています。Amazon Transcribeは、ダイアリゼーションの上限をストリーミングを含めて最大30人としています。

Metaの強みは、話者数の上限だけではなく、リアルタイム処理と話者分離、発話区間検出、多言語対応、低価格のAPIを一つのモデルで組み合わせた点にあります。会議システムやコール分析、ライブアシスタントを開発する企業にとっては、単発の性能記録よりも、こうした総合的な設計が利用のしやすさにつながる可能性があります。

現時点での注意点

注意したいのは、APIが返す話者ラベルはセッション内での識別に限定される点です。ラベルは「A」「B」のような形式で、発言者が誰であるかを特定する個人認証ではありません。また、タイムスタンプは単語単位でなく「ターン(発話の区切り)」単位で提供されます。

言語対応については、70以上の言語で学習され、初期リリースでは25言語がしっかり検証されたとされています。ただし、日本語がその25言語に含まれるかは、公開情報からは確認できません。実際に採用を検討する際には、Metaの公式ドキュメントを確認する必要があります。

音声認識サービス3者の話者分離性能比較
比較軸Muse Voice TranscribeSpeechmaticsAmazon Transcribe
話者分離の上限20人以上(上限は非公表)デフォルト50人/上限100人最大30人
リアルタイム認識対応対応対応
原文からの引用
For enterprise developers building meeting systems, call analytics, live assistants or ambient AI, that combination could matter more than who holds the speaker-count record.

会議システム、通話分析、ライブアシスタント、環境型AIを開発する企業の開発者にとって、重要なのは誰が話者数の記録を持つかではなく、その組み合わせである可能性があります。

今後の見通し

当面の焦点は、Museが実際にどれほどの認識精度や話者分離精度を出すのか、そして日本語を含む各言語の品質です。70言語対応とされていますが、初期リリースで精査されたのは25言語のため、日本語の対応有無や精度が明らかになれば、日本の開発者は採用判断をしやすくなります。また、競合の価格や機能も変わる可能性があり、話者数・遅延・コストを横並びで比較できるデータが増えると、音声認識APIの選定基準が明確になるでしょう。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、この発表は会議の文字起こしやコールセンターの分析、リアルタイムAIアシスタントの開発における選択肢が広がることを意味します。20人以上の話者をリアルタイムで区別できる点は、大人数での会議やオンラインイベントの書き起こしに有用です。また、1時間あたり0.18ドルという価格は、試作段階のサービスにも話者分離機能を組み込みやすくします。一方、音声を外部APIへ送ることになるため、機密情報や個人情報を含むデータでは、保存場所や利用条件の確認が不可欠です。日本語の認識品質が確認できるまでは、テストを重ねたうえで実運用するのが現実的です。さらに、話者ラベルが個人を特定しない仕様のため、議事録で発言の責任を明確にする用途では、別の照合手段を検討する必要があります。

気になる点

Muse Voice Transcribeの料金はどのくらいですか?
処理する音声1時間あたり0.18ドルと公開されています。長時間の会議音声やリアルタイムの会話分析を比較的低コストで試せる水準です。ただし、追加料金や最小利用時間などの細かい条件は、現時点の公開情報では明らかになっていません。
日本語の音声認識に対応していますか?
モデルは70以上の言語で学習され、初期リリースでは25言語が検証されたとされています。ただし、日本語がその中に含まれるかは記事では言及されていません。日本語への対応状況を判断するには、Metaの公式ドキュメントやサポート情報を確認する必要があります。
話者ラベルで個人を特定できますか?
APIが返す話者ラベルは「A」「B」のような形式で、セッションの中での識別に限定されます。音声から人物を特定する機能ではないため、発言者を確定させたい場合は、別途ユーザー認証や話者照合の仕組みを組み合わせる必要があります。

用語解説

話者分離(ダイアリゼーション)
音声中に複数の話者がいる場合に、「誰がいつ話したか」を判別する技術です。会議や通話の書き起こしで、発言者ごとにテキストを整理できます。
エンドポインティング
発話の開始と終了を自動で検出する処理です。文字起こしの区切りを決めるために使われます。
アダプティブディレイ
音声の曖昧さに応じて、文字起こしを確定するまでの待ち時間を調整する仕組みです。文脈が足りない場合は長めに待ち、十分なら早く出力します。
コードスイッチング
会話の途中で言語を切り替えることです。Museは多言語対応の一環として、言語が混在する会話も処理できるとされています。

出典

Meta prices Muse Voice Transcribe at $0.18 an hour, with real-time diarization for 20+ speakers: a steal for enterprises?

VentureBeat / carl.franzen@venturebeat.com (Carl Franzen) / 2026年9月3日

https://venturebeat.com/technology/meta-prices-muse-voice-transcribe-at-0-18-an-hour-with-real-time-diarization-for-20-speakers-a-steal-for-enterprises

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する