この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 1時間10セントの低価格、初代モデルから約72%引きを実現
  • 60言語対応、話者分離やコードスイッチングも標準装備
  • OpenAI頼みから脱却する自社モデル戦略の成果とみられる

発表の概要

Microsoft AIは2026年9月3日、音声認識モデル「MAI-Transcribe-2」を公開しました。同社によれば、OpenAIやGoogle、ElevenLabsが現在販売するどの音声認識製品よりも高速で高精度、そして低価格です。1時間あたり10セントという価格は、5カ月前に出た初代モデルの0.36ドルから約72%の引き下げになります。

モデルは、Microsoft Foundry(開発者向けモデル市場)とMAI Playground(テスト環境)で利用できます。対応言語は60言語で、6月のMAI-Transcribe-1.5の43言語、4月の初代モデルの25言語から拡大しました。記事は、実際の企業が持つ「雑音や低品質の録音、話し声の重なりを含む音声」向けに作られたモデルだとしています。

価格低下のインパクトは明確です。年間10万時間のコンタクトセンター音声を処理する企業の場合、文字起こし費用は36,000ドルから10,000ドルに減ります。この処理量は大手銀行や通信会社にとっては大規模とはいえず、この水準になると文字起こしはコストとして問題にならなくなると記事は指摘しています。

標準装備された機能

言語数より重要なのは、基本製品に含まれる機能群です。話者分離は複数人の録音で誰が何を話したかを識別し、単語レベルのタイムスタンプは検索や編集、動画との位置合わせを可能にします。キーワードバイアスは薬剤名や製品コード、社員名などのリストをモデルに与えて誤認識を防ぎます。自動言語識別により、利用者が事前に言語を指定する必要もありません。

特徴的なのは、出力スタイルの設定です。「そのまま」モードは言い淀みや言い間違いを残すため、コンプライアンスや法務部門向けです。「クリーン」モードは不要な表現を取り除き、読みやすい字幕やメモを作ります。さらに、文の途中で言語が切り替わるコードスイッチングにも対応し、英語とヒンディー語が混ざるHinglishや、英語とスペイン語が混ざるSpanglishが例として挙げられています。これらの機能は専門ベンダーでは追加料金になることが多いのですが、Microsoftはすべてを10セントの価格に含めました。

ベンチマークの読み方

性能主張の中心は、FLEURSの60言語で平均5.2%の語誤り率(WER)を達成し1位になったというものです。FLEURSは2022年にGoogleの研究者が公開したベンチマークで、102言語それぞれのネイティブ話者が約2000文(約12時間分)を読み上げた音声を使います。同一の内容で言語間比較ができるため、多言語音声認識の標準的な物差しとされています。

WERは人間の参照文に対する単語の置換・挿入・削除の割合で、5.2%は約20語に1語の誤りを意味します。ただしFLEURSは読み上げ音声を使った評価であり、実際の会話音声の性能を示すものではありません。また今回の平均5.2%は、同社が以前報告した3.7%から上昇しています。この上昇が対応言語の拡大によるものか、別の要因によるものかは、記事の記述からは判断できません。

OpenAI依存を離れる戦略

今回のリリースは、Microsoftが2年前には考えられなかった戦略を実行中であることを示します。それは、音声や画像といったモダリティごとに自社の最先端モデルを開発し、かつてOpenAIの技術で動いていた製品へ順次置き換えていく戦略です。文字起こしはこの戦略が最も速く進んだ分野であり、MAI-Transcribe-2はその成果を示す最も明確な事例だと記事は評価しています。

同社はOpenAIとの関係構築に130億ドルを投じてきました。そのパートナーに依存せずにAI分野で競争する方法を示すことは、今後の製品戦略や価格交渉にも影響を与える可能性があります。競合を下回る価格で自社モデルを提供できる証明になれば、API市場でのMicrosoftの立場は強まるでしょう。

現時点で分からないこと

記事はOpenAIやGoogle、ElevenLabsの製品と比べて「高速」「正確」と主張する一方、速度比較の具体的な測定値や、共通データでの比較結果は示していません。日本語を含む言語別の精度も未公表です。また、FLEURSは読み上げ音声の評価であり、実際の業務音声での性能は別途検証が必要です。

今回の10セントは「早期導入価格」とされており、いつまで適用されるのかは記事では触れられていません。同社は5カ月で対応言語を25から60に増やし、価格も大きく下げてきました。今後も短期間でのモデル更新や価格改定が続く可能性があります。実際のビジネス音声での精度を確認するには、各社モデルを同じデータで評価する追加の検証が待たれます。

MAI-Transcribe-2と初代モデルの比較
項目MAI-Transcribe-2初代モデル(5カ月前)
1時間あたりの料金10セント36セント
対応言語数60言語25言語
年間10万時間の文字起こし費用$10,000$36,000

今後の見通し

Microsoftが1時間10セントという価格を打ち出したことで、OpenAIやGoogle、ElevenLabsが価格や性能で対抗策を打ち出す可能性があります。同社が130億ドルを投じたOpenAIとの関係をどう整理するかも、AIのAPI市場全体に影響を与えるでしょう。次の判断材料は、日本語を含む各言語のWERの公表、実会話データでの精度検証、早期導入価格の適用期間の明示です。また、このモデルがMicrosoft Teamsなどの既存製品にどう組み込まれ、同社の既存音声サービスとどう住み分けるのかも注目されます。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって、音声認識APIの費用が1時間10セントまで下がれば、コールセンターの品質管理や会議議事録の自動作成、動画の字幕付けなど、コスト面で見送られていた用途が現実的な検討対象になります。年間10万時間を処理する企業では、文字起こしコストが36,000ドルから10,000ドルに下がるためです。その一方で、日本語の認識精度や、音声データを日本国外の基盤で処理することへの慎重さは別途検証が必要です。また、MicrosoftがOpenAIへの依存から脱却しつつあることは、AIベンダー選定の前提が変わり得ることを示します。特定のAPIに長期依存するリスクを再点検し、複数ベンダーを組み合わせる構成を検討する企業が増えるとみられます。

気になる点

価格はどれだけ下がったのか?
初代モデルの料金は1時間あたり36セントでしたが、MAI-Transcribe-2は10セントで、約72%の値下げです。年間10万時間の音声を処理する企業では、費用が36,000ドルから10,000ドルに減ります。大手銀行や通信会社の規模でも十分に導入を検討できる水準とみられます。
日本語の認識精度はどの程度か?
記事では60言語に対応するとされているものの、日本語が含まれるかどうかや、日本語での認識精度は示されていません。現時点では、Microsoft Foundry上のモデル情報やベンチマークスコアの公開を待って判断するのが適切です。
10セントという価格はいつまで適用されるのか?
記事では「早期導入価格」とだけ説明されており、適用期間は公表されていません。同社は5カ月前に出したモデルから価格を大きく下げており、今後も価格改定や機能追加が短期間で行われる可能性があります。

用語解説

FLEURS
2022年にGoogleの研究者が公開した多言語音声認識のベンチマーク。102言語で、各言語のネイティブ話者による約2000文の読み上げ音声を使います。
WER(語誤り率)
認識結果を人間の参照文と比べ、単語の置換・挿入・削除がどれだけあったかを示す指標。低いほど精度が高いことを示します。
話者分離
複数人が話す録音で、誰がいつ発言したかを識別し、発言者ごとに書き分ける機能です。
コードスイッチング
会話の途中で言語を行き来する現象。ヒンディー語と英語が混ざったHinglishなどが典型例です。
Microsoft Foundry
マイクロソフトが開発者向けに提供するAIモデルの市場。MAI-Transcribe-2もここから利用できます。

出典

Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed

VentureBeat / michael.nunez@venturebeat.com (Michael Nuñez) / 2026年9月3日

https://venturebeat.com/infrastructure/microsoft-ais-mai-transcribe-2-undercuts-openai-google-and-elevenlabs-on-price-and-speed

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する