この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • ChatGPT発の全二重音声モデルGPT-Live-1がAPIで利用可能になった
  • 割り込み対応や推論の委任、口調・話速の調整を開発者が制御できる
  • 音声レイヤーは1分0.05ドル。Full Duplex Benchは30ポイント改善

APIで提供開始

OpenAIが2026年9月10日、音声モデルGPT-Live-1のAPI提供を開始した。GPT-Live-1はChatGPTで先行導入されたモデルで、聞くことと話すことを同時に行う「全二重」の会話を得意とする。API版では、開発者が利用者や業務フローに合わせて音声エージェントの話し方や振る舞いを制御しやすくするための機能が加えられている。

原文で挙げられている主な強化点は、割り込み対応、推論とツール呼び出しのバックエンドへの委任、システムプロンプトによる口調・話速・会話スタイルの調整、背景雑音や無音の扱い、長時間セッションでの文脈保持、電話回線を通じた通話への対応である。価格はフロントエンドの音声レイヤーが1分0.05ドルとされている。

単一モデルで音声を処理

従来の音声エージェントは、音声認識(STT)、推論モデル、音声合成(TTS)を順につなぎ合わせる構成が一般的だった。この方式では各段の受け渡しごとに遅延が生じ、割り込みや間の取り方といった会話のリズムを崩しやすい。開発者は、誰かが遮ったり間を置いたりしたときに何が起きるかを含め、各段の調整を自ら担う必要があった。

GPT-Live-1は聞くことと話すことを単一のモデルで処理し、入ってくる音声と出ていく音声をまとめて推論する。割り込みや相づちにもその場で反応しつつ、深い推論はバックエンドのモデルに委任する。会話を止めずに裏側で処理を進められる点が特徴とされている。

原文では、導入先の事例として、カスケード構成と比べてコードベースを80%簡素化し、2万3千行のコードを削除できたという声が紹介されている。開発者は会話の背後で使うモデル、ツール、エージェントの実行基盤を選べる。予約や注文更新のような大量処理にはLuna、推論を要する複雑な問い合わせにはAstraといった使い分けが例示されている。

評価と導入事例

OpenAIの評価では、GPT-Live-1はFull Duplex Benchの性能をGPT-Realtime-2.1比で30ポイント改善したとされる。ターン制御の遅延と対話的な振る舞いで大きな改善が見られたという。GPT-6 Astraを中程度の推論負荷で組み合わせた場合、エンドツーエンドのタスクで音声エージェントの知能を測るTau3で1位になったとしている。

導入先として、Yelp、Speak、Fin、Devinの名前が挙がる。Speakは、学習者が考える間を置いてからチューターが応答するようになり、従来のターン制システムと比べて思考中の間での割り込みがほぼ80%減ったと報告している。Yelpでは予約やフードオーダーの電話対応で通話処理率が改善し、発話がより自然な文になったという。Devinについては、AIエンジニアとの協働がチームメイトと作業する感覚に近づくと述べられている。

音声の選択肢と留意点

音声の選択肢も広がる。従来の少数のリアルタイム音声から、アクセント・方言・言語の幅を広げた選択肢が用意される。原文では、今後数カ月にわたって音声の選択肢と言語の対応範囲を拡大していくと述べられている。カスタム音声を希望する場合は、営業への問い合わせが必要とされる。

GPt-Live-1はASRのトランスクリプトと応答テキストをネイティブに提供し、英数字の理解やキーワードバイアスにも対応する。ターン制のモデルではないがターン検出を備えるため、明示的なターン境界を前提とした実装を続けられる。Codexと接続するコード例も示され、アプリケーションから会話の文脈をCodexに渡し、その回答をGPT-Live-1に戻す流れが説明されている。ただし接続設定や委任の処理そのものは抜粋から省かれている。

公開されているデモは期間限定とされている。日本語を含む各言語がいつ、どの程度使えるようになるか、またカスタム音声の提供条件は原文では明らかにされていない。

GPT-Live-1と従来のカスケード型音声エージェントの違い
項目GPT-Live-1従来のカスケード型
音声の処理単一モデルで受信音声と送信音声をまとめて推論STT・推論モデル・TTSを順に接続
割り込みへの対応発生した時点でその場で応答各段の受け渡し調整が必要でタイミングを失いやすい
導入先でのコード量カスケード構成比で80%減、23K行を削除(導入先の事例)比較の基準
バックエンドの推論LunaやAstraなど別モデルに委任推論モデルがその役割を担う
原文からの引用
Compared to our cascaded build, GPT‑Live‑1 simplified our code base by 80% and removed 23K lines of code.

従来のカスケード構成と比べて、GPT-Live-1はコードベースを80%簡素化し、2万3千行のコードを削除できました。

今後の見通し

API提供は開始されたが、日本語を含む言語ごとの対応状況や品質はまだ示されていない。原文は「今後数カ月で音声の選択肢と言語の対応範囲を拡大する」と述べており、対応言語の一覧や品質評価が公開されれば、日本国内のサービスに組み込めるかどうかを判断できる。また、フロントエンドの音声レイヤーは1分0.05ドルと明示されているが、バックエンドのモデルとエージェント基盤のコストは構成によって変わる。電話対応や長時間セッションでの実運用コストが事例として出てくれば、既存のカスケード構成からの置き換えを検討する材料になるとみられる。

日本の開発者・IT企業にとっての意味

音声エージェントを自作する場合、これまでは音声認識・推論・音声合成を組み合わせ、割り込みや無音の扱いを自前で調整する必要があった。GPT-Live-1はこの音声レイヤーを単一モデルに置き換える選択肢を、APIと1分0.05ドルという従量課金で提供する。日本のIT企業にとっては、コールセンターや予約受付、社内ワークフローへの音声インターフェース導入時に、自前で組み上げるかAPIに寄せるかを比較検討できる材料になる。推論をGPT-6 AstraやLunaなどの別モデルに委任できるため、既存のテキスト処理やツール連携をそのまま活かしやすい。一方で、日本語の対応状況や通話品質、電話回線の接続方法は現時点で示されておらず、国内向けサービスへの適用判断には追加情報が必要になる。

気になる点

GPT-Live-1は日本語に対応していますか。日本から使えますか。
API自体の提供は開始されており、フロントエンドの音声レイヤーは1分0.05ドルです。原文は音声の選択肢をアクセント・方言・言語に広げ、今後数カ月で言語の対応範囲も拡大すると述べていますが、日本語がいつ、どの品質で使えるようになるかは明らかにされていません。
既存のSTT・LLM・TTS構成から全面的に作り替える必要がありますか。
必ずしも全面的な置き換えが求められているわけではありません。GPT-Live-1はASRトランスクリプトと応答テキストをネイティブに提供し、ターン検出も備えるため、明示的なターン境界を前提とした実装を続けられます。導入先の事例では、カスケード構成と比べてコード量が80%減り、2万3千行を削除できたと報告されています。
バックエンドの推論モデルは何を選べばよいですか。
原文では、予約や注文更新のような大量処理にはLuna、推論が必要な複雑な問い合わせにはAstraといった使い分けが例示されています。GPT-6 Astraは中程度の推論負荷でTau3の1位を記録したとされます。バックエンドのモデルとエージェント構成の料金は別途かかるため、タスクごとに推論の深さ・速度・コストを合わせる考え方が示されています。

用語解説

全二重(full-duplex)
聞くことと話すことを同時にできる対話方式。相手の発話中でも音声を入力し続けられる。
STT / TTS
STTは音声をテキストに変換する音声認識、TTSはテキストを音声に変換する音声合成を指す。
ASR
自動音声認識。話された音声をテキストに書き起こす技術で、文字起こしの精度に関わる。
ターン検出
会話で誰がいつ話すかを区切る「ターン」の境界を検出する仕組み。
キーワードバイアス
特定の語句を認識しやすくする補正。固有名詞や専門用語の認識精度向上に使われる。
エージェントハーネス
エージェントに利用できるツールや手順を与え、実行を制御する基盤のこと。

出典

Build more natural voice experiences with GPT‑Live‑1 in the API

OpenAI / 2026年9月10日

https://openai.com/index/introducing-gpt-live-1-in-the-api

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する