Grandream

Grandream

公開: 15 min read

OpenAI、フルデュプレックス音声モデル「GPT-Live-1」をAPI提供|Realtime API(gpt-realtime-2.1)と性能・料金はどう違うか

OpenAI、フルデュプレックス音声モデル「GPT-Live-1」をAPI提供|Realtime API(gpt-realtime-2.1)と性能・料金はどう違うか
AIエージェントの開発をご検討中ですか? AIエージェント開発サービスを見る →

OpenAIが2026年9月10日、音声モデル GPT-Live-1 をAPIで一般提供しました。7月にChatGPTの音声会話(Advanced Voice Modeの後継)として投入されたモデルの開発者向け版で、モデルIDは gpt-live-1、料金は 1分あたり$0.05(秒単位課金) です。

これまで開発者が音声エージェントを組む選択肢は Realtime API (現行モデルは gpt-realtime-2.1gpt-realtime-2.1-mini)でした。GPT-Live-1はこれを置き換えるものではなく、別のAPI(/v1/live/sessions)として並立 します。公式ドキュメントにもRealtime APIの廃止予定はなく、むしろ「Realtimeを使い続けるべきケース」が明記されています。

つまり開発者は今、設計思想も課金体系も異なる2つの音声APIを使い分ける 局面に入りました。この記事では、OpenAIの発表資料・公式ドキュメント・Artificial Analysisの独立実測をもとに、両者の違いを「仕組み」「性能」「料金」「機能」の順で整理します。さらに、公式の音声一覧に日本語が無いGPT-Live-1で 実際に日本語で会話できるのか を編集部で試した結果を挟み、最後に使い分けの判断軸をまとめます。

1. 仕組みの違い:ターン制の1モデルか、フルデュプレックス+委譲か

Realtime API:1つのモデルが聞いて、考えて、話す

Realtime APIの gpt-realtime-2.1speech-to-speech(S2S)モデル です。音声を直接入力し、音声を直接出力します。推論もツール呼び出しも音声生成も 1つのモデルの中で完結 し、推論の深さは reasoning effort で調整できます。画像入力、MCPサーバ接続、SIP(電話網)接続にも対応しています。

一方で会話の進み方は ターン制 です。サーバ側の音声区間検出(VAD)が「ユーザーが話し終えた」と判定してから推論が始まります。ユーザーの割り込みは、クライアントが speech_started イベントを監視して応答をキャンセルし、再生済み部分まで会話履歴を切り詰める、という手順で扱います。

GPT-Live:音声を担う前段と、推論を担う後段に分ける

GPT-Live-1は フルデュプレックス です。聞きながら話せるので、ユーザーが途中で口を挟んでも、相槌を打つべき間でも、モデル自身がその場で判断します。OpenAIはこれを「ターン検出器を音声経路から取り除いた第3世代の音声システム」と位置づけ、モデルは「1秒に何度も、話す・聞き続ける・黙る・割り込む・ツールを呼ぶ、を判断する」と説明しています。

もう1つの大きな違いは 2層構造 です。GPT-Live-1自体は会話の進行に専念し、深い推論やツール実行は バックエンド に委譲します。委譲先は2通り用意されています。

委譲モード

仕組み

想定

Responses委譲

OpenAIのモデル(推奨はGPT-5.6 Terra、低コスト用途にLuna、評価ではGPT-6 Astra)をセッション設定で指定。会話文脈の受け渡しをOpenAI側が管理

新規構築・マネージド運用

クライアント委譲

自社のエージェントや他社モデル、Codex SDKなど任意のバックエンドを、アプリ側が呼び出して結果を返す

既存エージェント資産がある場合

この分離により、音声モデルは自分でツールを実行しません。関数定義は delegation.responses.tools に置き、実行はバックエンドが担います。プロンプトも「話し方・相槌・割り込み・委譲方針」を書く音声層の指示と、「業務手順・ツールの使い方」を書くバックエンドの指示に分けるのが公式の推奨です。

OpenAIのエンジニアリング記事によれば、この構造は内部でも徹底されています。音声フレームはクライアントと音声モデルの間の専用経路を流れ、委譲やツール実行は非同期RPC境界の向こう側で動くため、遅いツール呼び出しがあっても音声の流れは止まりません。メディア処理系はPythonのasyncio実装からGoに書き直され、フレーム配送のp95が旧システムのp50に並んだとしています。

開発者から見た違い

設計の差は、そのままAPIの触り方の差になります。公式の移行ガイドから主な変更点を抜き出すと次の通りです。

  • 音声は連続ストリームで送り、手動のコミットや発話トリガは不要(話すタイミングはGPT-Liveが決める)
  • 応答終了イベントがないresponse.done に相当するものはなく、再生状況はクライアント側で追跡する
  • 割り込んでもバックエンドの作業は自動キャンセルされない。中断処理はアプリの責務
  • コンテキストは128kトークン。使用率が90%を超えると背景で会話を要約し、同一セッション内で音声エンジンを差し替える

2. 性能:会話の応答性で大差、タスク遂行はバックエンド込みで首位

OpenAIは発表記事で、GPT-Live-1と gpt-realtime-2.1gpt-realtime-2 を同じベンチマークで比較しています。数値は記事に埋め込まれたグラフの元データから抜き出しました。

ベンチマーク

何を測るか

GPT-Live-1

gpt-realtime-2.1

gpt-realtime-2

Full Duplex Bench v1 ターンテイキング遅延

ユーザー発話終了から応答開始まで(短いほど良い)

0.798秒

1.41秒

1.63秒

Full Duplex Bench v1.5 Interactivity

背景の話し声、第三者への発話、相槌、割り込みへの反応

80.1%

45.4%

47.8%

Artificial Analysis Conversational Dynamics

間の取り方・ターン交代・割り込み・相槌の平均

97.3%

95.7%

95.3%

τ³-bench Voice(Tau3)Pass@1 ※

航空・小売・通信の音声カスタマーサポートを最後までやり切れた割合

86.2%

45.7%

42.4%

Tau Banking Knowledge Pass@1 ※

銀行業務97タスク。社内ナレッジ検索と口座ツールを併用

32.0%

12.4%

10.3%

Full Duplex Bench v3 ツール呼び出し ※

言い直しや間を含む発話から正しいツール列を出せたか

87.0%

60.0%

58.0%

Full Duplex Bench v3 応答品質 ※

上記に対する口頭回答が意図に合っているか

90.0%

88.0%

81.0%

※印の項目は、GPT-Live-1にバックエンド(Tau系はGPT-6 Astra・medium、v3系はGPT-5.6 Terra・low)を組み合わせたシステムとしての値です。Realtime側は単体モデルの値です。

読み解くときのポイントは2つあります。

第一に、応答性の差は構造由来です。 ターンテイキング遅延が1.41秒から0.798秒へほぼ半減し、Interactivityは45%台から80%へ跳ねています。これはVADの判定待ちがなくなり、割り込みや背景音をモデル自身が扱うようになった効果で、バックエンドの賢さとは関係ありません。

第二に、タスク遂行の差はバックエンドの寄与が大きい。 Tau3で86.2%と45.7%という開きは、フロンティアの推論モデルを後段に置いたシステムと、音声モデル単体との比較です。「GPT-Live-1という音声モデルが2倍賢い」というより、「推論を専用モデルに任せられる構造が、音声エージェントの完遂率を引き上げた」と読むのが正確です。逆に言えば、バックエンドにLunaのような軽量モデルを選べば、この数字はそのまま再現しません。

独立実測:Artificial Analysisの見方

第三者機関のArtificial Analysisも、複数の構成で実測を公開しています。

構成

Conversational Dynamics

最初の音声が出るまで

GPT-Live-1(バックエンド Sol・low)

97.3%

0.29秒

GPT-Live-1(バックエンド Astra・medium)

94.9%

0.27秒

gpt-realtime-2.1(high)

95.7%

1.21秒

gpt-realtime-2.1(minimal)

92.7%

0.97秒

gpt-realtime-2(minimal)

96.1%

1.12秒

ここでも 最初の音声が出るまでの時間は0.27〜0.29秒と、Realtimeの約1秒に対して大きく短い ことが確認できます。一方、会話の自然さを示すConversational Dynamicsは、バックエンドの選択で94.9〜97.3%と揺れ、gpt-realtime-2(minimal)の96.1%がGPT-Live-1のAstra構成を上回る場面もあります。会話の自然さそのものはRealtime 2.x世代でも既に高水準 で、GPT-Liveが明確に差をつけるのは「割り込み・背景音への対処」と「最初の一声までの速さ」だと整理できます。

なお同サイトの総合首位はQwen Audio 3.0 Realtime Plus(98.4%)で、GPT-Live-1は会話力学の指標で全モデル中の首位ではありません。

3. 料金:分課金の音声層と、トークン課金の推論層に分かれた

GPT-Live-1は「壁時計」で課金される

GPT-Live-1の料金は 1分$0.05、秒単位で課金、分への切り上げなし です。ただし、これは 前段の音声層だけの価格 で、バックエンドのモデル利用とツール利用は別途トークン課金されます。

公式のコスト最適化ガイドには、何が課金時間に入るかが明記されています。

  • 課金対象は アクティブなセッション時間。ユーザーが話している時間、モデルが話している時間、双方が黙っている時間、バックエンドの処理を待っている時間 をすべて含む
  • WebRTCでセッションを作ると 15秒分が先に課金 され、以後のセッション課金に充当される
  • バックエンドの処理が長い場合、音声セッションを一度閉じれば待ち時間の$0.05/分は節約できるが、再接続の体験コストと相殺になる

さらに公式は、「高価で賢いバックエンドのほうが、タスクを速く終えて音声セッションを短くできるなら、トークン費の増分を超えて総額が安くなることがある」とも書いています。逆に安いモデルが失敗や再試行を繰り返せば、通話時間が伸びて高くつく。バックエンドの選択は、トークン単価ではなく通話全体の時間で評価する のがGPT-Live流のコスト設計です。

バックエンドに使える主なモデルの標準価格(100万トークンあたり、入力 / キャッシュ入力 / 出力)は次の通りです。

バックエンド

入力

キャッシュ入力

出力

GPT-6 Astra

$10

$1

$50

GPT-5.6 Sol

$4

$0.40

$20

GPT-5.6 Terra(公式推奨の起点)

$2

$0.20

$12

GPT-5.6 Luna(低コスト用途)

$0.20

$0.02

$1.20

Realtime APIは「話した量」で課金される

Realtime APIは従来通りトークン課金です。gpt-realtime-2.1 の音声トークンは 入力$32・出力$64(100万トークンあたり、キャッシュ入力は$0.40)gpt-realtime-2.1-mini入力$10・出力$20 です。

音声とトークンの換算は公式ガイドに明記されています。ユーザー音声は100ミリ秒で1トークン、モデル音声は50ミリ秒で1トークン。 つまり1分の音声は入力600トークン、出力1,200トークンに相当します。

聞いている1分

話している1分

gpt-realtime-2.1

$0.0192

$0.0768

gpt-realtime-2.1-mini

$0.006

$0.024

無音の時間は課金されません。ただしRealtimeには別の積み上がり方があります。応答を生成するたびに、会話履歴の全体が入力として再送される ため、ターンが進むほど履歴分のトークンが乗ります(大半はキャッシュ単価$0.40で処理され、retention_ratio で古い履歴を自動的に落とす設定もあります)。システムプロンプトやツール定義も毎ターンの入力に含まれます。

同じ通話で比べると

両者の課金は単位が違うので、通話の中身を決めてから比べる必要があります。ここでは 10分間の顧客対応通話 を仮定します。ユーザーが5分話し、モデルが3分話し、残り2分は沈黙や処理待ち。ターンは15回、バックエンドへの委譲は8回とします。

構成

内訳

概算

Realtime gpt-realtime-2.1

音声入力5分 $0.096 + 音声出力3分 $0.230 + 履歴再送(15ターン×約5kトークン、ほぼキャッシュ)約$0.03 + プロンプト・ツール定義 約$0.01

約$0.37

Realtime gpt-realtime-2.1-mini

上記の3分の1弱

約$0.12

GPT-Live-1 + Terra

音声層10分 $0.50 + バックエンド8回(入力計24k、大半キャッシュ 約$0.01、出力2.4k $0.03)

約$0.54

GPT-Live-1 + Astra

音声層 $0.50 + バックエンド(入力 約$0.05、出力 $0.12)

約$0.67

GPT-Live-1 + Luna

音声層 $0.50 + バックエンド 約$0.01

約$0.51

この前提では、GPT-Live-1の総額はRealtime 2.1の1.4〜1.8倍です。ただし構図は通話の密度で変わります。GPT-Live-1は沈黙も処理待ちも課金される「壁時計」型なので、間の多い通話ほど割高になり、モデルがよく話す通話ほど差が縮みます。 Realtimeの出力単価$0.0768/分は、モデルの発話比率が1分のうち65%を超えると、それだけでGPT-Liveの$0.05/分を上回ります。

なおArtificial Analysisの独自ワークロードでの算出では、GPT-Live-1構成(1時間あたり$4.47〜5.83)が gpt-realtime-2.1 構成(同$10.75〜11.31)より安く出ています。前提とする会話パターンが違えば結論が逆転する、という点そのものが、この2つのAPIを比較するときの本質です。

4. 機能面の差:何ができて、何ができないか

料金と性能以外に、実務で効いてくる差を公式ドキュメントから拾います。

項目

Realtime API(gpt-realtime-2.1)

GPT-Live-1

関数呼び出し

モデルが直接発行

バックエンドが実行(delegation.responses.tools

MCPサーバ接続

対応

ドキュメント上は関数と web_search の記載のみ(未確認)

画像入力

対応

非対応。視覚モデルをバックエンドに置き、文字で返す運用

音声の種類

従来のRealtime音声

12種。豪・英・アイルランド・北米・米南部・フィリピン英語とブラジルポルトガル語。自分の録音から作るカスタム音声 は承認制(営業経由)

対応言語

多言語(英数字認識は日・中・西・仏などで強化済み)

音声プリセットは英語とポルトガル語。「今後数か月で拡大」と公式。日本語は一覧に無いが、編集部の実機テストでは日本語で会話・転写できた(5章)

文字起こし

別途文字起こしモデルを設定

ネイティブASR転写と応答テキストを同梱。キーワードバイアスに対応

ターン検出

server VAD / semantic VAD / 手動

フルデュプレックスだが、明示的なターン境界で組みたい開発者向けにターン検出も提供

電話(SIP)

着信・発信、専用IPレンジ、DTMF

着信のみ。発信はパートナー連携経由

レート制限の単位

RPM / TPM

同時セッション数(Tier 1: 25、Tier 3: 200、Tier 5: 500)

コンテキスト

128k、超過時は自動切り詰め

128k、90%超で背景要約

音声透かし

SynthID(2026年7月末から)

GPT-Live-1のレート制限が「同時に何本の通話を張れるか」で決まる点は、コールセンター用途の見積もりでそのまま容量計画になります。Tier 1の25セッションは検証には十分ですが、本番の同時通話数と照らして早めに上位Tierを確認しておく必要があります。

5. 実際に試した:日本語で会話できるか

公式の音声一覧に日本語が無い以上、国内利用の前提として「日本語で話せるのか」は机上では判断できません。そこで編集部で最小構成のテストアプリを組み、日本語で話しかけてみました。

構成は公式のWebRTCクイックスタートに沿ったもので、ブラウザ(React)がマイク音声とSDPオファーを作り、ローカルサーバが POST /v1/live/sessions でセッションを作成する形です。音声は北米英語の Gleam、バックエンドは公式推奨の GPT-5.6 Terra(Responses委譲・web_searchなし)、音声層のinstructionsには「常に自然な日本語で話す。英語やポルトガル語に切り替えない」と書きました。

GPT-Live-1に日本語で話しかけたテスト画面。ユーザーとモデルの発話がネイティブASRで日本語に転写され、モデルも日本語で応答している

結果は次の通りです。

  • 日本語で話しかけると、日本語で返ってきました。 「GPT Live 1がリリースされましたね」に対し「そうですね、ついにリリースされました」と自然な日本語で応答。英語への切り替えや訛りの混入は、この短い会話では起きませんでした
  • ネイティブASRの転写も日本語で出力されます。 ユーザー発話は「GPT Live 1がリリースされましたね」「音声として、日本語がリストされてないみたいなんですけど、使えてますね」と、固有名詞を含めてほぼ正確に文字化されました(2文目の先頭に「i」が1文字混入)
  • バックエンド委譲も日本語のまま動きます。 2つ目の質問ではイベントログに session.delegation.created が出て、Terraからの応答テキストがストリームで返り、モデルがそれを日本語で読み上げました
  • 課金は42秒で$0.035。 session.closedusage.seconds は42秒、コンテキスト使用率は2%でした。バックエンドのトークン費は別途ですが、この程度の短い会話では1セント未満です

留意点もあります。今回は音声層のinstructionsで日本語を明示した上での結果で、指示なしでどの言語で話し始めるかは試していません。日本語の発音の自然さは英語ネイティブ向け音声(Gleam)で聞いた主観評価であり、日本語専用音声ではありません。公式の対応言語一覧に載っていない以上、品質保証や今後の挙動の安定性は公式には約束されていない と受け取るべきです。それでも「日本語は一覧に無いから使えない」という判断は早く、まず実機で試す価値がある ことは確認できました。

6. 使い分け:どちらを選ぶか

公式の移行ガイドは、あえて「Realtimeに残るべき条件」を挙げています。それを含めて整理すると、判断軸は次のようになります。

GPT-Live-1が向くケース

  • 割り込みや相槌、間の取り方など 会話の自然さがプロダクト価値の中心 にある(語学学習、コンパニオン、受付・一次対応)
  • 既にバックエンドのエージェントや業務ロジックがある。音声UXと業務ロジックを分けたい
  • 最初の一声までの速さ(0.3秒前後)が離脱率に直結する
  • バックエンドの処理中もモデルが話し続けてよい(「確認しますね」と言いながら裏で検索する体験を許容できる)

Realtime APIが向くケース

  • 音響そのものをモデルに判断させたい。留守番電話のビープ音、話者の抑揚といった、文字起こしに落ちない情報で分岐する
  • 応答終了イベントで 再生と画面を同期 させる必要がある
  • ツール判断を モデルの推論ループの中に閉じ込めたい。委譲の非同期性が設計を複雑にする
  • 画像入力やMCPの直接接続 が必須
  • 会話密度が低く沈黙の多い用途で、トークン課金のほうが安く収まる

導入前に確認したい3点

日本語の扱い。 公式に列挙されている12音声は英語系とブラジルポルトガル語で、日本語の対応は一次情報に記載がありません。ただし5章の通り、instructionsで日本語を指定すれば会話も転写も日本語で動くことは確認できました。国内向けに使うなら、自社の業務用語や英数字(予約番号、電話番号)を含む会話で転写精度と発音を実機で確かめた上で、公式の言語拡大の発表を追う、という進め方になります。

総額は通話パターンで決まる。 3章の試算はあくまで一例です。自社の実通話ログから「ユーザー発話・モデル発話・沈黙・処理待ち」の分数比率を取り、Realtimeはトークン、GPT-Liveは壁時計で当てはめ直してください。バックエンドの選択は単価ではなく、通話がどれだけ早く終わるかで評価します。

割り込み時の後始末は自分で書く。 GPT-Liveはユーザーの割り込みを自然に受けますが、走り出したバックエンド処理は止まりません。二重実行や取り消し漏れが業務上の事故につながる操作(予約確定、決済など)は、delegation_id を使った冪等化や確認ステップをアプリ側で設計する必要があります。

7. まとめ

  • OpenAIは2026年9月10日、フルデュプレックス音声モデル GPT-Live-1 をAPIで一般提供。料金は $0.05/分・秒課金。Realtime APIとは 別APIとして並立 し、Realtimeの廃止予定はない
  • 構造の違いは「ターン制の1モデル(Realtime)」対「フルデュプレックスの音声層 + 推論を委譲するバックエンド(GPT-Live)」。ツール実行は音声モデルではなくバックエンドが担う
  • 公式ベンチでは ターンテイキング遅延が1.41秒→0.798秒、Interactivityが 45.4%→80.1%。独立実測でも最初の一声までが 約1秒→0.3秒弱
  • タスク遂行(Tau3 86.2% 対 45.7%)の差は フロンティア推論モデルを後段に置いた効果が大きい。バックエンド次第で数字は変わる
  • 料金は「壁時計」対「話した量」。沈黙や処理待ちも課金されるGPT-Liveは間の多い通話で割高、モデルがよく話す通話では差が縮む。10分通話の一例ではRealtime 2.1が約$0.37、GPT-Live+Terraが約$0.54
  • 音声は12種にカスタム音声が加わる一方、MCP直結・画像入力は現時点で未記載または非対応。日本語は公式一覧に無いが、編集部の実機テストではinstructionsで指定すれば会話も転写も日本語で動いた(42秒で$0.035)。公式の保証は無いので、国内導入は自社の業務会話で転写精度を確かめてから

音声エージェントの選択は「新しいほうが良い」ではなく、会話の自然さを買うのか、モデル単体の完結性を買うのか の選択になりました。まず自社の通話ログで沈黙と発話の比率を測り、両方のAPIで同じ通話を再現してコストと体験を並べるところから始めるのが現実的です。


出典(OpenAI公式)

出典(第三者)

関連記事

Grandream

Grandream

株式会社グランドリーム

AI・システム開発のプロフェッショナルチームです。AIエージェント・業務自動化・Webシステム開発などを手がけています。

AIエージェント開発のご相談はお気軽に

PoC段階から本番運用まで一貫対応します。

AI開発について相談する

AIエージェント開発サービスの詳細を見る →

どのサービスが合うか30秒で診断する →