OPENAI SEARCH INSIGHT
GPT-Live、同時に聞き話す新音声モデルでChatGPT Voiceを刷新
この記事で分かること: OpenAIのGPT-LiveがChatGPT Voiceをどのように変え、利用者にどの機能や安全対策が提供されるのかを知りたい。
OpenAIは2026年7月8日、新世代の音声モデル「GPT-Live」を発表した。GPT-Liveは、AIが音声を聞きながら同時に話せる「フルデュプレックス」アーキテクチャを採用し、ChatGPT Voiceでより自然な会話を実現することを目指す。短い相づち、素早い会話の往復、利用者が考えるための沈黙への対応などを可能にするとしている。
ChatGPT VoiceにはGPT-Live-1とGPT-Live-1 miniの2モデルを順次導入する。OpenAIによると、発売時点では検索、より深い推論、複雑な処理が必要な問いに対し、GPT-Liveが背後のフロンティアモデルへ処理を委任する仕組みを採る。公開時にはバックグラウンドでGPT-5.5を使用し、会話の流れを維持しながら結果を戻すとしている。
OpenAIがGPT-Liveを発表、ChatGPT Voiceの会話体験を更新
GPT-Liveは、自然な人間とAIの対話を目的とした音声モデル世代としてOpenAIが発表した製品だ。従来の音声AIでは、利用者の発話が終わってからAIが応答するというターン単位のやり取りが基本だった。これに対してGPT-Liveは、入力音声を継続的に処理しつつ、音声出力も生成する設計を採用する。
OpenAIは、GPT-Liveが会話中に「mhmm」や「yeah」といった相づちを示せるほか、短いやり取りを重ねたり、利用者が考える時間には静かに待機したりできると説明する。会話の中で、話す、聞き続ける、止まる、割り込む、ツールを呼び出すといった判断を毎秒何度も行えることが、この設計の特徴とされる。
同社は、この技術をChatGPT Voiceの新しい体験に活用する。VoiceボタンからChatGPTと話す際、より自然な会話、より高度な回答、聞き取りの改善、視覚的な回答表示を提供するとしている。
フルデュプレックスで「聞きながら話す」仕組みへ
OpenAIの説明では、初期のChatGPT Voiceは、音声を文字へ変換するモデル、応答文を作る大規模言語モデル、文字を音声に変換するモデルを連結する方式だった。この方式はフロンティアAIとの音声会話を可能にした一方、複数モデルをまたぐ過程で情報が失われうることや、応答が遅く不自然になりやすいことが課題だったという。
その後のターンベース音声モデルは、単一モデル内で音声を処理・生成して遅延を抑えたが、利用者が話し終えるまで応答できない離散的なターンに依存していた。沈黙を発話終了と判定するため、少しの間や周囲の雑音によって、不自然なタイミングでAIが話し始める可能性もあった。
GPT-Liveでは、別々のメッセージを順番に処理するのではなく、継続的な入出力を扱う。OpenAIはこの方式により、より自然な会話の往復、時間感覚の維持、ライブ翻訳などが可能になるとしている。利用者が質問を差し挟む、少し考えてから話す、AIに静かに聞くよう求める、といった状況への対応も新体験の要素に挙げた。
難しい質問はGPT-5.5などへ委任して処理
GPT-Liveのもう一つの設計上の特徴は、継続的な音声対話と、検索・推論などの深い処理を分離している点だ。Web検索や高度な推論、より複雑な作業が必要な場合、GPT-Liveは別のモデルへタスクを委任し、処理結果を会話に戻す。
OpenAIによれば、公開時点のGPT-LiveはバックグラウンドでGPT-5.5を使用する。今後、新しいフロンティアモデルを公開するのに合わせ、GPT-Liveが利用するモデルも継続的に更新する方針だという。AIが深い処理を進めている間にも、GPT-Liveは利用者との会話を続け、対話の流れを保つことを狙う。
ChatGPT Voiceでは、用途に応じて推論レベルを選べるとしており、素早い回答向けのInstantと、より時間をかけて考えるMedium、Highが案内されている。また、天気、株価、スポーツなどでは、会話中にリッチな視覚カードを表示できる。検索、メモリー、画像、ファイルアップロードの対応も継続する。
GPT-Live-1とminiをChatGPT Voiceへ順次展開
OpenAIはGPT-Live-1とGPT-Live-1 miniの2種類を、世界のChatGPT利用者に向けて展開開始すると発表した。GPT-LiveはiOS、Android、ChatGPT.comのChatGPT Voiceでロールアウトされるとしている。
公式発表では、GPT-Live-1はGo、Plus、Pro利用者向けのChatGPT Voiceの標準モデルとなり、GPT-Live-1 miniはFree利用者向けの標準モデルとなる予定だ。APIについても近く提供する計画を示しているが、公式発表は開発者と企業が通知登録できることを案内するにとどめている。
OpenAIは、ChatGPTで特に利用の多い一部言語向けにGPT-Liveを最適化したとする。一方、言語によっては非ネイティブに聞こえるアクセントや流暢さの不足が生じる場合があり、改善を進めているという。公開時点では、ChatGPT内の動画付き音声機能や画面共有には対応しない。
これらの機能は導入に向けて取り組んでいるとしており、従来のStandardおよびAdvanced Voice Modeは、それらの機能が利用できる場合がある。
音声固有の安全対策とSynthID透かしを導入
OpenAIはGPT-Liveを「安全をデフォルトに設計した」と説明する。最新モデルの安全性向上を基盤に、音声向けの専用安全訓練と保護策を追加した。評価対象には、自傷、精神病と躁状態、AIへの情緒的依存、暴力、性的コンテンツを含めたほか、社内の専門家による音声固有リスクのレッドチーム評価も実施したという。
音声会話はリアルタイムで進むため、システムが安全性に問題のある出力の可能性を検知した場合、より安全な応答へ誘導したり、追加の安全メッセージやリソースを表示したり、高リスク時には音声会話を終了したりできるとしている。自傷に関する会話では、専門家が確認した危機支援ホットラインの案内を含むChatGPTの支援フローを音声向けに適用する。
10代の利用者に向けては、年齢に応じた振る舞いをモデルに訓練し、不適切な応答のリスク低減を図る。保護者はペアレンタルコントロールで10代のChatGPT Voice利用を選択でき、潜在的な自傷や自殺念慮の兆候を伴う高リスク状況では、連携した保護者に通知される場合があるという。
2026年7月31日の更新では、ChatGPT VoiceとOpenAI APIを通じてGPT-Liveが生成する対応音声にSynthID電子透かしを含めると発表した。対応音声ファイルに含まれるOpenAI由来のシグナルは、同社の公開検証ツールで検出可能になった。開発者や組織が自らの業務フローへ出所確認を組み込めるよう、検証用APIも導入したとしている。
Agent Memories編集部の考察
ここからは公式発表を踏まえた編集部の考察である。GPT-Liveの重要点は、単に音声の応答速度を高めるのではなく、「会話を続けるモデル」と「調査・推論を担うモデル」を役割分担させたことにある。人間同士の会話では、相手が情報を調べたり考えたりしている間にも、確認や補足のやり取りが進む。GPT-Liveは、この対話の連続性をAI側で再現しようとする設計といえる。
一方で、自然な相づちや待機、割り込み対応は、AIが人間らしく感じられる度合いを高めうる。だからこそ、OpenAIが情緒的依存や自傷などを音声ネイティブの評価項目に含め、会話中に働く保護策や長期的な監視を掲げた点は重要だ。使いやすさの向上と、利用者がAIとの関係をどう受け止めるかという課題は、切り離せないだろう。
また、生成音声へのSynthID透かしと検証APIは、音声コンテンツの出所確認を実務に組み込むための基盤となりうる。もっとも、透かしの対象は公式に「対応する音声ファイル」とされている。利用者や事業者は、検証の可否を個別の音声ファイルや利用経路に応じて確認する必要がある。
よくある質問
GPT-Liveとは何ですか?
GPT-Liveは、OpenAIが発表した新世代の音声モデルである。聞くことと話すことを同時に行うフルデュプレックス方式を採用し、ChatGPT Voiceでより自然な会話を実現することを目的としている。
GPT-Liveは複雑な質問にも答えられますか?
OpenAIによると、Web検索、深い推論、複雑な作業が必要な問いでは、GPT-Liveが背後のフロンティアモデルにタスクを委任する。公開時点ではGPT-5.5をバックグラウンドで用いるとしている。
ChatGPT Voiceの動画や画面共有はGPT-Liveで使えますか?
公式発表では、公開時点のGPT-LiveはChatGPTにおける動画付き音声と画面共有をサポートしないとしている。従来のStandardおよびAdvanced Voice Modeでは、これらの機能が利用可能な場合がある。
GPT-Liveの生成音声は識別できますか?
2026年7月31日の公式更新によれば、ChatGPT VoiceおよびOpenAI API経由でGPT-Liveが生成する対応音声にはSynthID電子透かしが含まれる。OpenAIの公開検証ツールは、対応音声ファイル内の出所シグナルを検出できるとしている。
まとめ
OpenAIのGPT-Liveは、フルデュプレックスの連続対話と、GPT-5.5などへのバックグラウンド委任を組み合わせ、ChatGPT Voiceをより自然で高機能な音声体験へ更新するモデルだ。GPT-Live-1とGPT-Live-1 miniの展開、安全対策、生成音声へのSynthID透かしも発表内容に含まれる。
自然な会話を実現する技術の進展とともに、音声AIの安全性、出所確認、言語ごとの品質改善が今後も重要な論点となる。
公式出典・確認日
OpenAI公式情報を2026-08-10時点で確認しています。提供範囲・料金・画面は更新される場合があります。
新しいAIへ乗り換えても、自分の前提や判断を持ち運べる状態をつくる。Agent Memoriesは、記憶をスキルや外部ツールへつなぐAIパートナー基盤を育てています。
AIエージェントの記憶を知る Agent Memoriesを見る本カテゴリはMiraigent / Agent Memoriesによる非公式編集記事です。OpenAIとの提携・承認・後援を示すものではありません。