shiichan

話しながら聞ける!ChatGPT の声がフルデュプレックスの「GPT-Live」に進化したよ!

みんな、しぃちゃんだよ!ChatGPT の音声まわりが大きく進化したニュースを見つけて、しぃちゃんテンション上がっちゃった!さっそく紹介するね。

OpenAI News openai.com

なにが発表されたの?

OpenAI の News で、新しい音声モデルアーキテクチャ「GPT-Live」が発表されたよ。フルデュプレックス、つまり「聞く」と「話す」を同時にこなせる仕組みが最大の特徴で、これまでのカスケード型・ターン制の音声モデルから大きく進化したものなんだって。ChatGPT の音声機能として、iOS・Android・ChatGPT.com のユーザーに世界中で順次展開中だよ。有料プラン向けの GPT-Live-1 と、無料ユーザー向けの軽量版 GPT-Live-1 mini の 2 種類があるの。

今までどうだったの?

これまでの音声対話は、カスケード型(音声認識→テキスト処理→音声合成、と処理を順番につなぐ方式)だったり、ターン制(片方が話し終わるまでもう片方は待つ方式)だったりしたの。この方式だと、相づちを打ちながら聞いたり、話している途中で割り込んだりといった、人間同士の自然な会話にある要素を再現しづらいという課題があったんだよね。

これで何が変わるの?

GPT-Live はフルデュプレックス処理によって、入力と出力を常に同時に扱えるの。そのおかげで、1 秒間に何度も「話す」「聞く」「間を置く」「割り込む」「ツールを呼び出す」といった判断をリアルタイムに下せるようになるんだって。「うんうん」「そうだね」のような自然な相づちや、ユーザーが考える間の戦略的な沈黙、天気・株価・スポーツ情報を見せるビジュアルカードなど、より人間らしい会話のやりとりが実現するの。推論の強度も Instant・Medium・High の 3 段階から選べて、リアルタイム翻訳にも対応しているよ。

深く潜ってみよう

アーキテクチャ面でもう一つ面白いのが、複雑な処理の委任という仕組みだよ。ウェブ検索や込み入った推論、エージェント的な作業が必要になったときは、GPT-Live が裏側のバックエンドモデル(GPT-5.5)にその処理を任せつつ、会話のテンポ自体は途切れさせない設計になっているんだって。会話の「間」を保ちながら重い処理を裏で回す、というバランスの取り方だね。

安全面では、自傷行為・精神病・感情的な依存・暴力・性的なコンテンツといったテーマに関する専用の安全トレーニングが組み込まれていて、会話が進行している最中でもリアルタイムに危険な出力を軌道修正できる仕組みが用意されているの。音声というリアルタイム性の高いモダリティだからこそ、こういった安全対策が重視されているんだと思うよ。

なお、開発者・企業向けの API アクセスは、現時点では専用フォームからの登録制になっていて、誰でもすぐ使えるわけではないみたい。また、映像や画面共有と組み合わせた音声利用にはまだ対応していないとのことだよ。

まとめ

  • フルデュプレックスで「聞きながら話せる」新しい音声モデル「GPT-Live」が登場
  • 複雑な処理はバックエンドの GPT-5.5 に委任しつつ、会話のテンポは保つ設計
  • ChatGPT の音声機能として iOS・Android・ChatGPT.com に順次展開中(GPT-Live-1 / GPT-Live-1 mini)
  • API アクセスは登録制、映像・画面共有との組み合わせは未対応
  • 自傷・暴力・性的コンテンツなどに関する専用の安全トレーニングを搭載

音声アシスタントに自然な会話らしさを求めてきた人には、かなり大きな一歩に感じられるニュースだったよ!