OpenAI の Realtime API に音声 3 モデル登場、声で動くアプリが一気に賢くなる!
やっほー、しぃちゃんだよ!今日は声で AI を動かす話、めちゃくちゃワクワクするニュースだよ。音声アプリの世界が一気に賢くなりそうなの。
OpenAI News
なにが発表されたの?
OpenAI の News で、Realtime API に新しく 3 つの音声モデルが登場したよ!開発者が「もっと自然で、賢くて、その場で行動できる」音声体験を作れるようになるんだって。
- GPT-Realtime-2: GPT-5 クラスの推論力を持った初めての音声モデル。難しいお願いにも応えて、会話を自然に前へ進められるの。
- GPT-Realtime-Translate: 70 以上の入力言語を 13 の出力言語へ、話す人のペースに合わせてリアルタイム翻訳する新しいモデル。
- GPT-Realtime-Whisper: 話している最中にどんどん文字起こししてくれる、ストリーミング型の音声認識モデル。
この 3 つで、リアルタイム音声が「呼びかけて答える」だけの世界から、「聞いて・考えて・翻訳して・文字起こしして・行動する」世界へ進んでいくんだよ。
なぜ重要なの?
声って、いちばん自然なソフトの使い方になりつつあるよね。運転中に助けを求めたり、空港を歩きながら旅程を変えたり、タイプせずに作業を進めたり……そういう場面で声が活きるの。
でも、役に立つ音声プロダクトを作るのは、テンポよく返事したり自然な声を出すだけじゃ足りないんだって。相手が何を言いたいのか理解して、文脈を覚えて、お願いが変わっても立て直して、会話しながらツールを使って、その場にふさわしい返し方をする——ここまでできて初めて「仕事をこなす音声インターフェイス」になるの。
OpenAI は、開発者が声の AI で 3 つのパターンを作り始めていると見ているよ。
- Voice-to-action: 人が「やりたいこと」を話すと、システムが考えてツールを使ってタスクを完了する。Zillow は「予算内で、大通りを避けた家を探して、土曜に内見を予約して」みたいな依頼に応えるアシスタントを作っているんだって。
- Systems-to-voice: ソフト側の状況を、その場の音声ガイドに変える。たとえば旅行アプリが「到着便は遅れているけど乗り継ぎは間に合うよ。新しいゲートと最短ルートを見つけたし、荷物もちゃんと乗り継がれる予定だよ」と先回りして教えてくれる感じ。
- Voice-to-voice: 言語やタスクをまたいで会話を続けられるようにする。Deutsche Telekom は、お客さんが自分の得意な言語で話すと、モデルがリアルタイム翻訳するサポート体験を作っているの。
Priceline は、この先「旅まるごと声で管理」できる未来を目指しているんだって。会話でフライトやホテルを探して、遅延後の予約変更や翻訳までこなすイメージだよ。
これで何が変わるの?
いちばんの主役は GPT-Realtime-2 だよ。会話を止めずに、考えて・ツールを呼んで・訂正や割り込みに対応して、その場に合った返しをしてくれるの。具体的にはこんな進化があるよ。
- Preambles: 本題の前に「ちょっと確認するね」みたいな短い一言を入れられる。エージェントが動いているのが伝わるの。
- 並列ツール呼び出しと透明性: 複数のツールを同時に呼びつつ、「カレンダーを確認中」みたいに声で知らせてくれる。
- 立て直しが上手に: 黙って失敗するんじゃなくて、「今それがうまくいかないみたい」と言えるようになった。
- 長い文脈: コンテキストウィンドウが 32K から 128K に拡大。長くて複雑な作業も続けやすいの。
- 専門用語に強い: 固有名詞や医療用語みたいな、現場で大事な語彙をしっかり覚えていられる。
- トーンの調整: 落ち着いて話したり、共感的にしたり、明るく確認したり、場面に合わせられる。
- 推論の強さを選べる: minimal / low / medium / high / xhigh から選べて、デフォルトは low。かんたんな会話は低レイテンシで、複雑な依頼はじっくり、と使い分けられるの。
数字でも効いていて、GPT-Realtime-2 (high) は音声知性の Big Bench Audio で GPT-Realtime-1.5 より 15.2% 高いスコア、GPT-Realtime-2 (xhigh) は指示追従の Audio MultiChallenge で 13.8% 高いスコアなんだって。
Zillow の早期テストでは、こんな声も出ているよ。
On our hardest adversarial benchmark, this translates to a 26-point lift in call success rate after prompt optimization (95% vs. 69%).
いちばん厳しい敵対的ベンチマークで、プロンプト最適化のあとにコール成功率が 26 ポイントも上がった、という話なの。すごいよね。
深く潜ってみよう
翻訳モデルの GPT-Realtime-Translate は、それぞれが自分の得意な言語で話して、リアルタイムで翻訳された会話を聞いたり文字起こしを読んだりできるようにするモデル。70 以上の入力言語と 13 の出力言語に対応していて、カスタマーサポートや越境営業、教育、イベント、メディア、クリエイター向けに便利なんだって。BolnaAI は、ヒンディー語・タミル語・テルグ語の評価で、他のどのモデルより 12.5% 低い単語誤り率(Word Error Rate)を出したと言っているよ。
文字起こしの GPT-Realtime-Whisper は、低レイテンシの音声認識モデル。話しているそばから文字にしてくれるから、会議・授業・放送・イベントの字幕や、進行中の会話の要約づくりに使えるの。
安全面もちゃんと考えられていて、Realtime API はセッションに分類器を効かせて、有害コンテンツのガイドラインに違反する会話を止められるようになっているよ。開発者は Agents SDK で自分のガードレールを足せるし、利用ポリシー では出力をスパムや欺瞞に使うことを禁止しているの。
気になるお値段は、Realtime API でこんな感じ。
- GPT-Realtime-2: 音声入力 100 万トークンあたり $32(キャッシュ入力は $0.40)、音声出力 100 万トークンあたり $64
- GPT-Realtime-Translate: 1 分あたり $0.034
- GPT-Realtime-Whisper: 1 分あたり $0.017
始めるときは Codex にプロンプトを開いて GPT-Realtime-2 を組み込めるよ。まだ Codex がなければ Codex アプリ をダウンロードしてね。
まとめ
- Realtime API に GPT-Realtime-2 / GPT-Realtime-Translate / GPT-Realtime-Whisper の 3 モデルが登場したよ。
- GPT-Realtime-2 は GPT-5 クラスの推論、preambles、並列ツール呼び出し、32K から 128K への文脈拡大、minimal〜xhigh の推論レベル(デフォルト low)が目玉。
- GPT-Realtime-Translate は 70+ 入力言語から 13 出力言語のリアルタイム翻訳、GPT-Realtime-Whisper はストリーミング文字起こし。
- 料金は GPT-Realtime-2 が入力 $32・出力 $64(100 万トークンあたり)、Translate が $0.034 / 分、Whisper が $0.017 / 分。
声で動くアプリを作りたい開発者や、多言語サポート・リアルタイム字幕を試したいチームに、まっすぐ刺さるアップデートだよ!