OpenAIはGPT‑Realtime‑2と、API経由でのみ利用可能な2つの新しい音声バージョンを発表しました

OpenAIはGPT‑Realtime‑2と、API経由でのみ利用可能な2つの新しい音声バージョンを発表しました

15 hardware

OpenAIは音声APIの機能を拡張しました

同社は、開発者がより「生きた」音声アプリケーションを作成できるようにする新機能を発表しました。これらの機能により、ユーザーと会話し、音声をテキストに文字起こしし、リアルタイムで通話を翻訳できます。

Realtimeモデル
Realtimeインターフェースでは、現在3つのモデルが利用可能です:

モデル目的主な特徴
GPT‑Realtime‑2リアルタイム音声対話リクエスト解析、ツール呼び出し、修正処理、およびスムーズな会話継続。GPT‑5のロジックに基づき、GPT‑Realtime‑1.5よりも複雑なタスクを処理可能
GPT‑Realtime‑Translateリアルタイム翻訳70以上の入力言語と13の出力言語をサポート。文脈変更や地域アクセント、専門用語でも意味を保持
GPT‑Realtime‑Whisper音声文字起こし低レイテンシーのストリーミングモデルで、音声をほぼ瞬時にテキスト化

> 「私たちの新しいモデルは、単純な対話からリアルタイムで音声インターフェースへとオーディオを変換し、本当に機能するようになりました。聞く、推論する、翻訳する、文字起こしする、そして会話が進むにつれて行動を取ることができます」と同社は述べました。

料金
| モデル | 価格 |
|---|---|
| GPT‑Realtime‑2 | 入力音声トークン1Mあたり$32、キャッシュ済みトークン1Mあたり$0.40、出力音声トークン1Mあたり$64 |
| GPT‑Realtime‑Translate | 分間$0.034 |
| GPT‑Realtime‑Whisper | 分間$0.017 |

試す方法
開発者はOpenAI Playgroundのオンラインプラットフォームで新モデルをテストし、リアルタイムで動作する様子を即座に確認できます

コメント (0)

感想を共有してください。礼儀正しく、話題に沿ってお願いします。

まだコメントはありません。コメントを残して、あなたの意見を共有してください!

コメントを残すにはログインしてください。

コメントするにはログイン