OpenAIはGPT‑Realtime‑2と、API経由でのみ利用可能な2つの新しい音声バージョンを発表しました
15
hardware
OpenAIは音声APIの機能を拡張しました
同社は、開発者がより「生きた」音声アプリケーションを作成できるようにする新機能を発表しました。これらの機能により、ユーザーと会話し、音声をテキストに文字起こしし、リアルタイムで通話を翻訳できます。
Realtimeモデル
Realtimeインターフェースでは、現在3つのモデルが利用可能です:
| モデル | 目的 | 主な特徴 |
|---|---|---|
| GPT‑Realtime‑2 | リアルタイム音声対話 | リクエスト解析、ツール呼び出し、修正処理、およびスムーズな会話継続。GPT‑5のロジックに基づき、GPT‑Realtime‑1.5よりも複雑なタスクを処理可能 |
| GPT‑Realtime‑Translate | リアルタイム翻訳 | 70以上の入力言語と13の出力言語をサポート。文脈変更や地域アクセント、専門用語でも意味を保持 |
| GPT‑Realtime‑Whisper | 音声文字起こし | 低レイテンシーのストリーミングモデルで、音声をほぼ瞬時にテキスト化 |
> 「私たちの新しいモデルは、単純な対話からリアルタイムで音声インターフェースへとオーディオを変換し、本当に機能するようになりました。聞く、推論する、翻訳する、文字起こしする、そして会話が進むにつれて行動を取ることができます」と同社は述べました。
料金
| モデル | 価格 |
|---|---|
| GPT‑Realtime‑2 | 入力音声トークン1Mあたり$32、キャッシュ済みトークン1Mあたり$0.40、出力音声トークン1Mあたり$64 |
| GPT‑Realtime‑Translate | 分間$0.034 |
| GPT‑Realtime‑Whisper | 分間$0.017 |
試す方法
開発者はOpenAI Playgroundのオンラインプラットフォームで新モデルをテストし、リアルタイムで動作する様子を即座に確認できます
コメント (0)
感想を共有してください。礼儀正しく、話題に沿ってお願いします。
コメントするにはログイン