小米は、テキストを音声に変換し、その逆も可能にする新しいAIモデルMiMo V2.5をリリースしました
33
software
小米は新しい音声AIモデルを発表しました
小米社は、テキストとオーディオの両方で動作する2つのバージョンの音声AIモデルを紹介しました:
| モデル | 機能 | 主な特徴 |
|---|---|---|
| MiMo‑V2.5‑TTS | テキスト → 音声 | 3種類のサブタイプ、MiMo Studioで期間限定無料。速度・トーン・感情調整可能。短いフレーズから新しい音声を生成(VoiceDesign)し、小さなサンプルセットから音声をクローン(VoiceClone)。 |
| MiMo‑V2.5‑ASR | 音声 → テキスト | 難しい環境での話者認識。中国語方言+英語に対応。バイリンガル対話と歌詞テキスト(バックミュージック中のボーカル)をサポート。騒音が強い場合でも動作し、イントネーションに基づいて自動的に句読点を挿入。 |
MiMo‑V2.5‑TTS の使い方
1. ベーシック:事前設定された声の中から1つ選び、速度・トーン・感情色調を変更できる。
2. VoiceDesign:短いフレーズを入力すると、新しい音質が生成される。
3. VoiceClone:選択した声の数サンプルをアップロードし、スタイルと指示を保持して再現する。
望む音色を実現するためにユーザーは以下を行える:
- テキストに特殊タグを追加
- 中国語または英語で簡単な自然言語で声を説明
- 複数の声が同時に対話する仮想演出用シナリオを作成
MiMo‑V2.5‑ASR の特徴
- 多言語対応:複数の中国語方言と英語をサポート。
- 歌詞認識:バックミュージックがある場合でもボーカルを抽出。
- ノイズ耐性:強い外部騒音環境で正確に認識。
- イントネーションによる句読点付与:自動的に句読点を挿入し、手作業の修正を減らす。
このように、小米は音声技術分野での能力を拡大し、合成音声と正確な話者情報認識の両方に柔軟なツールを提供しています
コメント (0)
感想を共有してください。礼儀正しく、話題に沿ってお願いします。
コメントするにはログイン