小米は、テキストを音声に変換し、その逆も可能にする新しいAIモデルMiMo V2.5をリリースしました

小米は、テキストを音声に変換し、その逆も可能にする新しいAIモデルMiMo V2.5をリリースしました

33 software

小米は新しい音声AIモデルを発表しました

小米社は、テキストとオーディオの両方で動作する2つのバージョンの音声AIモデルを紹介しました:

モデル機能主な特徴
MiMo‑V2.5‑TTSテキスト → 音声3種類のサブタイプ、MiMo Studioで期間限定無料。速度・トーン・感情調整可能。短いフレーズから新しい音声を生成(VoiceDesign)し、小さなサンプルセットから音声をクローン(VoiceClone)。
MiMo‑V2.5‑ASR音声 → テキスト難しい環境での話者認識。中国語方言+英語に対応。バイリンガル対話と歌詞テキスト(バックミュージック中のボーカル)をサポート。騒音が強い場合でも動作し、イントネーションに基づいて自動的に句読点を挿入。

MiMo‑V2.5‑TTS の使い方
1. ベーシック:事前設定された声の中から1つ選び、速度・トーン・感情色調を変更できる。
2. VoiceDesign:短いフレーズを入力すると、新しい音質が生成される。
3. VoiceClone:選択した声の数サンプルをアップロードし、スタイルと指示を保持して再現する。

望む音色を実現するためにユーザーは以下を行える:
- テキストに特殊タグを追加
- 中国語または英語で簡単な自然言語で声を説明
- 複数の声が同時に対話する仮想演出用シナリオを作成

MiMo‑V2.5‑ASR の特徴
- 多言語対応:複数の中国語方言と英語をサポート。
- 歌詞認識:バックミュージックがある場合でもボーカルを抽出。
- ノイズ耐性:強い外部騒音環境で正確に認識。
- イントネーションによる句読点付与:自動的に句読点を挿入し、手作業の修正を減らす。

このように、小米は音声技術分野での能力を拡大し、合成音声と正確な話者情報認識の両方に柔軟なツールを提供しています

コメント (0)

感想を共有してください。礼儀正しく、話題に沿ってお願いします。

まだコメントはありません。コメントを残して、あなたの意見を共有してください!

コメントを残すにはログインしてください。

コメントするにはログイン