小米はOmniVoiceをリリースしました。これはほぼすべての言語でテキストを音声化し、声をコピーできるオープンAIモデルです
50
software
XiaomiはオープンAIモジュールOmniVoiceを発表
同社はテキストを音声に変換する人工知能モデルOmniVoiceのリリースを発表しました。数百言語での音声合成だけでなく、音声クローン化やユーザー設定による発音生成も可能です。
OmniVoiceの新機能は?
| 指標 | 説明 |
|---|---|
| 言語 | 200以上の言語をサポートし、希少言語や学習データが少ない言語でも10時間未満のデータでほぼ任意の言語で音声を生成可能。 |
| 品質 | 102言語でのテストでは、人間と同等またはそれ以上の明瞭さを実現し、24言語では商用システムを上回る類似性と明瞭度を達成。 |
| アーキテクチャ | 中間トークン予測モジュールなしの簡易双方向Transformerネットワークにより、10万時間のデータで1日で学習完了し、PyTorchでは実時間の40倍まで推論速度が向上。 |
| 技術 | 「ランダム音響コード隠蔽」による高速学習と、大規模言語モデルとの事前学習接続により発音と明瞭度を改善。 |
実用機能
1. 音声クローン化
- 年齢、性別、トーン、アクセント、方言などの特徴で音声生成。
- 基準オーディオなしでもささやきやその他スタイルバリエーションを作成可能。
2. 原音処理
- ノイズ除去と不完全ファイルからもクリーンな音声特徴抽出。
3. インテンション制御
- 息遣いや笑いなどのニュアンスを追加し、より自然な発話に。
4. 発音微調整
- 多音節中国語漢字や英語固有名詞など複雑な音素を手動で調整可能。
結論
OmniVoiceは既存の商用音声合成システムに対抗できる競争力を備えています。シンプルな設計、高速学習・推論、豊富なカスタマイズ機能により、消費者向けアプリやサービスへの統合が容易です
コメント (0)
感想を共有してください。礼儀正しく、話題に沿ってお願いします。
コメントするにはログイン