
CosyVoice2
公式収録Alibaba発のオープンソース多言語AI音声生成・声質クローンモデルで、ゼロショット複製に対応します。
CosyVoice2
CosyVoiceは、AlibabaのFunAudioLLMチームによるオープンソースの多言語大規模音声生成モデルで、推論から学習・デプロイまでのフルスタック能力を提供します。大規模言語モデル アーキテクチャを基盤とし、教師あり意味トークン技術によって高品質なテキスト音声合成を実現します。最新のCosyVoice 3.0は学習データを1万時間から100万時間へ拡大し、モデル パラメータを5億から15億へ増やし、内容の一貫性、話者類似度、抑揚の自然さを大幅に向上させました。
主な特徴
- ゼロショット音声クローン: わずか3〜10秒の生音声から、抑揚や感情といったディテールを含めて素早く声を複製します
- 幅広い言語対応: 中国語、英語、日本語、韓国語、ドイツ語、スペイン語、フランス語、イタリア語、ロシア語の9主要言語と、広東語、閩南語、四川語、東北語など18以上の中国方言をカバーします
- クロスリンガル音声合成: ある言語の話者の声を使って、別の言語の音声を生成します
- 自然言語による制御: 指示テキストで言語、方言、感情、話速、音量などのパラメータを制御します
- ストリーミング音声合成: 双方向ストリーミングに対応し、最初のパケットの合成レイテンシは150ミリ秒まで低減します
- 発音のファインチューニング: 中国語のピンインと英語のCMU音素によるきめ細かい発音制御です
活用シーン
音声翻訳では、話者の声を保ちながら多言語の出力を生成できます。オーディオブックや双方向ポッドキャストの制作では、制作者が複数キャラクター・多感情の音声コンテンツを素早く生成できます。インテリジェント カスタマー サービスやヒューマン コンピュータ インタラクションでは、企業が超低レイテンシを活かして滑らかなリアルタイム音声会話を実現できます。
技術的な強み
CosyVoice 2.0は評価で5.53のMOS(平均オピニオン スコア)を記録し、商用モデルの5.52に迫り、バージョン1.0の5.4から大幅に向上しました。Seed-TTSの難問テストセットでは最低の文字誤り率を達成し、早口言葉、多音字、難読字に強みを発揮します。発音エラー率は1.0比で30〜50%低下し、TensorRT-LLMによるアクセラレーション推論に対応して4倍の性能向上を実現します。プロジェクトはGitHubで18.4kスターを獲得し、現在も活発にメンテナンスされており、2025年12月に最新版をリリースしました。
料金
完全免费开源
よくある質問
CosyVoice2とは何ですか?
CosyVoice2はAIツールです。Alibaba発のオープンソース多言語AI音声生成・声質クローンモデルで、ゼロショット複製に対応します。
CosyVoice2は無料ですか?
はい、CosyVoice2は無料版を提供しています。
CosyVoice2の使い方は?
公式サイトにアクセスしてCosyVoice2を利用できます。上の「公式サイトを見る」ボタンから始められます。