
Higgs Audio V2
公式収録1,000万時間超の音声で事前学習されたBoson AI製オープンソースの高表現力音声生成モデルです
閲覧 90お気に入り 0無料
Higgs Audio V2
Higgs Audio V2は、Boson AIが開発したオープンソースの音声基盤モデルで、1,000万時間を超える音声データで事前学習されています。ポストトレーニングやファインチューニングなしで高度に表現力豊かな音声生成を実現し、感情表現と複数話者による対話生成で業界トップレベルに達しています。
主な機能
- ゼロショット音声クローン: 参照音声をもとに類似の音色でスピーチを生成
- 複数話者の対話生成: エネルギーや感情を自動的に合わせた、自然で滑らかな複数人の会話に対応
- 多言語音声生成: 複数言語のテキスト読み上げ
- 自動韻律適応: ナレーション中にトーンとリズムを自動調整
- 感情表現力: EmergentTTS-Evalの感情カテゴリで75.7%の勝率を達成し、GPT-4o-mini-ttsを上回る
- 音楽と音声の融合: BGMとスピーチ内容を同時に生成可能
ユースケース
コンテンツ制作では、クリエイターがポッドキャスト、オーディオブック、動画ナレーションの生成に利用できます。マルチメディア制作では、複数キャラクターの対話音声を素早く生成できます。音声クローンでは、開発者が少量の参照音声からパーソナライズされた音声合成を構築できます。
独自の強み
Higgs Audio V2は、Llama-3.2-3Bをベースにした革新的なDualFFNアーキテクチャを採用し、総パラメータ数は5.8Bです。音声品質は16kHzから24kHzに向上し、話者類似度と全体的な自然さで優れた性能を発揮します。感情表現を真に「認識」する初のオープンソースモデルとして、イントネーション、タイミング、トーンの制御に長けています。
料金
完全免费使用
よくある質問
Higgs Audio V2とは何ですか?
Higgs Audio V2はAIツールです。1,000万時間超の音声で事前学習されたBoson AI製オープンソースの高表現力音声生成モデルです
Higgs Audio V2は無料ですか?
はい、Higgs Audio V2は無料版を提供しています。
Higgs Audio V2の使い方は?
公式サイトにアクセスしてHiggs Audio V2を利用できます。上の「公式サイトを見る」ボタンから始められます。