MaineCoon:22Bパラメータで47.5 FPS、史上最速のストリーミング音声・動画ソーシャルモデル

·Toolin 編集部

Catnipチームがストリーミング音声・動画ソーシャルモデルMaineCoonを発表。22Bパラメータで47.5 FPSの推論を実現し、30分以上の音声・映像同時出力に対応。コストはVeo 3のわずか1/2000。

MaineCoon:22Bパラメータで47.5 FPS、史上最速のストリーミング音声・動画ソーシャルモデル

中国拠点の10人スタートアップCatnip(猫薄荷)が、ストリーミング音声・動画ソーシャルモデルMaineCoonをリリースしました。22Bパラメータのモデルが、H100 1枚で47.5 FPSを叩き出し、初フレームは1秒以内に登場、30分超の連続生成に対応します。コストは1秒あたり0.001ドル以内に抑えられ、GPU満載時には1秒わずか0.00025ドルです。

核心機能

音声・映像のストリーミング生成

MaineCoonは「生成し終えてから再生」ではなく、生成しながら再生し、音と映像を同期して出力します。指示を出してから1秒以内に初フレームが現れ、その後ストリーミング出力が始まります。途中でいつでも新しい指示を入れられ、モデルはシームレスに切り替えます。

既存モデルとの根本的な違い:

  • 主流の音声・映像モデル:6-7 FPS、生成が完了して初めて視聴可能、音と映像は分離
  • MaineCoon:47.5 FPS、サブ秒級の初フレーム、音声・映像が同時に出力され、リアルタイム切り替えが可能

無限時間の生成

業界初となる30分超の連続音声・映像生成を実現し、その間ずっと画質、一貫性、音声・映像同期が崩れません。公式は2分間の連続生成動画を公開しており、最後まで人物に目立った崩れは生じませんでした。

リアルタイムのソーシャルインタラクション

MaineCoonは初めてシーンをソーシャルインタラクションに垂直に落とし込みました。核心は「生きた人間感」です:

  • 視線の変化、口元の微細な動き、話すリズムなど人物のディテールが自然
  • 音声と映像が高度に同期
  • 生成中でもいつでも指示を切り替え可能
  • ユーザーの言葉を受けるし、感情のフィードバックも返す

実際の体験

速度面の優位性

モデルタイプパラメータ数FPS
MaineCoon22B47.5
軽量ストリーミング動画モデル1.3B19.1
同種のストリーミング音声・動画モデル-6-7

MaineCoonは同種のストリーミング音声・映像モデルよりちょうど7倍高速で、H100の半分程度のコストであるRTX Pro 6000でも安定して30 FPS超を維持します。

コスト比較

  • 1秒あたりの推論コスト:0.001ドル(通常)、0.00025ドル(GPU満載時)
  • Veo 3との比較:コストの1/2000
  • Seedanceとの比較:コストの1/560

ベンチマークの成績

Catnipはソーシャルショート動画専用のベンチマークとしては初となるSocialVideo Benchを独自に構築しました。密集したスピーチ、2人のインタラクション、音楽歌唱、感情表現、ダンス、クリエイティブチャレンジ、ソーシャルミームの7大シーンを網羅します。

MaineCoonは総合スコア0.934を獲得し、主流7モデルの音声・映像生成モデルを超えてSOTAを更新しました(これまでの最良ベースラインSoulX-FlashTalkのスコアは0.895)。

技術アーキテクチャ

3段階の学習

  1. セルフリサンプリング(Self-Resampling):学習段階から劣化版の履歴フレームに触れさせ、軽微なドリフトとノイズを含む条件下でも安定を保つことを学ばせ、学習と推論の溝を埋める
  2. ストリーミング表現アライメント:凍結した事前学習済みV-JEPA 2視覚エンコーダを蒸留監視に導入し、モダリティ横断の意味構造学習を加速
  3. ドメイン認識型選好最適化+強化学習によるオンラインポリシー蒸留:異なるソーシャルシーン(ダンスは動き、会話はリップシンク、遠景は人体構造)ごとに専用の選好エキスパートモデルを学習させ、それをデプロイ可能な単一のストリーミングポリシーへ統合

3エージェント推論フレームワーク

推論側は3つの独立したインテリジェントコントローラで構成されます:

  • Director(ディレクター):ナラティブの計画と品質修正を担当。オブザーバーが生成コンテンツを常時監視し、ドリフトを発見次第ただちにフォワード修正
  • Cache Manager(キャッシュマネージャ):KVキャッシュの保持と破棄を管理。キャラクターの外観とキーフレームを長期記憶のアンカーとし、定期的に全体の外観ドリフトを補正
  • Buffer Controller(バッファコントローラ):リアルタイム性とインタラクション応答のバランスを取り、先読み生成量を適切なウィンドウ内に保つ

エンジニアリング最適化

22Bモデルの学習は64枚のH100で完了し、わずか10k GPU時間、データ量は100万件未満です。動画エンコード、テキスト埋め込み、教師特徴をすべて事前計算してディスクに保存することで、GPUは最も核心的な計算だけを行います。

応用シーン

  • バーチャルソーシャルインタラクション:1対1のビデオ会話で、AIキャラクターがリアルタイムに応答
  • コンテンツ制作:ショート動画をリアルタイムにストリーミング生成しながら、作りながら調整
  • バーチャルライバー/コンパニオン:長時間の安定動作、音声・映像同期が切れない
  • 多スタイルコンテンツ:実写スタイル、アニメスタイル(Minecraftのキャラクターなど)の両方に対応

試す方法

公式は200個の招待コードを限定で公開しています:

チームについて

Catnipの設立から半年強、チームは約10人です。創業者の楊姝瑞氏はTikTokとPixVerseでプロダクトを担当し、複数のバズったテンプレート特效を0から1で落地させた実績を持ちます。首席科学者の謝澤柯氏は香港科技大学(広州)の助教で、東京大学の博士号を取得しています。チームはすでにSequoia(紅杉)、Mingshi(明勢)などの有力VCからエンジェルラウンドの資金を調達済みです。

MaineCoonプロジェクトは2026年3月に始動し、核心研究者3名が2ヶ月でモデル学習、学習アーキテクチャ、データ基盤、推論システムのフルスタックな納品を完了しました。