MaineCoon:史上最速のストリーミング音声・動画ソーシャルモデル
Catnip チームが 22B パラメータのストリーミング音声・動画モデル MaineCoon を発表。単一枚の H100 で 47.5 FPS を達成し、コストは Veo 3 のわずか 1/2000、30 分超の音声・映像同時出力に対応します。


MaineCoon:史上最速のストリーミング音声・動画ソーシャルモデル
Catnip チームが 22B パラメータのストリーミング音声・動画モデル MaineCoon を発表。単一枚の H100 で 47.5 FPS を達成し、コストは Veo 3 のわずか 1/2000、30 分超の音声・映像同時出力に対応します。
既存の音声・動画生成モデルには大きく分けて二つの弱点があります。速度が遅く、生成が完了するまで結果を見られないか、動画は生成できても音声がおろそかになり音と映像が常に別々に処理されるか、どちらかです。Catnip チームが発表した MaineCoon(マインクーン)は、この二つの問題を同時に解決しようとしています——22B パラメータのモデルでありながら、単一枚の H100 で 47.5 FPS を叩き出し、指示を出してから 1 秒以内に最初のフレームを生成、30 分超の音声・映像同時出力に対応し、毎秒のコストは 0.001 米ドル以内に抑えられています。
MaineCoon とは何か
MaineCoon は Catnip チームが開発したストリーミング音声・動画ソーシャルモデルで、名前はメインクーンという猫の品種に由来します——この品種は「猫の中の犬」という異名を持ち、飼い主がどこへ行くもほとんどついて回ります。モデルも同じで、一気に生成して終わりではなく、あなたの状態に寄り添いながらリアルタイムに先へ進みます。
テキストを与えると、生成しながらそのまま再生し、音声と映像の同時出力まで実現します。その様子は、まるで真人と 1V1 のビデオ通話をしているかのようです。長さは 30 分以上に達し、この長さを実現したのは業界初です。
核となる機能
音声・動画のストリーミング生成
ストリーミング生成そのものは目新しい概念ではありません(ChatGPT が一文字ずつ吐き出すのもストリーミング出力です)が、動画の 1 フレームは何千何万というピクセルを扱い、さらに音声とタイムライン上で正確に揃える必要があり、難易度はまったく次元が違います。生成セグメントを小さくするほど、各フレームが依拠できる過去のコンテキストは短くなり、モデルは破綻しやすくなります。
MaineCoon はこの単位をサブ秒級まで極限に圧縮しました。指示を出してから 1 秒以内に最初のフレームが出力され、低レイテンシと高品質を両立します。途中でリアルタイムに新しい指示を入力しても、モデルは即座に調整できます。
業界最速の推論速度
同種のストリーミング音声・動画モデルの速度は軒並み 6-7 FPS ですが、MaineCoon はちょうど 7 倍速いです。
- 22B パラメータ:シングル H100 でデプロイ、最大 47.5 FPS
- RTX Pro 6000(H100 の半分のコストの推論カード):安定して 30 FPS 以上
- 1.3B の軽量ストリーミング動画モデル(19.1 FPS)と比べても 2 倍以上速い
速度のために品質は犠牲になっておらず、むしろ感情表現はより豊かで、動作はより滑らかで安定しています。
無制限の長さでの生成
MaineCoon は 10 分を超える音声・動画コンテンツを連続生成でき、その間も画質・一貫性・音声と映像の同期のどれも崩れません。アーキテクチャ上は、完全に無限の生成すら可能です。
自社構築の SocialVideo Bench ベンチマーク(密度の高い講演、二人のインタラクション、音楽歌唱、感情表現、ダンス、クリエイティブチャレンジ、ソーシャルミームの 7 大シーンをカバー)では、MaineCoon は総合スコア 0.934 を記録し、主流の 7 つの音声・動画生成モデルを上回って SOTA を塗り替えました。
コスト比較
| モデル | 毎秒の推論コスト | MaineCoon との比較 |
|---|---|---|
| MaineCoon(GPU 満載) | 0.00025 米ドル | 基準 |
| MaineCoon(標準) | <0.001 米ドル | 基準 |
| Veo 3 | 約 0.5 米ドル | MaineCoon の 1/2000 |
| Seedance | 約 0.14 米ドル | MaineCoon の 1/560 |
技術アーキテクチャ
学習側:三段階の漸進
- 自己再サンプリング(Self-Resampling):学習時に劣化版の過去フレームに触れさせ、不完全な条件下でも安定を保つことを学ばせ、推論と学習の間の溝を解消します
- ストリーミング表現の整合:凍結した事前学習済み V-JEPA 2 ビジュアルエンコーダを導入して蒸留による監督を行い、学習の収束を加速します
- ドメイン選好最適化(DPO)+ 強化オンラインポリシー蒸留(ROPD):ダンス、会話、ロングショットなど異なるソーシャルシーンごとに選好エキスパートモデルを学習し、デプロイ可能な単一のストリーミングポリシーへ統合します
22B モデルは 10k GPU 時間以内で学習が完了し、データは 100 万件未満です。
推論側:3 つのインテリジェントコントローラ

- Director(ディレクター):認知の中核で、ナラティブとエラー修正を担当。ビートごとに構造化プロンプトを生成し、品質ドリフトを常時監視し、問題を発見すると前方修復を起動します
- Cache Manager(キャッシュマネージャ):KV キャッシュの保持と削除を管理し、キャラクターの外見、シーン確立フレーム、重要な対話フレームを長期記憶のアンカーとして保持します
- Buffer Controller(バッファコントローラ):リアルタイム性とインタラクション応答のバランスを取り、先読みバッファ量を制御して、再生が止まらずに続きユーザーの指示が即座に反映されるようにします
応用シーン
MaineCoon は初めてシーンをソーシャルインタラクションへ垂直に落とし込み、狙いは「生きた人間感」です——視線の変化、口元のひきつり、話すリズムといった、リアリティを決める細部です。
- AI ソーシャル会話:人物の会話をシミュレートし、キャラクターの顔の筋肉の動きや語気の間を指示どおり正確に再現します
- リアルタイムインタラクションコンテンツ:いつでも質問してキャラクターに答えさせたり、新しい指示を入力してキャラクターの行動を調整できます
- 長尺動画生成:10 分を超える連続コンテンツで画質と一貫性を維持します
💡 ヒント:MaineCoon は現在、200 個の招待コードに限った限定クローズドベータを開放しています。チームの次の目標は「ソーシャルワールドモデル」です——人を座標系の中心に据え、ユーザーの感情を能動的に観察し、人を原点としてソーシャル行動の行方をシミュレートします。公式サイト mainecoon.tech からベータ応募が可能です。
関連記事

AnySearch:「検索」を Agent 向けのインフラに作り変える
Product Hunt 週間ランキング首位を獲得した AnySearch は検索ボックスではなく、AI Agent に「フィルタ済み・重複除去済み・構造化済み」の情報を渡す統一 API です。この記事ではそのポジショニング、接続方式、Token を節約できる理由を分解します。

Claude Sonnet 5 リリース:性能は Opus 4.8 に肉薄、価格は60%
Anthropic が Claude Sonnet 5 をリリース。デフォルトでアダプティブシンキングが有効化され、新トークナイザを導入。価格は $3/$15 を維持し、8月31日までは $2/$10 の期間限定価格です。

Mandol 実操:LLM 呼び出しなしの Agent 長期記憶を構築する
中国科学院ソフトウェア研究所が Mandol をオープンソース化。SemanticMap + SemanticGraph で KV/ベクトル/グラフの保存を統一し、検索段階は LLM 呼び出しゼロ、検索5.4倍高速化、LoCoMo/LongMemEval の両 benchmark で最高精度を達成。

MCP が企業向け統一認可を発表:1回のログインで全コネクタが自動で利用可能に
Model Context Protocol が Enterprise-Managed Authorization 拡張を発表。企業は Okta などの IdP で MCP Server へのアクセスを一元管理でき、ユーザーは設定ゼロで初回ログイン時に接続完了します。

MobileForge 実操:GUI Agent でラベルなしデータのフライホイールを回す
Kuaishou が浙江大学と共同で MobileForge をオープンソース化。MobileGym + HiFPO により、スマホ GUI Agent が実アプリ内で自己探索・自己フィードバック・自己最適化します。完全なコードとモデル付きです。

StepFun Step Edge 端末向けフルラインナップ:0.1秒のローカル Agent 呼び出し
StepFun が Step Edge 端末向けモデルファミリーを発表。ベース/Audio/GUI/Gen の4種を含み、スマホや車載シーンを主眼に、ローカル toolcall は最速 0.1秒、機密データは端末外に出ません。