JoyAI-Echo: JDがオープンソース化した5分長動画生成フレームワーク
JDが初めて長音声動画生成フレームワークJoyAI-Echoをオープンソース化。キャラクター一貫性、音声安定性、生成速度の3大難題に直接切り込み、複数の指標でリードします。


JoyAI-Echo: JDがオープンソース化した5分長動画生成フレームワーク
JDが初めて長音声動画生成フレームワークJoyAI-Echoをオープンソース化。キャラクター一貫性、音声安定性、生成速度の3大難題に直接切り込み、複数の指標でリードします。
AI長動画生成にはずっと「不可能な三角形」がありました:長時間、高一貫性、高速さの3つは両立できないように見えます。同じキャラクターが前のショットと次のショットで見た目が違い、話者の声色は上がったり下がったり、レンダリングには半日待たされる。JDが最新でオープンソース化したJoyAI-Echoは、これらの痛点を1つずつ撃ち破るために来ました。

JoyAI-Echoとは
JoyAI-EchoはJDが初めてオープンソース化した長音声動画生成フレームワークで、分単位のナラティブ動画生成に対応し、キャラクターの外見と声色は複数ショット間で一貫性を保ちます。コードとモデルの重みはすべて公開され、開発者はこれをベースに二次開発とファインチューニングができます。
- GitHubアドレス:https://github.com/jd-opensource/JoyAI-Echo
- Hugging Face:https://huggingface.co/jdopensource/JoyAI-Echo
- プロジェクトページ:https://echo-team-joy-future-academy-jd.github.io/Echo-LongVideo-Page/
核心技術のブレークスルー
1. クロスモーダル音声動画メモリバンク:「顔が変わる」問題を解決
従来のモデルはショットごとの生成時に履歴内容の記憶がなく、毎回「記憶喪失」のように最初からやり直していました。JoyAI-Echoは専用のメモリバンクを内蔵し、キャラクターの視覚特徴と聴覚特徴を継続的に保存して精密に呼び出します。5分間のマルチショット生成において、このメモリバンクは監督の手の中の「キャラクター台帳」のようなもので、呼び出すたびに出力の一貫性を保証します。

2. 記憶駆動ポストトレーニング:速度7.5倍向上
JoyAI-Echoは三段階のポストトレーニングパイプラインを設計しました:SFT -> クロスモーダルRLHF -> 分布マッチング蒸留(DMD)。DMD技術は多ステップ拡散の教師-生徒蒸留を8ステップの高速推論に圧縮し、約7.5倍の推論速度向上をもたらします。長動画を「半日待ち」から「秒で出力」に変えました。
3. Director Agent(監督エージェント):対話式編集
自然言語で要件を伝えられます。たとえば「第3場のカフェの背景を図書館に変えて」。要件の分解、動画生成、結果チェックを自動で行います。気に入らない箇所はその部分のショットだけ再生成し、動画全体をやり直す必要はありません。
4. 軽量リアルタイム超解像:720pから高精細へ
付属のリアルタイム超解像モジュールは、レイテンシをほとんど増やさずに、ネイティブ720p動画を最高1472x2560解像度まで引き上げます。
評価データ
100本の独立した物語脚本、合計3000カットの厳しい評価の中で:
| 指標 | 結果 |
|---|---|
| 音声正確率 | 0.8646(業界リード) |
| 音声品質選好 | 81.7% |
| プロンプト追従性選好 | 80.6% |
| IPキャラクター一貫性選好 | 59.4% |
応用シーン
- バーチャルアニメと物語制作:自然言語でAIに指示して、一貫したアニメシリーズを生成
- デジタルヒューマンのライブ配信と短編ドラマ:長時間にわたり声色、リップシンク、表情の一貫性を維持
- ブランドマーケティングコンテンツ:台詞や一部ショットを変更するだけで複数バージョンの動画を生成
- 映像絵コンテの予演:プレビュー動画を素早く生成し、カメラワークを検証
- 教育教材とゲームアニメーション:一貫したストーリーのアニメを動的に生成
入手方法
コードとモデルの重みはすべてオープンソースで、GitHubリポジトリjd-opensource/JoyAI-Echoへ行けば入手できます。
関連記事

Gemma 4 12B:16GBノートPCでマルチモーダルAIモデルを動かす
Googleが120億パラメータのオープンソースマルチモーダルモデルを発表。テキスト、画像、音声入力に対応し、9GBのVRAMがあればノートPCでローカル実行できます。Apache 2.0ライセンス。

Hermes Desktop:オープンソースエージェントがデスクトップへ
Nous Researchがデスクトップ向けオープンソースエージェントHermes Desktopを発表。macOS/Windows/Linuxをカバーし、CLIエージェントのスキルとメモリをすべて再利用、マウス操作だけで使えます。

Kimi Work:ナレッジワーカー向けのローカルAI Agent
Moonshot AIがデスクトップ向け汎用Agentを発表。Agentクラスター、ブラウザ制御、金融データソースに対応し、ホワイトカラーも日常業務をAIで完了できます。

OpenClaw 2026.6.1:ついにWindowsをネイティブサポート
世界最大のオープンソースAI Agentプロジェクトが大型アップデートを発表:Windowsネイティブ接続、スキル工房によるAgentの自己進化、マルチAgentワークボードの協働で、16億台のPCがコンピュートノードに変わります。

Step 3.7 Flash:409 tok/sのAgent効率モデル
StepFunの新モデルは出力速度409 tokens/s、単タスクコストはClaude Opus 4.6の1/9、コーディング能力はその97%に達し、Agentの高頻度呼び出しシーンのために設計されています。

OpenSquilla 3.0: MetaSkillでAIスキルフローを自動編成
オープンソースAI AgentフレームワークOpenSquilla 3.0がMetaSkillを発表。自然言語で多ステップワークフローを自動合成し、スマートモデルルーティングと組み合わせて使用コストを下げます。