SenseNova U1:オープンソースのインフォグラフィック生成モデル、8BパラメータでシングルGPU動作

·Toolin 編集部

SenseTimeがオープンソース化した8Bパラメータのインフォグラフィック生成モデル。Apache 2.0ライセンスで商用利用可能。文字レンダリングが安定し、レイアウト制御が精密で、コストはクローズドソース方式の約10分の1です。

SenseNova U1:オープンソースのインフォグラフィック生成モデル、8BパラメータでシングルGPU動作

GPT-Image 2 がインフォグラフィック生成に火をつけましたが、クローズドソースで、Token 単位の課金であり、100万出力トークンあたり最大30ドルもかかります。ローカルデプロイや二次開発が必要な場合、SenseTimeがオープンソース化した SenseNova U1 が現時点で最も注目に値する代替案です。8Bパラメータ、Apache 2.0ライセンス、シングルGPUで動作し、コミュニティの実測コストはクローズドソース方式の約10分の1です。

SenseNova U1 とは

SenseNova U1 は SenseTime がオープンソース化したマルチモーダル生成モデルシリーズで、自社開発の NEO-unify アーキテクチャを採用しています。従来の画像モデルに必須だった VAE とビジョンエンコーダを捨て、ピクセルと文字を同じ表現空間に入れてネイティブにモデリングします。つまりモデルはもはや画像を「翻訳」せず、2つの言語で同時に考えることで、圧縮に起因するディテールの欠落やノイズの問題を根源から解決しています。

Hugging Face の中国開発者コミュニティは「純粋なエンドツーエンドのピクセル-文字モデリングを実現した」と評価しています。

SenseNova U1 アーキテクチャの概要

インフォグラフィック強化版のコア能力

SenseTime はベース版に加えて、さらに SenseNova-U1-8B-MoT-Infographic(インフォグラフィック強化版)をオープンソース化しており、インフォグラフィックのシーン向けに専用の最適化が施されています。

文字レンダリングの安定性

インフォグラフィック生成の最大の難所は文字です。SenseNova U1 インフォグラフィック強化版は、中国語と英語が高密度に混在するシーンでも、文字レンダリングに目立った破綻がありません。大量の棒グラフ、表、中英バイリンガルを含む「LLM アーキテクチャの進化」知識図解のテストでは、BERT から GPT-5 までの年代とパラメータ規模がひと目で分かり、文字化けは発生しませんでした。

レイアウト制御の精密さ

ポスター生成テストでは、モデルは組版の指示を正確に理解します。たとえば「中央の余白が画面の約40%」「呼吸感を極めて強く」という要求に対し、余計な装飾を詰め込むことなく、抑制の効いたデザイン原則を厳格に守りました。ダークカラーのセリフ体とベージュの紙テクスチャの組み合わせは、東洋の余白の詩情とモダン組版のバランス感を的確に捉えています。

構造化ドキュメント生成

学術論文ページの生成テストでは、モデルは arXiv スタイルの完全なページ組版を正確に出力しました。フォーマットは明瞭で、複雑な数式にも構造上のエラーはなく、そのまま使える完成度を示しています。

学術論文ページの生成結果

高密度の中国語小文字レンダリング

企業ブランドの運用ロジックを扱う高密度の中国語インフォグラフィックテストでは、モデルはほぼすべての中国語の小さな文字を正確にレンダリングし、組版は明瞭で読みやすいものでした。

高密度中国語インフォグラフィックの生成結果

GPT-Image 2 との比較

2つのモデルはインフォグラフィック生成の分野で明確な分化を見せています:

観点GPT-Image 2SenseNova U1 強化版
設計の方向性ビジュアル派:光影やマテリアルの視覚的インパクトを追求生産ツール派:情報構造の明確さを優先的に保障
文字レンダリング品質は高いが文字サイズが小さめ安定していて可読性が高い
コスト100万出力トークンあたり$30クローズドの約1/10
デプロイ方式API呼び出しのみローカルデプロイ、シングルGPUで動作
ライセンスクローズドソースApache 2.0、商用利用可

端的に言えば、GPT-Image 2 は視覚効果を追求する場面に向き、SenseNova U1 は正確な情報伝達が必要な実際の生産シーンにより適しています。

デプロイ情報

  • モデルパラメータ:8B
  • ライセンス:Apache 2.0(商用利用可)
  • デプロイ要件:1枚の RTX 5880(48GB VRAM)、実際のVRAM使用量は約30GB
  • コミュニティサポート:GGUF 量子化重みはコミュニティの手で自主的に提供されており、デプロイのハードルをさらに下げています
  • ベンチマーク向上:BizGenEval (Hard) で6.8ポイント向上、IGenBench Q-ACC で18.2ポイント向上

向いている人

  • コンテンツクリエイター:インフォグラフィック、ポスター、知識図解を大量に生成する必要がある人
  • 開発チーム:インフォグラフィック生成能力をローカルにデプロイし、継続的なAPI費用を避けたいチーム
  • 学術/オフィスシーン:構造化ドキュメントやプレゼンテーションのページを生成する必要がある場面
  • 商用ユーザー:Apache 2.0 ライセンスが商用を許可しており、後顧の憂いがありません