Qwen-Image-3.0:Alibaba Qwen の第3世代画像生成モデル

·Toolin 編集部

4.5k token の超長入力、10px 級の小文字までクリアにレンダリング、12言語に対応。ポスター、試験問題、コマ割り漫画などの複雑なレイアウトを一発で出力できます。

Qwen-Image-3.0:Alibaba Qwen の第3世代画像生成モデル

これまで AI 生図の文字化け、文字欠落、長文崩壊に繰り返し悩まされてきたなら、Alibaba Qwen の新世代画像生成モデル Qwen-Image-3.0 が解決しようとしているのはまさにこの問題です。最大 4.5k token の入力に対応し、新聞レイアウト、試験問題、コマ割りストリップ漫画のような大量の文字を含む複雑なレイアウトを一度で直出できます。EC 素材、SNS ポスター、教育コンテンツ、UI シミュレーション、そして「文字が正確でなければならない」あらゆる図文シーンに向いています。本稿では、その能力の境界、主力モデル ID と API 呼び出し方法を短時間で把握できるよう解説します。

Qwen-Image-3.0 とは

Qwen-Image-3.0 は Alibaba Qwen の Qwen-Image シリーズ第3世代の画像生成モデルです。前世代と比べ、AI 生図を「クリエイティブなおもちゃ」から「生産性ツール」へ押し進めており、核心のアップグレードは3つの方向に集中しています:

  • 長文と複雑レイアウト: 最大 4.5k token 入力に対応し、新聞、絵コンテ、試験問題など大量の文字を含む複雑なレイアウトを正確に生成できます。
  • ディテールレンダリング: 10px の小文字をクリアにレンダリングでき、毛穴、髪の毛などの微視的な質感もリアルに再現します。
  • 多言語と世界知識: 12 言語のレンダリングをネイティブサポートし、豊富な世界知識と組み合わせて Web ページ、ゲーム、ライブ配信画面のシミュレーションを構築できます。

公式の文生図マシン評価によれば、Qwen-Image-3.0 は現時点で GPT Image 2 に次ぐ中国国内首位の画像生成モデルです(公式の最新ランキングを基準に)。

コア能力

文字レンダリング: 長文、小文字、多言語を一気に

文字生成はずっと画像生成モデルの技術的な難所でした。Qwen-Image-3.0 の実測パフォーマンス:

  • 『滕王閣序』の全文約 800 字を書き上げ、誤字・脱字なし。タイトル、作者、本文の文字サイズの階層もはっきりしており、赤い篆刻の印まで追加できます。
  • コンサートチケットを生成すると、テーマ、日付、住所などの文字が正確に表現され、フォントスタイルも統一されています。
  • 中・英・韓の多言語混在の歌詞フローティング効果でも、文字欠落、文字化け、ずれや変形が発生しません。

複雑構図: コマ割り漫画と群像

20 コマの縦長ショート漫画を一度で直出できます: 前後のストーリーがスムーズにつながり、吹き出しの文字はクリアで通じ、キャラクターの表情や動きはストーリーに合致します。群像の画面では、古装、仙侠、軽いサイバーパンクなど複数のスタイルのキャラクターが自然に共存し、商店の看板の文字も正確です。

UI とインタフェースシミュレーション

高難度のユースケースを一つ: モデルに「VS Code のプログラミング画面の中で、Qwen アプリを通じて、WeChat チャット画面に投稿するハンドドリップコーヒーのポスターを生成する」よう依頼します。モデルは多層 UI のネスト関係を正確に理解し、順番に VSCode のプログラミング画面、Qwen アプリの画面、SNS チャット画面とコーヒーポスターを生成し、最終的な効果は各プラットフォームのネイティブページのビジュアル規範にほぼ合致しました。

主力モデル ID とパラメータ(Alibaba Cloud 百炼ドキュメントより)

Qwen の文生図(Qwen-Image)は汎用画像生成モデルで、特に複雑なテキストレンダリングが得意で、複数行レイアウト、段落レベルのテキストと細粒度のディテール描写に対応します。現在の主力モデル ID:

  • qwen-image-2.0-pro(おすすめ): Pro シリーズ。文字レンダリング、リアルな質感、意味遵守がより強力で、文生図と画像編集に対応。出力解像度は 512×512 から 2048×2048、デフォルトは 2048×2048、1〜6 枚の出力に対応し、同期インタフェースのみ対応。
  • qwen-image-2.0(おすすめ): 加速版。効果と応答速度を両立し、パラメータは Pro と同じ。
  • qwen-image-max: Max シリーズ。リアリティと自然さがより強く、AI 合成の痕跡がより少ない。デフォルトは 1664×928、固定 1 枚。
  • qwen-image-plus: Plus シリーズ。多様な芸術スタイルと文字レンダリングが得意。

💡 ヒント: モデルのバージョン番号とパラメータは Alibaba Cloud 百炼(Model Studio)の公式ドキュメントを基準にしてください。新バージョンは随時登場する可能性があります。

使い方: API 呼び出し

現在、Alibaba Cloud 百炼と Qwen AI プラットフォームは Qwen-Image-3.0 API のインビテーションテストを開始しており、Qwen Studio と Qwen アプリはまもなく無料体験を開放予定です。API 呼び出しの要点:

エンドポイント: 北京リージョン POST https://{WorkspaceId}.cn-beijing.maucs.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation

認証: Alibaba Cloud 百炼の API Key を使用し、HTTP ヘッダーに Authorization: Bearer sk-xxxx を追加します。

リクエストボディの主要フィールド:

  • model: モデル ID、例: qwen-image-2.0-pro。
  • input.messages: 単一ターン・単一 user メッセージのみ対応。
  • parameters:
    • negative_prompt: ネガティブプロンプト。
    • size: 出力解像度。
    • n: 出力枚数。
    • prompt_extend: インテリジェント書き換え。より豊かなディテールを得るために有効化を推奨。オフにするとより制御しやすくなります。
    • watermark: 透かし。
    • seed: ランダムシード。

いくつかの落とし穴回避の注意:

  • プロンプト長の上限: qwen-image-2.0 シリーズは 1300 Token、その他のモデルは 800 Token。中国語と英語に対応しています。
  • 生成画像の URL 有効期限はわずか 24 時間です。速やかにダウンロードして保存してください。
  • 正常に生成された画像の枚数で課金され、失敗タスクは課金されません。

具体的な課金帯は Alibaba Cloud 百炼コンソールを基準にしてください。

誰が使うべきか

  • EC と SNS 運営: 商品画像、イベントポスター、詳細ページ画像を量産。文字が正確でなければならない現場です。
  • 教育コンテンツ制作: 試験問題、教材、科学解説のロング画像。数式と専門注記が大量に含まれます。
  • 漫画と絵コンテの制作者: 複数コマのストリップ漫画を一気に直出でき、ストーリーも連続しています。
  • プロダクトと UI デザイナー: インタフェースシミュレーションを迅速に生成し、マルチプラットフォームのビジュアル検証に活用します。

終わりに

Qwen-Image-3.0 は AI 生図の中で最も手強い二つの課題——文字の乱れと長文理解——を一歩前進させ、同時に UI、科学解説ロング画像、連続絵コンテといった強い適性を持つシーンを強化しました。「直出しで使える素材」が必要なプロのクリエイターにとって、反復デバッグと何度も描き直す試行錯誤のコストを下げてくれています。文字を安定してレンダリングできる中国語の画像生成モデルを探しているなら、百炼コンソールでインビテーション枠を申請して試す価値があります。

公式ドキュメント: