5大モデル実測:Qwen3.7 Max のプログラミング能力は本当に通用するのか

·Toolin 編集部

Qwen3.7 Max はプログラミング競技ランキングで世界2位に到達し、Claude Opus 4.7 に次ぎます。本記事では液体シミュレーション、六角形 2048、地下鉄博物館、ブラウザ OS の4つのタスクで、Qwen3.7 Max、GPT-5.5、Gemini 3.5 Flash、DeepSeek V4、Claude Opus 4.7 のプログラミング性能を実測比較します。

5大モデル実測:Qwen3.7 Max のプログラミング能力は本当に通用するのか

Alibaba の最新フラグシップモデル Qwen3.7 Max がプログラミング競技ランキングで2位を獲得しました。GPT-5.5、Gemini 3.5 Flash、DeepSeek V4 Pro を超え、Claude Opus 4.7 に次ぐ順位です。Terminal Bench や SWE Bench などの従来型プログラミングベンチマークでも、中国製モデルとして1位です。

ランキングの数字は魅力的ですが、実際に使いやすいのでしょうか。5つのモデルと4つのタスクで、一文プロンプトによる Vibe Coding 能力を実測しました。

モデルの入手と価格

Qwen3.7 Max は現在 Alibaba Cloud 百炼プラットフォームで利用可能で、新規ユーザーには100万トークンの無料枠があります。期間限定の5割引き価格は、入力6人民元/100万トークン、出力18人民元/100万トークンです。

Opus 4.7 や GPT-5.5 と比べると Qwen3.7 Max の価格には明確な優位性がありますが、DeepSeek の低価格と比べるとまだかなり高めです。

テスト1:液体シミュレーションアニメーション

プロンプト:「HTML+CSS+JS で、容器の中の液体が揺れるアニメーションを作って。容器をドラッグすると傾き角度を変えられるように。」

Qwen3.7 Max:スムーズにタスクを完了し、さらに色のカスタマイズ、揺れ、液体量調節などの機能を追加。堅実な出来栄えです。

DeepSeek V4:比較的シンプルですが、ミスはありません。

GPT-5.5:液体の演出がやや奇妙で、波のアニメーションが興醒めです。

Gemini 3.5 Flash:ボトルがコントロールパネルの背後に隠れてしまい、手動で引き出す必要があります。ただしカスタマイズ項目は最多。

Claude Opus 4.7:ボトルがあまりに粗末で、液体の揺れの表現は激しい状態だと音波の跳動のように見えます。

テスト2:六角形 2048

プロンプト:「遊べる 2048 を作って。ただしマスは六角形にして。」

このテストは、モデルが非標準グリッドのゲームロジックを理解できるかを検証します。

Qwen3.7 Max:見た目が良く遊べますが、まれに数字が重なる位置が正しくないことがあります。

DeepSeek V4:六角形なのに、キーボード操作は WASD の4方向だけです。

Claude Opus 4.7:最も良い出来栄え。ハニカムのルールを本当に理解しており、マスの移動方向は完全に六角形のロジックに従っています。

GPT-5.5:Codex の能力に支えられ、生成後に自分でブラウザを開いてプレビューし、コンソール情報を取得してコードを修正できます。ただしマウスでの方向操作は Opus 4.7 に及びません。

Gemini 3.5 Flash:大量の追加要素——3種類の背景テーマ、内蔵の8ビット宇宙サウンドエフェクトで、体験は充実の極みです。

テスト3:地下鉄博物館ウェブサイト

プロンプト:「『地下鉄博物館』という名前のテーマサイトをデザインして。没入感が強いこと。」

本来は、モデルに各都市の地下鉄情報やロゴ、芸術性のある全体スタイルを見せてほしいという意図でした。

Qwen3.7 Max:地下鉄の車両のように文字を縦に配置していますが、全体の印象は雑然としています。

Gemini 3.5 Flash:最も優れた出来栄え。地下鉄グッズやカスタム記念切符ジェネレータを作り、名前を入力して駅を選ぶと、レトロ風の記念乗車券をリアルタイム生成できます。

GPT-5.5:ページのスタイルは良いものの、情報量が少なく、地下鉄博物館が情報展示サイトであるべきことを理解していません。

DeepSeek V4:チケット記念や運転体験を設計しましたが、最終的に納品された成果物にはこれらの機能が反映されていません。

テスト4:ブラウザ OS

プロンプト:「HTML で完全なブラウザ OS を構築して。」

Qwen3.7 Max:良い感じのデスクトップ風景画像を追加していますが、全体には単純めです。

Gemini 3.5 Flash と GPT-5.5:同率でベスト。どちらも OS 全体を詳細に設計しており、専用のスタイルと完全なインタラクションがあります。

DeepSeek V4:最もシンプルです。

Qwen3.7 Max を Codex に接入する

実測では、Qwen 公式サイトだけで Qwen3.7 Max を使うより、Codex などの Agent 製品に接入した方が良い結果が出ることがわかりました。接入方法は以下のとおりです:

設定手順

  1. Alibaba Cloud 百炼プラットフォームで API Key を取得
  2. ~/.codex/config.toml 設定ファイルを修正し、モデル情報を追加
  3. 同時にパソコンの環境変数(.bash_profile または .zshrc)を修正し、API Key を書き込む
  4. 端末で codex と入力して起動すると、モデルは GPT-5.5 から Custom に切り替わります
# 環境変数の例(.zshrc または .bash_profile に追加)
export QWEN_API_KEY="your-api-key-here"

同じ方法で DeepSeek、MiniMax、Kimi などのモデルも Codex に接入できます。

Codex の設定

注意:接入後に stream disconnected before completion: InternalError.Algo.InvalidParameter: The "function.arguments" parameter of the code model must be in JSON format というエラーに遭遇する可能性があります。これは百炼のストリーミング出力形式が標準の OpenAI プロトコルではなく、Agent のツール呼び出し時に不安定なためです。この場合、公式の修正を待つか、新しいセッションを開き直すしかありません。

Skill を併用するとさらに良い

Codex にフロントエンドデザイン Skill(https://github.com/Leonxlnx/taste-skill)をインストールすると、同じ一文プロンプトでも、Codex が自動的にデザイン Skill を呼び出してデザインの方向づけと構想を完了し、最終的に生成される結果は Qwen 公式サイトで直接生成するよりかなり良くなります。

Skill 併用の効果

結論

一言でまとめると:Qwen3.7 Max はプログラミング能力で確かに大きく向上しましたが、一文 Vibe Coding のシーンでは、まだ GPT-5.5 や Gemini 3.5 Flash を安定して超えるには至りません。

ただし Codex などの Agent 製品に接入し Skill と組み合わせると、効果は質的な飛躍を見せます。これは一つのトレンドを裏付けています。モデル能力だけではもう不十分で、記憶、オーケストレーション、検証、推論の持続性といった「周辺能力」が同じく重要なのです。

関連記事

Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き
AI製品

Doubao Seed 2.1 Pro 実測:Codingがトップティア入り、マルチモーダルにも驚き

ByteDanceのDoubao Seed 2.1 Proを実測。Agent Codingとマルチモーダル能力が本番利用可能な水準を超え、スクリーンショットからのフロントエンド対話復元に対応。価格はClaude Opus 4.6比で約80%低下。

Toolin 編集部
Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入
AI製品

Hyper3D Rodin Gen-2.5:4秒で100万ポリゴン、3D生成にThinking機構を導入

影眸科技(Deemos)がHyper3D Rodin Gen-2.5を発表。3D生成で初めてLLM類似のThinking機構を導入し、4秒で100万ポリゴンのモデルを生成、1000万ポリゴン精度と12Kネイティブテクスチャを実現した。

Toolin 編集部
WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー
AI製品

WeChat「小微」AIアシスタント実測:12の入口がチャット・コンテンツ・ドキュメントの全シーンをカバー

WeChatネイティブのAIアシスタント「小微」は段階的ロールアウト中。メインモデルは自社開発のWeLMで、チャット履歴の検索、公式アカウント記事の要約、ローカル生活サービスの呼び出しが可能。機密性の高い操作には二段階確認が必要。

Toolin 編集部
DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる
AI製品

DeNovoSWE:初の長距離Doc2Repo訓練セット、Code Agentにリポジトリ構築を学ばせる

中国人民大学高瓴学院がDeNovoSWEを発表。「ドキュメントから完全なリポジトリを生成する」初の長距離訓練セットで、4818件の実タスクインスタンスを含む。Qwen3-30BはBeyondSWE-Doc2Repoで5.8%から47.2%へ向上した。

Toolin 編集部
Baidu搭子(DuMate)実操作チュートリアル:インストールから自動化までの中国製オフィスAgent
AIチュートリアル

Baidu搭子(DuMate)実操作チュートリアル:インストールから自動化までの中国製オフィスAgent

Baidu搭子DuMateの「要求→承認→実行→納品」チェーンを最初から最後まで走らせるガイド。インストール、UI、オフィスシーンの実践と自動化を1本でまとめた。

Toolin 編集部
Claude Tag:AIを本当の意味でチームの同僚にする
AI製品

Claude Tag:AIを本当の意味でチームの同僚にする

AnthropicがClaude Tagを発表。ClaudeをSlackワークフローに組み込み、共有コンテキスト、持続的メモリ、能動的介入に対応する、チーム協働の新パラダイム。

Toolin 編集部