AlibabaがQwen-AgentWorldをオープンソース化:初の言語世界モデル、ひとつのモデルで7クラスの環境をシミュレート

·Toolin 編集部

AlibabaのQwenが初のネイティブ言語世界モデル(Language World Model, LWM)「Qwen-AgentWorld」をオープンソース化。単一モデルでMCP / Search / Terminal / SWE / Web / OS / Androidの7クラスのエージェント環境をカバーし、評価ベンチマークAgentWorldBenchも同時公開。

AlibabaがQwen-AgentWorldをオープンソース化:初の言語世界モデル、ひとつのモデルで7クラスの環境をシミュレート

AlibabaのQwenが、初のネイティブ言語世界モデル(Language World Model, LWM)Qwen-AgentWorldをリリースした。AIエージェントの研究開発と訓練のために作られたものだ。その中核能力は:エージェントが行動を取る前に、まず内部で環境フィードバックをシミュレートしてから意思決定すること。ひとつのモデルで7クラスのエージェント対話環境を同時にカバーし、評価ベンチマークAgentWorldBenchも同時リリース、モデルウェイトとベンチマークはどちらもオープンソース化されている。

この記事では、Qwen-AgentWorldとは何か、どう動くか、効果はどうか、どう入手するかを分解する。

これは何か

Qwen-AgentWorldは言語世界モデルで、2つのパラメータ規模を提供する:

  • Qwen-AgentWorld-35B-A3B(オープンウェイト)
  • Qwen-AgentWorld-397B-A17B

これは実環境との対話の置き換えを狙うものではない——実環境は、エージェントの行動の信頼性を保証するゴールデンスタンダードであり続ける。LWMが提供するのは 相補的な経路 だ:実環境を超えるスケーラビリティと制御性、そして内化された世界予測能力を持つ。

上図はスマートフォンシステムのシミュレーション:左側がスマホ画面の初期状態、右側がエージェントがツールバーの削除アイコンをタップする操作の予測結果だ。

2つの大きなハイライト

ハイライト1:事前訓練の段階から環境モデリングを訓練目標に

環境モデリングが CPT → SFT → RL の全過程を貫く。従来の汎用基盤大モデルの訓練では、訓練終了後に初めてAIに環境の理解や操作結果の予測を教えていた。Qwen-AgentWorldはこのステップを事前訓練段階へ前倒しし、1000万件を超える実環境対話軌跡に基づいて訓練されている。

3段階の訓練フロー

ハイライト2:単一モデルで7クラスの環境をカバー

クラスカバーする環境
テキスト系MCP、Search、Terminal、SWE
GUI系Web、OS、Android

3つのGUI領域の環境観測は、ピクセルフレームではなく レンダリング可能なコード(アクセシビリティツリーXML、HTML、UI階層マークアップ)として表現される。これにより、純テキストの世界モデリングだけで視覚環境をカバーでき、領域をまたぐ知識転移が実現する。

Qwen-AgentWorld がシミュレートできる7クラスの対話環境

PCシステム(メニューバーで「ファイル」>「印刷」をクリックする操作の予測など)やウェブサイトの対話(「ユーザーを追加」ボタンをクリックする操作の予測など)をシミュレートできる。

効果:全体のシミュレーション品質はClaude Opus 4.8超え

同時リリースされた AgentWorldBench は、5つのフロンティアモデルによる9つの成熟評価セット上の実環境対話観測に基づいて構築され、フォーマット、事実性、一貫性、真実性、品質の5次元で評価する。

  • Qwen-AgentWorld-397B-A17B はAgentWorldBenchで最高の全体平均スコア 58.71 を達成し、GPT-5.4(58.25)、Claude Opus 4.8、Gemini 3.1 Proを上回った。優位性はTerminalとSWE領域で最も顕著だ。
  • 35B-A3B 規模 では、3段階訓練パイプラインが全体平均スコアを8.66ポイント引き上げ、Claude Sonnet 4.6を上回る性能を示した。

AgentWorldBench の評価結果

創発した3つの推論パターン

研究チームはテキスト系4領域の129本の思考連鎖を分析し、3つの創発的な推論パターンを発見した:

  1. 自己修正:モデルが「Wait!」を自己訂正のトリガー信号として使い、中間予測を修正する(平均で1turnあたり10.4回)。事実誤り、知識の境界、視点転換をカバーする。
  2. 情報漏洩防止:検索領域では、モデルはエージェントが検索している参照答えをすでに知っており、要約が目標を偶然漏らさないよう確保することで漏洩を防ぐ。
  3. 多段因果推論:例えば curl -s localhost:3000 | python3 -m json.tool の出力を予測する際、6段の推論チェーンを走らせる——Node.js が無い → サーバーが起動していない → ポート3000でリッスンしていない → curl が静かに失敗 → 空のパイプ → json.tool が JSONDecodeError を投げる。

💡 ヒント:Qwen-AgentWorldは、言語世界モデルが「分離した環境シミュレータ」としてエージェントRLに制御可能な訓練環境を提供できると同時に、「統一されたエージェント基盤モデル」にもなることを検証した——その事前訓練は7つのベンチマークを含む複数ターンのエージェントタスクへ転移でき、エージェントタスク向けのRLファインチューニングを一切必要としない。

入手方法

AlibabaはQwen-AgentWorld-35B-A3B(モデルウェイト)とAgentWorldBench(評価ベンチマーク)をオープンソース化した。

誰に向くか

  • エージェント研究開発チーム:LWMを制御可能な環境シミュレータとして使い、実環境よりスケーラブルな訓練経路をエージェントRLに提供する。
  • GUI / Computer-Useエージェント開発者:Qwen-AgentWorldでWeb / OS / Android上の操作結果を予測し、試行錯誤のコストを下げる。
  • エージェント基盤モデル研究者:言語世界モデルの事前訓練から複数ターンのエージェントタスクへの転移能力を探究する。

参考