FineVLA オープンソース化:ひと言でロボットの使う手や掴む位置を制御
香港大学とAlibabaが共同公開した制御可能VLAフレームワーク「FineVLA」。言語で実行アームや接触領域などの細部を指定でき、RoboTwinシミュレーションで成功率86.8%を達成。


FineVLA オープンソース化:ひと言でロボットの使う手や掴む位置を制御
香港大学とAlibabaが共同公開した制御可能VLAフレームワーク「FineVLA」。言語で実行アームや接触領域などの細部を指定でき、RoboTwinシミュレーションで成功率86.8%を達成。
現在のロボットモデルは「コップをカゴに入れて」という指示は理解できますが、どちらの手で?どの方向から掴む?コップの本体を持つか、持ち手を持つか?こうした実行効果を左右する重要な細部は、既存のデータセットではほとんど注釈されていません。香港大学 XLANG Lab と Alibaba Qwen チームが共同で FineVLA をオープンソース化しました——制御可能な VLA(Vision-Language-Action)ポリシー向けのオープンソースフレームワークで、ロボットにタスクを遂行させるだけでなく、人間が指定したやり方で遂行させることを可能にします。コード、モデル、評価ベンチマークはいずれも公開済みです。
FineVLA とは何か
「ロボットに実行の細部を理解させる言語レイヤー」と捉えるとよいでしょう。画像生成では、テキスト記述の細部が結果の制御性に直接影響します。ロボットポリシー学習も同様で、言語は実際の動作プロセスを拘束する必要があります。同じスプーンの持ち上げでも、軌跡によって左腕を使うか右腕を使うか、障害物を迂回するか直線で動くかは異なりますが、データセットでは往々にして同じ目標レベルの指示を共有しています。
これは教師ありの曖昧さをもたらします。モデルは「最終的に成功すること」は学べても、どちらの手を使うか、どの方向から接近するか、物体のどの部位に接触するかといった実行上の制約を言語から学ぶことは困難です。FineVLA はまさにこのレイヤーを補うために生まれました。
FineVLA は「コップをカゴに入れて」を「左手で、右側から接近し、持ち手を掴む」といった実行可能な具体指示に変えます。
コアコンポーネント:4つのモジュールでループを構成
FineVLA は「データ—モデル—評価—ポリシー」の完全なループを構築しました。
左側はデータ構築のパイプライン(10 データセット → 97万軌跡 → 4.7万の代表サンプル → 10次元注釈)、右側はポリシー学習と評価です。
コンポーネント1:FineVLA-Tool —— 97万軌跡から細粒度データへ
4つの段階を経て、異種ロボットデータを高品質な細粒度の教師信号に変換します。
- 段階1 フォーマット統一:Bridge V2、BC-Z、RT-1、RoboMIND など 10 のオープンソースデータセットから 972,247 軌跡を集約し、LeRobot2.1 フォーマットに統一変換
- 段階2 動作の正規化:時間基準と運動学表現を絶対座標+正規化済みクォータニオン回転に統一し、破損軌跡を除去
- 段階3 DTW クラスタリングによる重複排除:動的時間伸縮法に基づいて動作軌跡の類似度を計算して階層クラスタリングを行い、97万件から 47,159 件の代表サンプルを選別
- 段階4 10次元の細粒度注釈:動作シーケンス、実行主体(左/右アーム)、対象物体、接触・接近方式、軌跡方向、失敗回復など 10 の次元で注釈。注釈後の平均単語数は 9.3 から 96.8 に増加(10.4 倍)
コンポーネント2:RoboFine-VLM —— VLM にロボットの動きの記述を学ばせる
汎用 VLM は物体の曖昧さの区別、接触領域、運動経路といった実行の細部を見落としがちです。チームは Qwen3.5-VL-397B-A17B に全パラメータの教師ありファインチューニングを行い、RoboFine-VLM を得ました——10 の制御次元を網羅するステップレベルの動作記述を出力でき、将来のデータ拡張に使えるスケーラブルなアノテーターです。
コンポーネント3:RoboFine-Bench —— 細粒度の動作理解を評価
評価ベンチマークは訓練セットと厳密に重複しておらず、VQA と Caption の2トラックに分かれ、定位、動作理解、状態推論という3つの評価軸をカバーします。
500 本の動画、32 種のロボット形態、11,631 個のアトミックファクトを含み、訓練セットとは厳密に重複しません。2 つのトラックが設けられています。
- VQA トラック:1030 問、10 の細粒度次元に沿って分布
- Caption トラック:動作と整合したステップレベルの記述の生成をモデルに求め、LLM が一貫性、カバー率、反ハルシネーションの3指標を採点
コンポーネント4:FineVLA-Policy —— 細粒度言語がポリシーに与える効果を検証
3 つの構成を設計して「アーキテクチャ」と「データ規模」の影響を厳密に分離し、各構成を 7 種類の FG:Raw 指示比率で評価します。
実際に使ってみて:効果データ
シミュレーションと実機ロボットの結果
最適な混合ポリシー設定での成績:
| 評価環境 | 指標 | FineVLA | 比較基線 | 向上 |
|---|---|---|---|---|
| RoboTwin シミュレーション | 成功率 | 86.8% / 82.5% | 基線 | +15.0 / +11.1 |
| 実機双腕ロボット | スコア | 62.7 / 100 | Raw-only 49.9 | +12.8 |
制御可能な要素で分解すると、姿勢(+23)、色(+18)、接近方向(+18)などの次元でいずれも大幅な向上がありました。
メリット
- 本当の意味で制御可能:「完了できる」ではなく「あなたの言ったやり方で完了する」
- データループが完全:異種データから細粒度注釈、評価、ポリシーまで、各環節すべて公開
- 評価ベンチマークが公開されて利用可能:RoboFine-Bench はロボットの細粒度理解評価の空白を埋める
限界
- 主に双腕シーンで検証:単腕、移動操作などの形態への転移効果は自己検証が必要
- 注釈品質に依存:細粒度注釈は現在 Qwen3.5-Plus での生成+人手によるレビュー。スケール拡大は RoboFine-VLM の安定性次第
応用シーン
- 身体性AI(Embodied AI)研究:公開済みのコード+モデル+ベンチマークで、制御可能 VLA の研究ベースラインとしてそのまま使える
- 産業用双腕ロボット:実行の細部(どちらの手で、どこを掴むか)を精密に制御する必要があるシーン
- ロボットデータの注釈付け:RoboFine-VLM をスケーラブルなアノテーターとして使い、新規データセットの細粒度注釈を加速できる
- VLA モデル評価:RoboFine-Bench はモデルが「言うことを聞くか」を測る公共の物差し
コード、モデル、評価ベンチマークはすべて GitHub で公開済みです(「FineVLA」で検索)。