Agnes AI のオールモーダル API が無料開放:テキスト+画像+動画をワンストップで呼び出せる

·Toolin 編集部

グローバル AI Lab ランキング第9位の Agnes AI が、テキスト・画像・動画の3つのコアモデル API を無期限で無料開放すると発表。開発者はコストゼロでオールモーダル能力を呼び出せる

Agnes AI のオールモーダル API が無料開放:テキスト+画像+動画をワンストップで呼び出せる

Agent の開発、ワークフローの設計、ショート動画の制作で、テキスト・画像・動画のモデルを同時に呼び出す必要があるなら、Agnes AI がたった今、断りがたい提案をしてくれました。3つのコアモデル API を無期限で無料開放するのです。

これは、Token 消費のために細かくやり繰りする必要がもうなくなり、複数のプラットフォーム間を行き来する必要もなくなったことを意味します。1つの API 体系で、テキスト生成・画像編集・動画生成の3つの能力をカバーします。

Agnes AI とは

Agnes AI はグローバル AI Lab ランキング第9位に位置するラボで、PinchBench、Claw-Eval、Artificial Analysis などの国際評価体系で継続的にランクインしています。コアの製品ラインは3つのモデルで構成されます。

  • Agnes-2.0-Flash:テキストモデル。1M のコンテキストウィンドウとツール呼び出しをサポート
  • Agnes-Image-2.0-Flash:画像モデル。画像から画像への変換、複数画像の融合、部分編集、テキスト修正をサポート
  • Agnes-Video-V2.0:動画モデル。音画同期生成、最初のフレーム/最初と最後のフレームからの動画生成をサポート

2026年6月1日より、上記3つのモデル API は世界中の開発者向けに無期限で無料開放されています。

3つのモデルがテキスト・画像・動画の3大モダリティをカバーする統一 API 体系

テキストモデル:1M コンテキストのコード生成能力

Agnes-2.0-Flash はコード開発、企業ナレッジベース、スマートカスタマーサポート、ドキュメント処理、Agent ワークフローなどのシーンをサポートします。実測では、いくつか印象的なタスクをこなせました。

シーン1:ウェブゲーム生成。1つの Prompt だけで完全なシューティングゲームを生成できます。戦闘機、雑魚敵、Boss 戦、スコアシステム、ライフ、コンボ表示、パーティクル爆発、動く星空背景まで含みます。

シーン2:プロダクトプロトタイプの構築。1つのプロンプトだけで MBTI 性格診断サイトを生成できます。完全なテストフロー、結果計算ロジック、性格タイプの表示ページを含みます。

シーン3:フロントエンド UI 生成。複雑な Prompt で要件を記述すると、モデルはプロダクト要件、UI 構造、インタラクションロジック、ビジュアルスタイルを、実行可能な1つの HTML ファイルに統合します。

# サンプル Prompt:地図アプリの生成
Amap(高徳地図)タイプの地図アプリを構築してください。起点は北京市東城区とします。
地図は拡大縮小ができ、目的地と出発地を入力でき、モバイル縦画面のアプリUIとします。
地図アプリのUIデザイン、シンプルな画面、階層的なUIレイアウト、角丸レイアウト...

Agnes-2.0-Flash が生成した地図アプリのUI

複雑な Prompt に基づいて Agnes-2.0-Flash が生成した地図アプリのインタラクションモック

画像モデル:編集できることが最大のセールスポイント

Agnes-Image-2.0-Flash の最大の特徴は画像を生成することではなく、画像を編集することです。画像から画像への変換、複数画像の融合、背景の置き換え、部分編集、テキスト修正、スタイル変換をサポートします。

ポートレートの高精度リタッチ:人物のスタイリングを大きく変更しても、顔の一貫性は安定して保たれます。肌の質感、光と影の階調、レンズの質感はいずれも商業撮影の水準に近いです。

ポートレート編集の効果

人物のスタイリングを大きく変更しても顔の一貫性は安定

EC向けポスター:製品の実写写真を1枚アップロードすると、モデルは製品のセールスポイントコピー、視覚的な装飾要素、EC風のレイアウトを含む完全なポスターを自動生成します。

インフォグラフィック:ニーズに応じてフローチャートや知識解説図を生成できます。さらに、海洋生物の特徴に基づいて建築コンセプトデザインのインフォグラフィックを生成し、版面構成を自動で整理することも可能です。

インフォグラフィックの自動生成。フロー構造、アイコン、視覚的ガイド記号を含む

動画モデル:音画同期生成

Agnes-Video-V2.0 は音画同期生成をサポートしており、これが大多数の動画モデルとの違いを生むキー能力です。出力解像度は 720P または 1080P から選べます。

音楽演奏シーン:画面内のドラマーの演奏動作がドラムのタイミングと同期し続け、バンドの画面ではボーカル、ギタリスト、ドラマーの3人の動作が対応する音とほぼ一致します。

映画的な質感のシーン:人物の口の動きがセリフと対応し、表情や感情の変化が会話内容に合わせて調整され、画面全体が実写撮影に近い効果になります。

人物の演技シーン:視線、呼吸、顔の細部で感情を伝え、階層感の豊かな演技を表現し、映像作品の演技方法に近いものです。

使い始めるには

  1. Agnes AI の開発者プラットフォームにアクセスしてアカウントを登録
  2. API キーを取得(無料、無期限)
  3. ニーズに応じて対応するモデルのインターフェースを呼び出す:
    • テキスト生成:Agnes-2.0-Flash を呼び出す
    • 画像編集:Agnes-Image-2.0-Flash を呼び出す
    • 動画生成:Agnes-Video-V2.0 を呼び出す

3つのモデルの API インターフェースのスタイルは統一されており、同じプロジェクト内での混在呼び出しをサポートし、完全なマルチモーダルワークフローを構築できます。

誰に向いているか

  • 個人開発者:コストゼロでプロダクトプロトタイプを検証し、テキスト・画像・動画の能力を含むアプリを素早く構築
  • EC運営:画像モデルで製品画像を一括処理し、ECポスターを生成
  • ショート動画チーム:動画モデルで素材と絵コンテのテストを素早く生成
  • Agent 開発者:同じモデル体系の中でオールモーダル能力を呼び出し、Agent ワークフローを構築

同種製品との比較

能力Agnes AI競合ソリューション
テキスト+画像+動画 API統一体系、1つの API通常は2〜3のプラットフォームとの連携が必要
価格無期限で無料Token 課金で、月コストは数百から数千
画像編集能力画像変換・部分編集をネイティブサポート多くはテキストからの画像生成のみ
動画の音画同期ネイティブサポート多くはアフレコの後処理が必要
コンテキストウィンドウ1M tokens通常 128K-256K

Agnes AI の無料戦略は能力が弱いからではなく、1つのトレンドに賭けているからです。API 呼び出しコストがゼロになれば、開発者の試行錯誤の余地は大幅に解放され、アプリのエコシステムは加速的に拡大する、と。予算が限られた中小チームと個人開発者にとって、この賭けは注目に値します。