過去のバトル · 2025-01-11 UTC
AI Agent Development Frameworks 対決 — 2025年1月11日
AI Agent Development Frameworksカテゴリーから。 10名の参戦者に38票が投じられました。 Mastraが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


マスタラは、AI を活用したアプリケーションおよびエージェントを構築するためのオープンソースのTypeScript フレームワークです。開発者がアイデアから実装にたどる道筋を示唆するツールセットを提供します。エージェント、ワークフロー、メモリー、ワークスペース、オブザビリティなどが含まれます。マスタラは、さまざまなフロントエンドおよびバックエンドフレームワークと統合し、スタンドアロンサーバとしてデプロイできるようになっています。開発者が、内部 automation エージェント、顧客向けエージェントなどの幅広い機能を構築できるようにします。マスタラには、ビルトインオブザビリティ、繰り返しチェック、キャッシュ可能なリザンバルストリームなど、機能が含まれています。マスタラは、高速スケーリングのスタートアップと全球規模の企業を支援するように設計されています。 マスタの基盤は、エージェントに基づいており、インストラクション、モデル、ツール、実行時の振る舞いで定義することができます。 エージェントはユーザーとの相互作用、タスクの完了、および製品フローの受け渡しを行うことができます。 フレームワークには、イベントのための内在化されたイベント システム、Redis Streams および Google Cloud Pub/Sub のイベントの公開とサブスクリーンに使用するメカニズムも含まれます。 Mastraには豊富なリソースのエコシステムがあります。その中には本、ブログ、ガイドなどがあります。Mastraには、大きなユーザーコミュニティがあり、その採用状況は幅広い業界で見られます。
評価基準の詳細
- エージェント
- ワークフロー
- メモリ
- ワークスペース
- モニタリング
- 組み込みイベントシステム

AI Legionsは、自動制御AIエージェントを生成してタスクを実行するオープンソースプラットフォームです。 GPT-3.5-turboやGPT-4などのlarge language modelを使用して、エージェントを統合して複雑な目標を達成できます。プラットフォームは、設定および管理のためのフレームワークを提供しており、これには構成ファイル、API、およびワークフローが含まれます。 AI Legionsは、ユーザーが独自のモデルの作成、統合、機能の追加を可能にするように設計されており、機能性を追加するために拡張できるようにします。 自律制御のAIシステムの研究、開発、展開など、様々な用途に適したプラットフォームです。 AI Legion環境の設定には、Node.jsとOpenAI API キーのインストールが必要です。エージェントはコンソール経由で立ち上げられることができ、状態管理の機能も提供されており、イベントログの削除やエージェントのカスタム設定付きでの再起動が可能です。 AI Legionは力強いツールで、独立性のあるAIシステムを構築・展開するのに役立ちます。またオープンソースの性質により、幅広いユーザーにアクセス可能ですが、しかし設定および使用においては相当の技術的専門知識と設定の努力が必要です。 AI Legionのひとつの重要なメリットは、機械学習と知能図表技法を組み合わせることで、エージェントが時間とともに学び、適応する能力を持つことを可能にする事です。これはエージェントが環境と対話しながら、パフォーマンスと判断能力が向上することを意味します。 AI Legionではまた、以下の課題や制限があります。大量の設定管理の手間、エージェントのエラーおよびループのリスク、高いトークンカウントおよびAPIの使用コスト、および偏りもしくは正確さに関する懸念です。さらに、大規模言語モデルを使用することで、偏りや精度の問題が生じる可能性があります。 この特定の機能として、AI Legionではウェブ検索、アプリケーション特化の検索エンジン、APIへの対応、エージェントの状態を管理する機能、カスタム設定を利用したエージェントのリスタートなどが提供されています。プラットフォームは高く汎用性があり、ユーザーは独自のモデル、動作、機能を作成して統合することができます。 AI Legion の潜在的な用途には、自己組織化する AI システムの研究開発、AI が実行するワークフローのおよびプロセスの展開、およびカスタム AI アプリケーションの開発が含まれます。 全体的に、AI Legionは、自律的なAIシステムを構築および展開するための強力な拡張可能なプラットフォームですが、有効に使用するには、重大な技術専門知識と設定の努力が必要です。
評価基準の詳細
- ウェブ検索
- カスタム検索エンジン
- APIおよびウェブフックの統合
- エージェント状態管理
- カスタムモデルおよびアクションの作成
- ノウハウグラフおよび機械学習機能


AutoML-Agentは、機械学習のフルライフサイクルを担当するために、合成される大規模言語モデルエージェントを用いたオープンソースフレームワークです。単一のモデルまたはスクリプトに依存するのではなく、データの理解、前処理、モデル選択、トレーニング、評価などのタスクを、共通目標に向けて協力する専門のエージェントに委任するのです。 研究者や開発者が拡張されたパイプラインコードを書かなくても実験を自動化したいという場合は、この枠組みを用います。データセットや目的を自然言語で記述すると、ユーザーはエージェントが候補解決策を提案・構築・繰り返し、プロセス中の結果や推論結果を表面化させることができます。 オープンソースなため、AutoML-Agentには独自のエージェント、ツール、またはモデルのバックエンドをカスタマイズできるため、AutoMLシステムとして利用しやすく、またマルチエージェントワークフローの研究環境としても活用できる。
評価基準の詳細
- マルチエージェントLLMのオーケストレーション
- 自動データ前処理および特徴ハンドリング
- モデルの選択およびハイパーパラメーターの検索
- トレーニングおよび評価パイプラインの生成
- 自然言語タスクの指定
- カスタマイズ可能なアーキテクチャの拡張


Cerebrumは、AIOS(AIエージェントオペレーティングシステム)フレームワーク内でのLLMベースのAIエージェントの開発・展開に目的のSDKです。AIOSは、スケジューリング、コンテキスト スイッチング、メモリ管理、ツール管理など、LLMベースのエージェントに対する課題に対処する。Cerebrum SDKでは、エージェントアプリケーションを作成して実行することができるキーコンソールとUIインターフェースを提供し、両方のWeb UIとコンソール インターフェースをサポートしています。このSDKには、リストアップロードされたLLMs、エージェントとツールをダウンロードおよび実行する機能など機能が含まれています。また、エージェントとツールを管理します。Cerebrumはエージェントユーザーと開発者向け設計されており、彼らがAIエージェントアプリケーションを作成し展開することを目指しています。
評価基準の詳細
- エージェントの開発と展開
- LLMベースのAIエージェントの管理
- Web UIとコンソール UIのサポート
- エージェントとツールの管理
- 利用可能なLLMs、エージェント、ツールをリスト表示
- エージェントとツールをダウンロードおよびアップロード

Gemma 3は、主に1台のGPUの演算能力を最大限に引き出せるように最適化された、デバイスを対象とした軽量のオープンなモデルとしてのコレクションです。マルチモーダル入力に対応し、140以上の言語がサポートされている。モデルは様々なサイズ(1B、4B、12B、27B)が用意されており、開発者のハードウェアとパフォーマンスのニーズに合わせた最適なサイズを選択できる。Gemma 3では高度なテキストとビジュアル推論機能、そして128kトークンのコンテキスト窓を提供し、複雑なタスクに対して関数呼び出しをサポートします。また、より高速なパフォーマンスと計算要求の削減のために量化版も提供されています。これは、同社の「ジェミニ2.0モデル」に利用されている同様の研究とテクノロジーを基にしており、Googleが役立つAI技術を普及させるというコミットメントの一環です。Gemma 3は、スマホ、ラップトップ、ワークステーションなどのデバイスで直接動作できるAIアプリケーションを作成できるように設計されています。 Gemma 3は、他のモデル (LLMのLlama3-405B, DeepSeek-V3, o3-mini など) と比較した、初期の人間の好み評価で高いパフォーマンスを達成している。36を超える言語に対して、出-of-the-boxで全球的な展開に対応し、140を超える言語に対して事前統合でのサポートが可能である。モデルは機能コールと組み込まれた出力により、構造化されたAI-ドライブのワークフローを可能にする。 "Gemma 3 の開発には厳格な安全プロトコルが採用されました。その内容は、広範囲にわたるデータ管理の実施や、安全ポリシーの調整を含むフィンテューニングなどの安全性を向上させる措置、そして堅固なベンチマーク評価の実施などとなります。" "Gemma 3"ファミリーのオープンモデルは、大きな採用と共に急速に拡大しています。100万人を超えるダウンロード数と、60,000を超える「Gemma"をベースとしたユーザー独自のモデルが生み出されていて、その活気あるコミュニティの存在は、これらユーザー独自のモデルの成長に大きく貢献しています。 Gemma 3には、単一のGPUまたはTPUホストでエンゲージングなユーザー エクスペリエンスを開発することができる開発者向けに適切な機能が実装されています。
評価基準の詳細
- マルチモーダルAIサポート
- 責任のある開発のフコスト
- 拡張的なファインチューニング
- 140以上の言語のサポート
- パフォーマンスの改善

MiniMax‑M1
オープンソースの large-scale 理学モデル、1,000万トークンコンテキスト、そして Mixture-of-Experts アーキテクチャのハイドブリッド

MiniMax-M1はオープンウェイトの、大規模ハイブリッド注意力推論モデルです。ハイブリッドMixture-of-Experts (MoE) architectureと軽速Attention機構を組み合わせて、試験時間のコンピューティングを効率的に拡大できるようにしている。モデルは1,000万トークンのコンテキスト長をネイティブにサポートし、大規模な強化学習(RL)で多様な問題を使用してトレーニングされている。 MiniMax-M1は複雑なソフトウェア工学、ツールユーザー、長いコンテキストタスクなどを対処する際に、他の強いオープンウェイトモデルを上回るパフォーマンスを実現する。 標準ベンチマークにおける実験結果は、MiniMax-M1が数学、プログラミング、ソフトウェアエンジニアリング、役割的なツールを使う、長文コンテキスト推論などのカテゴリタスクにおいて他のモデルを上回していることを示しています。 このモデルは、長い入力の処理や広範囲の考えが必要な複雑なタスクにぴったりに向いています。 MiniMax-M1は、次世代の言語モデルエージェントが現実世界の課題を解決するには、論理的思考と対処に強固な基盤を提供します。 リーディングの商用とオープンウェイトのモデルをまたもとのカテゴリタスクで比較したベンチマークパフォーマンスはそのモデルがどのくらいのパフォーマンスを発揮しているかを示している。 MiniMax-M1の技術報告では、モデルアーキテクチャ、トレーニングプロトコル、評価結果について詳しく説明しています。
評価基準の詳細
- ハイブリッド Mixture-of-Experts (MoE) アーキテクチャ
- ライトニング注意力メカニズム
- 制約付き学習(RL) スケーリングフレームワーク
- コンテキストの長さが1,000万トークン
- テスト時計算の効率的スケーラビリティ


ScreenAgentは、VLM(ビジュアル言語モデル)エージェントを提供します。マウスとキーボード操作でコンピュータGUIを操作します。バックグラウンドでスクリーンショットを観察し、その上でアクションを実行します。このプロジェクトには、マルチステップタスクを完了するための計画・実行・反省プロセスが含まれています。このエージェントを使うのは、タスクを教えるのは困難であるためです。エージェントはタスクの計画、画像理解、大域的な視覚的な位置関係などを持つ必要があります。ScreenAgentデータセットは、さまざまなデイリーコンピュータタスクをカバーすることができ、エージェントの学習をサポートしています。このプロジェクトには、デスクトップを制御するクライアント、データセット、マイナーリファレンスエンジンおよびトレーニングコードがあります。また、さまざまなデスクトップOSとアプリケーションに対応しています。これは、APIに依存せず、多目的であり、APIに依存せず、さまざまなOSおよびアプリケーションに使えるという ScreenAgent のアプローチは、一般性が高くなります。
評価基準の詳細
- マウス/キーボード操作の実行
- タスクの完了をガイドする計画-実行-反省プロセス
- さまざまなデスクトップOSおよびアプリケーションに対するサポート
- さまざまなタスクカバーを実現するための手動で注釈したScreenAgentデータセット
- GUI間互いにVLMエージェントによるインタラクション


BabyAGIは、自律的なエージェントを構築するための実験的なフレームワークです。2023年3月に公開された元のBabyAGIから派生し、タスクをプランニングする機能を導入しました。このフレームワークは、新しいデータベース内に保存、管理、実行機能を提供する「関数z」という名の新しい関数枠で構築されており、関数間の依存関係、認証シークレットをトラッキングするグラフ構造、および自動ロード機能、汎用的なログ機能などを搭載しています。また、機能の管理、更新の実行、ログの表示を管理するためのダッシュボードも付属しています。開発者の間で議論を呼び起こすために、複雑なタスクを解決しやすくしたシンプルなものを作ることに主眼を置いており、自律エージェントの開発の面白いアプローチを提示しています。
評価基準の詳細
- 関数登録とメタデータ管理
- 依存関係のトラッキングとキー依存関係
- 自動ロード機能とログ
- 機能の管理やログを表示するためのダッシュボード

"MCP-Use"はオープンソースのプラットフォームで、Large Language Models (LLMs)の接続に役立つMCPサーバーと、LLMsと連携できるカスタムAIエージェントの開発をサポートしています。このプラットフォームは、ChatGPTアプリをはじめ、Claudeコネクター、MCPサーバーなどを構築するためのフルスタックのMCPフレームワーク(mcp-use SDK)を提供しています。 MCP-Useを利用して、開発者は既存のユーザーとエージェントのいる複数のプラットフォームに対して、同じコードベースを使用してアプリケーションを展開できます。 ChatGPT、Claude、Geminiなど、そのようなプラットフォームに展開できます。プラットフォームは、MCPアプリケーションを1つのコマンドでサボルダリングする能力、製造クラウドへの自動展開、組み込み式の分析と監視など、さまざまなツールと機能を提供します。 開発者はmcp-use SDKを使用して、特に追加のツールを必要とせずに、MCPサーバーとアプリケーションを構築して展開できます。プラットフォームは、ライブLLMが必要なくアプリケーションをテストできる VISUAL INSPECTORとSANDBOX テスト機能を提供します。 MCP-UseはMCPベースのアプリケーションの開発と展開を簡素化することを目指しており、カスタムAIエージェントとアプリケーションを作成して展開する開発者にとって魅力的であるというオプションとなります。
評価基準の詳細
- MCPサーバーメンテナンス
- LLM接続と統合
- カスタムAIエージェント開発
- 自動展開とスケーラビリティ
- ビジュアルインスペクターとサンドボックステスト
- 組み込みアナリティクスと監視可能性

コミュニケーションAIプラットフォームであるRasaは、データ、モデル、および展開におけるフルコントロールを持つ開発者がコンテキストを考慮したチャットやボイス アシスタントを作るのに役立ちます。オープンソースのコアは自然言語理解と対話管理を処理し、Rasa Proでは企業向けの機能を追加して、分析、セキュリティコントロール、_scalable infrastructure_が利用できるようになります。 Rasa Studioでは、設計者やコラボレーターと会話チームが、記述コードなしで訓練データ、フロー、およびテストを作成し、それを一緒に管理する低コストインターフェイスが提供されます。ツール群は、メッシングチャンネルやIVRシステム、カスタムアプリケーションなど、さまざまなチャネルを通じてアシスタントをサポートするハイブリッドチームをサポートします。 大企業によって、銀行、テレコム、医療、政府などでオンパレードデプロイ、適合性、カスタマイズが必要な場所で広く使用されています。
評価基準の詳細
- 自然言語理解エンジン
- カスタムアクションによる会話管理
- Rasa Studioの低コストインターフェース
- ボイスおよびマルチ チャンネル統合
- 会話 アナリティクスおよびテスト ツール
- 企業向けセキュリティおよびデプロイ コントロール













