過去のバトル · 2024-06-18 UTC
Agent Development 対決 — 2024年6月18日
Agent Developmentカテゴリーから。 9名の参戦者に33票が投じられました。 Gretel AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

デベロッパー向けプラットフォームである Gretel AI は、機密情報が露呈されない限り、実データセットと同様の統計的特性を持つ仮装データを作成するためのツールです。チームでは、プライバシー、合規性、利用可能性の制約により、実データへのアクセスが制限されている場合のAIおよびアナリティクスプロジェクトをブロックするのを防ぐために、Gretel AI を使用します。 プラットフォームでは、テーブルの、テキストの、タイム・シリアスのデータの生成用に、API、SDK、プリ・ビルド・モデルが提供されている。また、品質評価、プライバシリスク評価を行うツールも用意されている。機械学習モデルのトレーニング、代表されていないクラスの強化、チーム間でのデータ共有、ソフトウェアのテストにおけるロジカルなアーティファクト生成に用いてもらえる一般的な使い方がサポートされている。
評価基準の詳細
- 合成するためのタブラー、テキスト、およびタイムシリーズデータ用の生成モデル
- Differential 秘密保護とPII (Personally Identifiable Information) の redaction コントロール
- 品質、正確性、およびプライバシーリスクのスコア付けレポート
- Python SDKおよびREST API統合
- 前トレーニングモデルおよびカスタム テンプレート
- クラウドおよび自社ホストの展開可能なオプション

Letta AI は、オープンソース プラットフォームで作成できる、長期認識能力を備えた状態の AI エージェントを目的としたものです。このようなエージェントは、過去の相互作用を記憶し、複雑で文脈的によほど意思決定プロセスを実現します。 これは、エージェントが経験から時間をかけて学び、対応する応答を適応させる必要があるアプリケーションには特に便利である。 Letta AI は、客層サービスから、より複雑な問題解決タスクに至るまで、さまざまでいる開発者や研究者を対象としている。 長期記憶と高度な推論能力を提供することで、Letta AI は、より高度の自律性と知性を持つエージェントを構築しうるように助け、幅広いタスクに対処することができる。
評価基準の詳細
- 状態エージェント
- 長期記憶
- 高度な推論方法

Stagehandは、開発者がウェブのナビゲーション、インタラクション、情報抽出を可能にするウェブブラウジングフレームワークです。Playwright-styleコードの決定論的部分と自然言語による指示を組み合わせ、チームが必要な時に出細分化された制御や、詳細を省略した高レベルの抽象化を容易に行うことができます。 このフレームワークは、ページの観察、要素に対する行動、構造化されたデータの抽出など、特定のアクションに焦点を当てた、予測可能で小さなAPIによって構成されています。拡張性のあるアーキテクチャは、カスタムのモデル、キャッシュ、ブロードなエージェントスタックへの統合をサポートしており、これはクイックなスクレイピングスクリプトから、エンタープライズ向けブラウジングワークフローまでに対応可能なように考慮されています。
評価基準の詳細
- 自然言語アクション、アウト、エクストラクトメソッド
- スキーマと共に構造化されたデータ抽出
- 低レベルコントロールを提供するPlaywright互換性
- 複数のLLMサービスのサポート
- 繰り返しブラウザアクションのキャッシュ
- エージェントフレームワークと組み合わせることができる
NetX は、ブロックチェーンと人工知能技術を統合したモジュラーな経済ネットワークです。其のアーキテクチャは、開発者や組織が分散取引、データ交換、人工知能が駆動するサービスなど、さまざまなデジタル経済用途をサポートできるように、分散取引用コモーネント、データ交換用コモーネント、人工知能使用サービスなど、統合フレームワーク内でプラグインできるように設計されています。 プラットフォームでは、伝統的なブロックチェーン機能をマシンラーニングワークフローより橋接して、トークン化されたインセンティブ、スマートコントラクトの自動化、AIを活用した分析の運用をエコシステム内で実現することを目指している。これにより、Web3アプリケーションを構築するチームが、知能化された処理やデータドライブの決策作業を要するというニーズに応える適切なプラットフォームとなる。 モジュラの重要性を重視することで、NetXは開発者にスタックの構築における柔軟性を提供し、適合するブロックチェーン、AI、経済プリミティブを選択できるようにして、プロジェクトのニーズに応じて組み立てることができることを目的としています。
評価基準の詳細
- モジュラーなネットワークコンポーネント
- ブロックチェーン統合レイヤー
- AIサービス互換性
- スマートコントラクトサポート
- トークニーエコノミープリミティブ
- 開発者に特化したツール


Snorkel Flowは、ラベル付け関数を使用してマニュアル注釈に頼ることなく、データのラベリング、キュレーション、調整を迅速に行うことで、プログラマティック データ開発のエンタープライズ プラットフォームです。 ドメインの専門知識を再利用可能なヒューリスティックとして固有化すると、生データから生産可能なAIモデルの開発までのパスを加速します。 プラットフォームは、Weak supervision、モデルトレーニング、エラーアナリティスのワークフローを統合しています。データサイエンティストと専門家のコラボレーションを伴う、データセットとモデルの改善プロセスをサポートしています。ドキュメント分類、情報抽出、企業アプリケーション向けにファンデーションモデルをフィネットゥーニングするなど、多くの用途をサポートしています。
評価基準の詳細
- プログラマティック ラベリングでラベリング機能を活用
- 弱い監督とラベル アグリゲーション
- 組み込みモデルトレーニングおよび評価
- エラーアナリティスおよびデータ スライシングツール
- ファウンドेशन モデルのフィンバックサップ スタートラップ
- エキスパートおよびデータサイエンスの共同作業ツール


AutoGenは、Microsoft Researchによって開発されたオープンソースのプログラミングフレームワークです。これは、複雑なワークフローを完了するために会話、推論、ツールの呼び出し、コードの実行、相互作用などを行うのに役立てることができる、複数のLLMを活用したエージェントを開発者が定義できるようにしています。 このフレームワークは、柔軟な会話パターンをサポートし、カスタマイズ可能なエージェントロールと、人間の入力と外部API、コード実行環境との統合を実現する。 一般的に、リサーチ アシスタントをプロトタイプ化する、自動化されたコーディング ワークフロー、データ アナリシス パイプライン、タスク志向のエージェント システムなど、さまざまな用途に使われている。 AutoGenは活発なコミュニティの開発、ドキュメント化、エクサンプルとの共存という形でPythonライブラリとして配布されており、複数エージェントアプリケーションの実験と展開に役立つ実用的な基盤となっています。
評価基準の詳細
- マルチエージェント会話のオーケストレーション
- カスタマイズ可能なエージェントロールとパーソナ
- コードの実行とツールの呼び出し
- 人間が入力を提供できる
- 主な LLM プロバイダーと互換性あり
- Python API を拡張


LangChain エージェントは、言語モデルの判断、決定、外部ツールとの相互作用ができるアプリケーションを開発するのに役立つ広範な LangChain フレームワークの一部です。エージェントは、LLMを推論エンジンとして使用して、どのアクションをとったらよいのか、どの順序でとったらよいのか、結果を使って次のステップにどのように影響させることができるのかを判断します。 フレームワークは、質問の連鎖、データ ソースの統合、メモリーの管理、およびAPI、データベース、検索ツールとの接続に適合したモジュラーのコンポーネントを提供します。なぜか、それはチャットボット、調査助手、ワークフロー自動化、および他のダイナミックなLLMドライブシステムの構築に適したものです。 LangChainにより、複数のモデルプロバイダーと言語 (PythonとJavaScript/TypeScript) がサポートされるため、デプロイメントのいずれにおいても、柔軟な基礎としてプロトotypingやproduction deployment に使うことができる。
評価基準の詳細
- LLMを利用したエージェントの作成
- プロンプトとチェーンの組成
- メモリと状態の管理
- ベクター ストアやAPIへの統合のサポート
- 複数のLLMプロバイダーのサポート
- ストリーミングと非同期エクゼキューションのサポート


LangGraph StudioはLangGraph枠組みの上で、エンジニアがエージェント系のアプリケーションを構築するための高度に特化した開発環境です。VISUALINTERFACEを通じてグラフの構造を検証・実行パスの追跡を行い、エージェントがノード、ツール、ステート間をどう動かしているかを理解できます。 LangGraph スタジオでは、ステートの編集や中間ステップからの再生、実行中のエージェントとのリアルタイムの相互作用など、インタラクティブなデバッグ機能も提供しています。これにより、複数ステップの LLM ワークフローでよく発生するループ、ツールコールのエラー、予期せずブランチングの不正行為の診断が簡素化されます。 LangGraph Studio とLangSmith を統合することで、チームは複雑なエージェントシステムを開発、テスト、ロールアウト前の反省活動や観察性を統合された方法で行うことができます。
評価基準の詳細
- インタラクティブなグラフ視覚化
- ラン、再生、フォークするエージェントの実行
- ステートの檢視、マニュアル編集
- アジェントのテストのためのライブチャットインターフェース
- LangSmithのトレース統合
- ローカル、ホスティングデプロイのいずれかのオプション


Zep AI Memoryは、会話やセッションをまたがってパーソニティスト、分散された構造化された思い出すエージェントを作成する開発者向けのメモリサービスです。 チャット履歴をキャプチャし、重要な事実を抽出して知識グラフに入力します。エージェントは、要件に応じて適切なコンテキストを検索するために、プロンプトに完全な履歴を詰め込まなくても、必要な情報にアクセスできます。 プラットフォームは、シンプルな API によってサマリーゼーション、エンティティエクストラクション、-semantiscサーチを一体化しており、 チームはカスタムリテリーバイナリ構築の必要なしに、カオスボット、コパイロット、自動エージェントに州を持ったメモリを追加できる。 また、生産ワークロードにスケーラブルで、プロンプトサイズとトークンコストは予測可能である。 Zep は、LangChain など一般的な LLM フレームワークと統合し、人気の言語向けの SDK を提供し、既存のエージェントスタックに簡単に入れ替えることができ、LLM などのフレームワークに慣れている開発者にとっても便利です。
評価基準の詳細
- 長期会話記憶
- 自動的事実とエンティティの抽出
- 知識グラフのストレージ
- 意味的とハイブリッドの検索
- LangChainやLlamaIndexとの統合
- マルチ言語のSDK












