過去のバトル · 2025-12-12 UTC
Agent Development 対決 — 2025年12月12日
Agent Developmentカテゴリーから。 9名の参戦者に39票が投じられました。 Flowwise AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


Flowwise AI はオープンソースの低コストコードプラットフォームです。開発者とチームは、LLM (Language Model) を利用したアプリケーションを、視覚的ノードベースインターフェースを通じて設計できます。大量のボイラープレートを記述するのではなく、ユーザーはモデル、プロンプト、メモリ、ベクトルストア、ツールといったコンポーネントをキャンバス上で接続して、チャットボット、エージェント、リトリーバー パイプラインのアセンブリを組み立てます。 フレーミングソリューションのFlowwiseは、LangChainやLlamaIndexなどの人気のフレームワークを基幹に構築されており、LLM プロバイダー、埋め込み、データソースを幅広くサポートしています。 完成したフローはAPIまたは埋め込みウィジェットとして展開できるため、内部ツールのプロトタイピングに適しており、製品機能の配送にも実用的に使用できます。 プロジェクトは自主ホスト用に設計されており、コミュニティ駆動であるため、それらのチームを引き付けている。Teamsは、Flexibility、透明性、、 AI stack への制御を、独自サービスに固定されていてはならないことなく取得したい。
評価基準の詳細
- ノードベースの視覚化されたエディターによるLLMワークフロー
- LangChainとLlamaIndexコンポーネントのサポート
- 組み込まれたエージェント、メモリ、およびツール統合
- ベクトルデータベースと埋め込み用のコネクタ
- APIエンドポイントとチャットウィジェットの実装
- カスタム認証とマルチモデルサポート

Pdf Redaction
AIパワーで使用されるドキュメントの削除ツール 機密情報の除去を簡素化した、PDFファイルから機密情報の削除に使用されるAIアシストツールです。 このツールは機械学習を組み込み従来のドキュメントの削除のフローで、長くて時間がかかるドキュメントのチェック作業を自動化します。 また、法廷、医療機関・政府などの機密事項を取り扱う機関を対象としています。

Pdf Redactionは、ユーザーにPDFファイルから個人情報や機密情報を特定して、永久に削除できるようにAIを助けているツールです。PDFファイルからプライベートなコンテンツや金融情報を自動検出して、外部にドキュメントを共有する前にハッシングする必要がある情報やその他の機密情報を検出して、ドキュメントを自動で除去します。 機械学習と従来の削除作業フローを組み合わせることで、長い文書のレビューにおける人間の手作業を減らすことを目的としたツールは、法律専門家、医療機関、政府機関、および定期的に機密情報を取り扱うビジネスに適しています。 ユーザーはPDFをアップロードし、AIを使用して機密情報を検索、提案された抹消を確認、抹消した後の方程式を配布するために準備した文書をエクスポートできます。
評価基準の詳細
- Aiを活用した機密情報の検知
- テキストやコンテンツの完全削除
- パDFファイルのバッチ処理
- レビューと承認フロー
- 個人情報と財務情報のパターンに対応
- 機密情報を安全に扱う


「IsMyStoreReady」は、ShopifyやWooCommerceを使用している店舗オーナー向けの自動チェックツールです。このツールを使用すると、店舗のパブリックページのスキャンを実行するだけで、コンバージョンやSEO、信頼性、来店読みのために障壁となる一般的な問題を表面化させることができます。 このツールは、製品ページの質、ショップのポリシー、パフォーマンスのシグナル、およびトラスト要素を網羅する構造化されたレポートを生成します。このため、ファウンダーと小規模なECのチームは、コンサルタントを雇うか、複数の別個のアウッドを実行する必要なく、明確で優先順位付けされた開始点を持ちます。 ソロ販売者、ドロップシッパー、DTCブランドを含む成長途上の個人・企業は、広告投射やマーケティング予算を拡大する前に、即時の意見を得たい場合があります。
評価基準の詳細
- 一クリックの店舗診断
- Shopify と WooCommerce のサポート
- 売上と信頼チェック
- SEO とパフォーマンス サインール レビュー
- 優先順位付けて問題レポート
- 実行可能な改善の提案


LangChain エージェントは、言語モデルの判断、決定、外部ツールとの相互作用ができるアプリケーションを開発するのに役立つ広範な LangChain フレームワークの一部です。エージェントは、LLMを推論エンジンとして使用して、どのアクションをとったらよいのか、どの順序でとったらよいのか、結果を使って次のステップにどのように影響させることができるのかを判断します。 フレームワークは、質問の連鎖、データ ソースの統合、メモリーの管理、およびAPI、データベース、検索ツールとの接続に適合したモジュラーのコンポーネントを提供します。なぜか、それはチャットボット、調査助手、ワークフロー自動化、および他のダイナミックなLLMドライブシステムの構築に適したものです。 LangChainにより、複数のモデルプロバイダーと言語 (PythonとJavaScript/TypeScript) がサポートされるため、デプロイメントのいずれにおいても、柔軟な基礎としてプロトotypingやproduction deployment に使うことができる。
評価基準の詳細
- LLMを利用したエージェントの作成
- プロンプトとチェーンの組成
- メモリと状態の管理
- ベクター ストアやAPIへの統合のサポート
- 複数のLLMプロバイダーのサポート
- ストリーミングと非同期エクゼキューションのサポート

LangSmithは、LangChainチームによって作成された、大規模言語モデルを動かすアプリケーションを、追跡するため、テストするため、評価するため、監視するための開発者向けのプラットフォームです。 LangChainおよびLangGraphフレームワークと密接に統合できるようになっていますが、フレームワーク非依存(framework-agnostic)であり、SDKやAPIを通じて、LLMアプリケーションをインストルメント化できます。その核心的な目的は、LLMベースのシステムでは出力が非決定性であり、エラーは微妙で、開発者が、実行時にチェーン、エージェント、プロンプトが実際に何をしているかについて、可視性を提供することによって、潜在的な不確実性を対処することです。 プラットフォームの中心概念は、トレース(trace)です。各アプリケーションのランを実行すると、詳細で階層化されたトレースが表示されます。該当するエンティティには、送信されたprompts、modelの応答、トークン使用状況、レイテンシー、ツールのコール、各ノードの中間出力などが含まれます。これにより、複雑なマルチステップエージェントや、悪い答えの原因が数層奥にあるリテラル・オーガメンテッド・ジェネレーションパイプラインのデバッグが容易になります。開発者は、個々のトレースを検査するほか、ランをフィルタリングおよびテキスト検索できるため、各ノードでの正確な入力と出力を掘り下げることが可能です。 LangSmithも、アプリケーションの品質を測定する評価ツールを提供しています。チームは、プロダクション トレイス atau カレード エクサンプルからデータセットを作成し、評価ツールでそれらにアプリケーションを実行し、組み込まれた評価ツール、カスタム コードベース チェック、または LLM-アサイスアプローチを使用して出力のスコアを決定できます。この機能は、Prompt またはモデルが変更されたときにレギュレーション テストをサポートし、改善された結果ではなく結果が実際に改善されているかどうかを数値化するために利用できます。 業務用途の運用では、遅延、コスト、エラーレート、フィードバックなどを時間の経過とともに跟跡する監視ダッシュボード機能や、ユーザーのフィードバックおよびユーザー注釈を収集する機能を提供します。また、プッシュボタン式でプログラムを作成してモデルに入力をさせるプロンプト管理機能、試験室モードの機能もある。 LLM機能を実装する開発者やチームに向けられた、LangSmithは主にアドホックprint-statementデバッグから、統合された観察性と評価までを、システム的に進むことが目標です。 LangSmithの主な強みは、LangChainエコシステムとの深い統合と、追跡、データセット、評価の統一されたワークフローです。実際のところ、最も充実した体験は、LangChain/LangGraphの世界で熟練していることを前提としています。 また、LLMベースの評価自体は、注意深い設計が必要です。さらに、この製品はhostedの商用製品であり、使用ベースの価格設定になりますが、一定のプランでは自分でホストするオプションもあります。 その他、Langfuse、Halicone、Arize Phoenix、Weights & Biases Weave などと競合する、他のLLM観察性ツールが存在しています。
評価基準の詳細
- ランニングトレースにステップバイステップの入出力とトークン使用を実現
- データセットの生成と自動評価
- 組み込み、コードベース、LLM-エージェント評価器
- プロダクション監視ダッシュボード
- ヒューマンフィードバックと注釈の収集
- プロンプトマネージャー、バージョニング、プレイグラウンド

コバルは、声と会話モダリティをまたぐ会話型AIエージェントを構築するチーム向けのテストと評価プラットフォームです。これは、従来のユニットテストや手動のスポットチェックが、エージェントシステムの非決定性の複数ターン特性を捉えきれないこと、つまり実世界の動作を向上させないか悪化させないかを知ることが難しい、開発者にとって頻発する問題です。 プラットフォームの核となる概念はシミュレーションです。静的のテストケースに頼るのではなく、Covalはさまざまなシナリオおよび会話のパスを通じてエージェントをテストする模擬ユーザーインタラクションを生成します。 これらの模擬実行は、定義されたメトリックおよび期待値と照合されることで、チームはリリース変更前に信頼度を測定し、エージェントおよびプロンプトが進化するにつれてバグを発見できるようになります。 Covalはボイスとテキストのエージェント両方をサポートし、ボイスでは、ボイスからのテキスト変換、遅延、ターンテイキングなど、言語モデルにない追加のレイヤーがエージェントの品質に影響を与えることがあります。このcompanyは、無人車の開発チームがデプロイメント前に行動を検証するために大規模なシミュレーションを使用するのと同様のテスティング哲学をAIエージェントにも適用し、品質を高めているように思えます。 一般的なワークフローでは、チームはエージェントを接続し、シナリオと評価基準を定義し、シミュレーション を実行し、実行中の結果を確認して、時間の経過とともにパフォーマンスを追跡します。この機能は、開発時にも実行時にも、CI スタイルのプロセスに組み込まれる継続的な監視やリグレッションテストに活用できます。 Covalというツールは、カテゴリが進化した中で比較的若い製品のひとつで、価格、統合、および正確なメトリックカバー範囲などの詳細は直接確認することが有益です。チームはシナリオのシミュレーションが自社の生産トラフィックに合致するかどうか評価するべきで、それを考慮するために、一般的LSTM評価ツールとの大きな違いは、シングル・プロンプトのスコアリングを中心としてシナリオを評価するのではなく、Multiターン・Multiモードエージェントシミュレーションの重視にあります。
評価基準の詳細
- シミュレートされたユーザーの相互作用を使用してエージェントをテストする
- 実行後の評価指標とスコアの評価
- ボイスとテキストエージェントのサポート
- エージェントのバージョン間におけるバグの検出
- 会話のパスに関するシナリオに基づくテスト

Stagehandは、開発者がウェブのナビゲーション、インタラクション、情報抽出を可能にするウェブブラウジングフレームワークです。Playwright-styleコードの決定論的部分と自然言語による指示を組み合わせ、チームが必要な時に出細分化された制御や、詳細を省略した高レベルの抽象化を容易に行うことができます。 このフレームワークは、ページの観察、要素に対する行動、構造化されたデータの抽出など、特定のアクションに焦点を当てた、予測可能で小さなAPIによって構成されています。拡張性のあるアーキテクチャは、カスタムのモデル、キャッシュ、ブロードなエージェントスタックへの統合をサポートしており、これはクイックなスクレイピングスクリプトから、エンタープライズ向けブラウジングワークフローまでに対応可能なように考慮されています。
評価基準の詳細
- 自然言語アクション、アウト、エクストラクトメソッド
- スキーマと共に構造化されたデータ抽出
- 低レベルコントロールを提供するPlaywright互換性
- 複数のLLMサービスのサポート
- 繰り返しブラウザアクションのキャッシュ
- エージェントフレームワークと組み合わせることができる

Vertex AI Agent Builder
Google Cloudプラットフォームが、エンタープライズアプリケーションのための生成型AIエージェントを作成および展開する開発者を支援します。

Google CloudにおけるGemini Enterprise Agent Platformの一部として、Vertex AI Agent Builderは、エンタープライズ向けの生成型AIエージェントを開発、拡大統治、最適化するための総合プラットフォームです。これにより、技術チームはエンタープライズアプリケーションとワークフローを強力なエージェントシステムに変換することが可能になります。プラットフォームは、データとAIを統合した環境を提供し、 Geminiなどのツールを使用して、生成型AIアプリケーションを迅速に開発することができます。ユーザーは、機械学習モデルの訓練、テスト、調整を1つのプラットフォーム上で行うことができます。 エンタープライズ向けのエージェントを迅速に構築、拡大、統括、および最適化するために、ビジネスにオープンで包括的な環境を提供します。これは、企業データに根ざした企業向けエージェントを提供できます。また、API、SDK、その 他の開発者用ツールをサポートして、全ての層にわたるフンドメンタルを提供します。これにより、開発者はグローバルスケールでアプリケーションとワーカーフローを強力なエージェント系システムに変換できます。 主要な機能は、200を超えるGoogleおよび第三者提供のAIモデルとツールを選択できる機能、特定の用途におけるモデルをカスタマイズできる機能、および生成型AIモデルに対する客観的な評価のためにモデル評価サービスを活用できる機能が含まれています。また、エージェントパワー開発とワークフローに対するサポートが提供されており、GoogleのAntigravityなどのツールを利用してエージェントの管理とオーケストレーションを一元化できる機能が含まれています。 データサイエンティストやマイクロサービス・エンジニア向けに設計された、GeminiEnterpriseAgentプラットフォームはAIエンジニアのためのトレーニング、チューニング、展開、以及MLOpsで自動化、標準化、管理する機械学習(ML)モデルのプロジェクトを提供しており、これはチームの協力や開発ライフサイクルを改善するモジュラーツールの組み合わせとなります。 Vertex AI エージェント ビルダーは、 Gemini Enterprise エージェント パラドックス プラットフォーム内にあり、企業向けアプリケーション向けの高度な AI エージェントの作成および展開を可能にする。また、エージェントの開発、スケール、統治、最適化を 지원するツールや機能を提供しています。
評価基準の詳細
- エンタープライズ規模でエージェントを構築、スケール、統治、最適化するためのオープンで包括的な環境を提供
- 200件以上のGoogleとサードパーティのAIモデルとツールの選択肢
- モデルを特定の用途のためにカスタマイズする
- 生成型AIモデルに対する目標評価を行うためのモデル評価サービス
- Gemini トレナーの生成型AIアプリを迅速に開発
- Gemini エンタープライズアプリの安全な登録、管理、および統治

Botpressは、巨大言語モデルにPowered している会話型AIエージェントの開発プラットフォームです。Visual Flow Builder、SDK、人気のメッセージングチャンネルとの統合などを提供し、チームは自然な会話を展開するエージェントを設計、APIを呼び出す、複数ステップのタスクを実行できるようにすることができます。 "ローカodeskツールを組み合わせて低レベルのカスタマイズが可能なプラットフォームは、非技術的なユーザーや開発者が同一プロジェクトに協力できるように設計されています。機能として、ノウハウベース、分析、人間のアシストなどがあります。顧客サポート、リード発生、内部オートメーションのような生産用途での使用が適しています。 Botpressでは、試験や開発に適した無料プラン、および使用量によって料金が調整される有料プラン、さらに自主的なホスティングに適したオープンソースコミュニティエディションを提供します。
評価基準の詳細
- ドラッグ アンド ドロップで構成された会話 フローのエディタ
- LLMパワーのエージェントを使ったツール使用
- ドキュメントやURLから知識ベースのインポート
- マルチ チャンネル展開 (Web、WhatsApp、Slack、など)
- 分析と会話モニタリング
- 人間へのハンドオフとチームの共同作業












