過去のバトル · 2025-04-24 UTC
Agent Development 対決 — 2025年4月24日
Agent Developmentカテゴリーから。 7名の参戦者に32票が投じられました。 DeepOpinionが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


DeepOpinionは、大規模なロボティックプロセス自動化ツールに限界があり、複雑で記録大量の知識ワークを担当することを目的としたEnterprise向け自動化プラットフォームです。これは大規模言語モデルとワークフローツールを組み合わせて、スケールでスケーラブルなエイリアム、契約書、請求書、サポートチケットなどの非構造化入力を処理して、RPAツールが苦手とするタイプの作業を効率化するものです。 金融、保険、クライアントサービスの業界やオペレーション部門などで信頼できる実行可能なロールアウトの可能性のあるAI処理手段が求められるチームをターゲットに掲載しているプラットフォームです。このプラットフォームでは、エンドユーザーアクションや法的要件の遵守などの観点から監査可能なAIエージェントの構築と配布を可能としてくれることで、組織に大量の開発作業を必要とせずにAIエージェントの構築と運用が可能になります。 Cloud上またはオンプレミス展開の選択肢もあるDeepOpinionは、規制のある企業環境に適合し、繰り返しの認知的タスクの手動プロセス時間を削減することを目指しています。
評価基準の詳細
- AI एजंटによるドキュメントおよびテキスト処理
- ワークフローアUTOMATION の知識タスク
- 無構造ソースからのデータ抽出
- エンタープライズ向けのセキュリティおよび展開オプション
- 既存のビジネスシステムとの統合
- ヒューマン-イン-ザ-ループのレビュー制御

Letta AI は、オープンソース プラットフォームで作成できる、長期認識能力を備えた状態の AI エージェントを目的としたものです。このようなエージェントは、過去の相互作用を記憶し、複雑で文脈的によほど意思決定プロセスを実現します。 これは、エージェントが経験から時間をかけて学び、対応する応答を適応させる必要があるアプリケーションには特に便利である。 Letta AI は、客層サービスから、より複雑な問題解決タスクに至るまで、さまざまでいる開発者や研究者を対象としている。 長期記憶と高度な推論能力を提供することで、Letta AI は、より高度の自律性と知性を持つエージェントを構築しうるように助け、幅広いタスクに対処することができる。
評価基準の詳細
- 状態エージェント
- 長期記憶
- 高度な推論方法

Botpressは、巨大言語モデルにPowered している会話型AIエージェントの開発プラットフォームです。Visual Flow Builder、SDK、人気のメッセージングチャンネルとの統合などを提供し、チームは自然な会話を展開するエージェントを設計、APIを呼び出す、複数ステップのタスクを実行できるようにすることができます。 "ローカodeskツールを組み合わせて低レベルのカスタマイズが可能なプラットフォームは、非技術的なユーザーや開発者が同一プロジェクトに協力できるように設計されています。機能として、ノウハウベース、分析、人間のアシストなどがあります。顧客サポート、リード発生、内部オートメーションのような生産用途での使用が適しています。 Botpressでは、試験や開発に適した無料プラン、および使用量によって料金が調整される有料プラン、さらに自主的なホスティングに適したオープンソースコミュニティエディションを提供します。
評価基準の詳細
- ドラッグ アンド ドロップで構成された会話 フローのエディタ
- LLMパワーのエージェントを使ったツール使用
- ドキュメントやURLから知識ベースのインポート
- マルチ チャンネル展開 (Web、WhatsApp、Slack、など)
- 分析と会話モニタリング
- 人間へのハンドオフとチームの共同作業

デベロッパー向けプラットフォームである Gretel AI は、機密情報が露呈されない限り、実データセットと同様の統計的特性を持つ仮装データを作成するためのツールです。チームでは、プライバシー、合規性、利用可能性の制約により、実データへのアクセスが制限されている場合のAIおよびアナリティクスプロジェクトをブロックするのを防ぐために、Gretel AI を使用します。 プラットフォームでは、テーブルの、テキストの、タイム・シリアスのデータの生成用に、API、SDK、プリ・ビルド・モデルが提供されている。また、品質評価、プライバシリスク評価を行うツールも用意されている。機械学習モデルのトレーニング、代表されていないクラスの強化、チーム間でのデータ共有、ソフトウェアのテストにおけるロジカルなアーティファクト生成に用いてもらえる一般的な使い方がサポートされている。
評価基準の詳細
- 合成するためのタブラー、テキスト、およびタイムシリーズデータ用の生成モデル
- Differential 秘密保護とPII (Personally Identifiable Information) の redaction コントロール
- 品質、正確性、およびプライバシーリスクのスコア付けレポート
- Python SDKおよびREST API統合
- 前トレーニングモデルおよびカスタム テンプレート
- クラウドおよび自社ホストの展開可能なオプション
NetX は、ブロックチェーンと人工知能技術を統合したモジュラーな経済ネットワークです。其のアーキテクチャは、開発者や組織が分散取引、データ交換、人工知能が駆動するサービスなど、さまざまなデジタル経済用途をサポートできるように、分散取引用コモーネント、データ交換用コモーネント、人工知能使用サービスなど、統合フレームワーク内でプラグインできるように設計されています。 プラットフォームでは、伝統的なブロックチェーン機能をマシンラーニングワークフローより橋接して、トークン化されたインセンティブ、スマートコントラクトの自動化、AIを活用した分析の運用をエコシステム内で実現することを目指している。これにより、Web3アプリケーションを構築するチームが、知能化された処理やデータドライブの決策作業を要するというニーズに応える適切なプラットフォームとなる。 モジュラの重要性を重視することで、NetXは開発者にスタックの構築における柔軟性を提供し、適合するブロックチェーン、AI、経済プリミティブを選択できるようにして、プロジェクトのニーズに応じて組み立てることができることを目的としています。
評価基準の詳細
- モジュラーなネットワークコンポーネント
- ブロックチェーン統合レイヤー
- AIサービス互換性
- スマートコントラクトサポート
- トークニーエコノミープリミティブ
- 開発者に特化したツール


Snorkel Flowは、ラベル付け関数を使用してマニュアル注釈に頼ることなく、データのラベリング、キュレーション、調整を迅速に行うことで、プログラマティック データ開発のエンタープライズ プラットフォームです。 ドメインの専門知識を再利用可能なヒューリスティックとして固有化すると、生データから生産可能なAIモデルの開発までのパスを加速します。 プラットフォームは、Weak supervision、モデルトレーニング、エラーアナリティスのワークフローを統合しています。データサイエンティストと専門家のコラボレーションを伴う、データセットとモデルの改善プロセスをサポートしています。ドキュメント分類、情報抽出、企業アプリケーション向けにファンデーションモデルをフィネットゥーニングするなど、多くの用途をサポートしています。
評価基準の詳細
- プログラマティック ラベリングでラベリング機能を活用
- 弱い監督とラベル アグリゲーション
- 組み込みモデルトレーニングおよび評価
- エラーアナリティスおよびデータ スライシングツール
- ファウンドेशन モデルのフィンバックサップ スタートラップ
- エキスパートおよびデータサイエンスの共同作業ツール

LangSmithは、LangChainチームによって作成された、大規模言語モデルを動かすアプリケーションを、追跡するため、テストするため、評価するため、監視するための開発者向けのプラットフォームです。 LangChainおよびLangGraphフレームワークと密接に統合できるようになっていますが、フレームワーク非依存(framework-agnostic)であり、SDKやAPIを通じて、LLMアプリケーションをインストルメント化できます。その核心的な目的は、LLMベースのシステムでは出力が非決定性であり、エラーは微妙で、開発者が、実行時にチェーン、エージェント、プロンプトが実際に何をしているかについて、可視性を提供することによって、潜在的な不確実性を対処することです。 プラットフォームの中心概念は、トレース(trace)です。各アプリケーションのランを実行すると、詳細で階層化されたトレースが表示されます。該当するエンティティには、送信されたprompts、modelの応答、トークン使用状況、レイテンシー、ツールのコール、各ノードの中間出力などが含まれます。これにより、複雑なマルチステップエージェントや、悪い答えの原因が数層奥にあるリテラル・オーガメンテッド・ジェネレーションパイプラインのデバッグが容易になります。開発者は、個々のトレースを検査するほか、ランをフィルタリングおよびテキスト検索できるため、各ノードでの正確な入力と出力を掘り下げることが可能です。 LangSmithも、アプリケーションの品質を測定する評価ツールを提供しています。チームは、プロダクション トレイス atau カレード エクサンプルからデータセットを作成し、評価ツールでそれらにアプリケーションを実行し、組み込まれた評価ツール、カスタム コードベース チェック、または LLM-アサイスアプローチを使用して出力のスコアを決定できます。この機能は、Prompt またはモデルが変更されたときにレギュレーション テストをサポートし、改善された結果ではなく結果が実際に改善されているかどうかを数値化するために利用できます。 業務用途の運用では、遅延、コスト、エラーレート、フィードバックなどを時間の経過とともに跟跡する監視ダッシュボード機能や、ユーザーのフィードバックおよびユーザー注釈を収集する機能を提供します。また、プッシュボタン式でプログラムを作成してモデルに入力をさせるプロンプト管理機能、試験室モードの機能もある。 LLM機能を実装する開発者やチームに向けられた、LangSmithは主にアドホックprint-statementデバッグから、統合された観察性と評価までを、システム的に進むことが目標です。 LangSmithの主な強みは、LangChainエコシステムとの深い統合と、追跡、データセット、評価の統一されたワークフローです。実際のところ、最も充実した体験は、LangChain/LangGraphの世界で熟練していることを前提としています。 また、LLMベースの評価自体は、注意深い設計が必要です。さらに、この製品はhostedの商用製品であり、使用ベースの価格設定になりますが、一定のプランでは自分でホストするオプションもあります。 その他、Langfuse、Halicone、Arize Phoenix、Weights & Biases Weave などと競合する、他のLLM観察性ツールが存在しています。
評価基準の詳細
- ランニングトレースにステップバイステップの入出力とトークン使用を実現
- データセットの生成と自動評価
- 組み込み、コードベース、LLM-エージェント評価器
- プロダクション監視ダッシュボード
- ヒューマンフィードバックと注釈の収集
- プロンプトマネージャー、バージョニング、プレイグラウンド











