過去のバトル · 2024-01-11 UTC
Observability 対決 — 2024年1月11日
Observabilityカテゴリーから。 10名の参戦者に40票が投じられました。 Quotient AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

Quotient AIはチームが搭載した AI機能を提供しているチーム向けの、観測性と評価プラットフォームです。AIパワーを搭載した実稼働システム、検索(RAG)、自動エージェントを含む—を、終ユーザーに到達する前にホログラム、リトリーベルエラー、質問の問題を表面化し、他にQuality Issuesを監視すること続けています プラットフォームは、自動評価をリアルタイムのアラートと組み合わせて、エンジニアリングとMLチームが根源的な原因を診断し、モデルまたはプログラム変更によるバックレッションのトラッキングを行い、可用性をメジャーに維持します。このプラットフォームは、AIパイプラインをインストルメンテーションすることで、デベロッパーがアプリケーションが実際にはどのように振る舞うかを参照できるものとなり、オフラインのベンチマークだけに頼るのではなく、
評価基準の詳細
- リアルタイムAIモニタリングとアラート
- ハリケーンと取り戻しエラーの検出
- RAGパイプラインの評価ツール
- エージェントの行動と診断
- モデルとプロンプトの変更によるレグレスの分析
- AIアプリケーション用の生産性観察

ウェーブ (Weave) は、機械学習モデル (LLM) の大規模な言語モデルアプリケーションを追跡および最適化するための監視と評価プラットフォームです。ウェーブはLLM評価官やカスタムスコーラの使用によるアプリケーションレスポンスのトレース、メトリクスの収集、評価のためのツールを提供します。このプラットフォームの主な機能には、セッショントレース、LLMコール、ツールコール、およびカスタムエージェントへの手動インストルメンテーションがあります。 このプラットフォームでは、一般的なSDKやハーネス、カスタムエージェント可視性と連携が可能です。WeaveはPythonとTypeScript用のライブラリを用意しており、そのプラットフォームをインストール・使用するためのものです。このプラットフォームはWeights & Biasesのサービスを利用しており、W&BアカウントとAPIキーが認証に必要です。 ユーザーはWeaveのUI上でLLMへの呼び出しをトレースし、入力と出力をレビューし、エージェントの指標を確認できます。ただし、名前から推測されるように、WeaveはノーコードのAIワークフロー作成者ではありません。このようにして、WeaveはLLMアプリケーションの自動化と評価をサポートしています。
評価基準の詳細
- エージェントのトレーシングと指標の収集
- カスタムエージェントの動作性
- LLMのトレーシングと評価
- OpenTelemetry spanサポート
- Weights&Biases(W&B)のインテグレーション
- PythonおよびTypeScriptのライブラリ

AgentOpsは、AIエージェントのライフサイクルについての開発プラットフォームであり、実行時にエージェントがどのように動作しているかを明らかにするトレーシング、モニターング、およびデバッグツールを提供しています。このプラットフォームはLLMのコール、ツールの使用状況、コスト、およびエラーコードをキャプチャし、複雑なマルチステップワークフロー全体を通じてエージェントのビヘイビアを把握するためのチーム向けです。 AgentOpsは視覚化に加えて、セッション再生機能や、LangChain、CrewAI、AutoGenなどの人気エージェントフレームワークとの統合などを提供しています。この機能によりエンジニアは、推測やロギングに頼るのではなく、測定可能な信頼性でプロトタイプから実稼働に移行することができます。 開発者やチームがAgentベースのアプリケーションをリリースする際のバグのトラッキング、コストのコントロール、リリース前後でエージェントの動作の正当性の確認が必要な場合に備え、AgentOpsはこのようなニーズを満たすソリューションを提供します。
評価基準の詳細
- エージェントセッションの記録および再生
- LLMコールおよびツール使用のトレース
- コストおよびトークンの分析
- エラーおよび障害の検出
- PythonおよびJavaScript用フレームワークのSDK
- エージェントパフォーマンスの指標に対するダッシュボード

Confident AIは、大規模言語モデルの開発に対する評価と観察性プラットフォームです。DeepEvalのオープンソースフレームワークを活用して、大規模言語モデルの開発に従事するチームに対する統一されたワークスペースを提供しており、プロンプト、アーキテクチャ、および取得パイプラインに対してベンチマーク、リグレッションテスト、および品質制御チェックを実行します。 プラットフォームではエンジニアが製品をリリースする前に、ホロシネシス、プランプットリグレッション、およびレートリーヴャールファイルに遭遇するのを防ぐことができます。また、実際のユーザーとのインタラクションを追跡するためのリリースモニタリングを提供します。これにより、チームではデータセットを統合、テストレポートを共有し、測定可能なフィードバックでプランプットを反復するのではなく、何にも知らなかったとして推測するのではなく、プロンプトに反復することができます。 [Confident AI]は、構造化された、指標を活用したアプローチを取り入れたLLMの品質保証に対するアプローチが必要な開発者、機械学習エンジニア、QAチームを対象にしている。アドホックの手動レビューではなく、指標に基づいた品質保証の方法を求めているのである。
評価基準の詳細
- DeepEval-powered 評価 メトリクス
- プロンプトとモデルのリグレッションテスト
- RAG ならびにリトレーブル評価
- 生産トレースおよびモニタリング
- データセット およびテストケース マネージャ
- 評価結果のチーム協力


エンタープライズプラットフォームであるFiddler AIは、プロダクションで稼働中の機械学習モデルの監視、分析、およびセキュリティをサポートするチームに助けを貸します。Lチューンワードモデル(LMM)やジェネレティブアイルームメントのリスクからモデルのパフォーマンス、データドラフト、偏り、品質問題に関する可視性を提供します。ハロウィンシン、指令投入、および安全な出力に対するリスクを防ぐセーフガードも提供されます。 機械学習 エンジニア、データサイエンティスト、リスクおよびコンプライアンスチーム向けに設計されたFiddlerは、説明可能性、リアルタイムモニタリング、ギャラードラيلを1つのワークフローに組み合わせます。このツールは、一般的な機械学習パイプラインおよびクラウド環境と統合され、組織は大規模な責任あるAI実践の運用を支援いたします。
評価基準の詳細
- モデルパフォーマンスの漂流監視
- LLM幻想と安全性の検出
- 暗示された投票保護および脱走対策
- 説明可能なAIと根因分析
- 偏りの評価と公平性評価
- 生産AIのダッシュボードと警告

Portkeyは、アジャイルなAIチーム向けの統一されたコントロールプレーンです。AIチームが生産現場に進むための包括的なプラットフォームを提供し、高度なAI Gate Way、モニタリング、およびガバナンス機能などが含まれます。ユーザーは統一APIを通じて、1,600人以上のLLMへのアクセスを提供して、モデルと統合を簡素化し、チームが作成に集中できるようにします。また、リアルタイムのモニタリングを提供して、LLMの挙動を監視し、早期に異常を検出し、使用を事前に管理できるようにします。さらに、キャッシング機能を使用すると、重複テストを減らしてユーザーは数千ドルを節約できることが示されました。Portkeyは、幅広いLLMをサポートし、3,000を超えるGenAIチーム、および毎日数百万のトークン処理をサポートするため、AIチーム向けに設計されています。
評価基準の詳細
- マルチプロバイダーラーティングをサポートするAIゲートウェイ
- プロンプト管理とバージョニング
- リクエストログ、トレース、および分析
- 意味的なキャッシングとリトライ
- ゲールデール(Guardrails)による入力および出力検証
- 使用頻度およびコスト監視ダッシュボード

Relariは、開発者向けのプラットフォームです。このプラットフォームでは、AIエージェントの信頼性を大幅に向上させることを目的とした、体系的なテストと評価を実施することを主な目標とともに開発しています。 このプラットフォームは、シナリオに基づくテストを行い、合成データセットを生成、自動評価の実行、および現実世界のシナリオにおけるエージェントのパフォーマンスのベンチマークを実施して、製品のリリースまでお客様のチームをサポートしています。 Y Combinator (W24) の支援を受けて、Relariは複雑な LLM アプリケーションとマルチステップ エージェントを構築しているエンジニアリング チームを対象としています。伝統的な QA では対応が困難となるそのようなシステムに対して、Relari のツールはソフトウェアエンジニアリングの厳密さ---ユニット テスト、回帰チェック、および測定可能なメトリック---を導入することを目指しています。 プレーヤー(production agents)の前ローンチ検証とオンドウング・クオリティ・アサランス(ongoing quality assurance)のために、サーバーレスプラットフォームはカスタム評価官(評価者評定官)、シナリオシミュレーション、継続的モニタリングをサポートします。
評価基準の詳細
- シンティチックデータセットの生成
- 自動エージェント評価パイプライン
- シナリオとコミュニケーションシミュレーション
- カスタマイズ可能な評価指標
- LLMアプリケーション向けのリグレッションテスト
- パフォーマンスベンチマークと報告


Arize AIは、LLMの評価プラットフォームにAI監視を組み込んでいます。AI開発者やデータサイエンティストがAIモデルの動作監視、対処、パフォーマンス向上に助けるプラットフォームです。そのプラットフォーム内には、問題の特定と修正を提案するツールを提供し、ユーザーがモデルの精度と安定性を向上させることができます。Arize AIは、そのモデルのパフォーマンスを最適化するために必要なAI開発者やデータサイエンティストのニーズを考慮し設計されています。プラットフォームの機能には、問題の迅速な特定と対処に役立つ監視と対処を含みます。Arize AIは、モデルのパフォーマンス評価と向上の機能も提供します。ユーザーはモデルを時間の経過とともに精細化することができます。Arize AIを利用することで、ユーザーはAIモデルの最適パフォーマンスを確保し、良い決定や結果につながることができます。プラットフォームの監視と評価の焦点は、その他のAI開発ツールとは一線を画し、そのような巨大言語モデルのほか複雑なAIシステムと取り組む人々にとって、貴重なリソースとなっています。
評価基準の詳細
- モデルモニタリング
- トラブルシューティングと問題の特定
- 提案済みの修正生成
- モデルパフォーマンスの評価
- LLMの評価と最適化

Edwin AIは、IT運用用のAIエージェントで、インシデント発生、調査、解決の高速化を目的としたツールです。 ITチームはこのツールを利用して、システムの調査、影響の理解、修正、既存ツールへの適用を一括管理できるようになります。 Edwin AIはアラートの相関化、アラートノイズの軽減、root causeの自動推測、remediationの自動実行や予測分析から解決までを一連のプロセスで対応します。 このツールは、30種類のカテゴリに跨る3000種類以上のツールと相互運用可能であり、リアルタイムなアクセス可能な情報提供と情報 siloを排除することが可能です。 Forrester調査で、Edwin AIは組織が313%のROIを得られることも判明し、6月以内に還元が可能にしました。
評価基準の詳細
- アラート間の相関化とノイズの軽減
- AIによりroot causeの提案
- 自然言語でインシデントのサマリー
- ITSMや観測可能性プラットフォームとの統合
- 自動化されたtrouble shootingフロー
- 過去のインシデントからの知識の充実

ファウンドリーエーアイは、実際のビジネスフローウォークを処理するAIエージェントの開発プラットフォームです。エージェント デザイン、テスト、継続的な改善のツールを組み合わせて、チームは別々のシステムをくっつけないことなく、プロトタイプから生産機器まで迅速に進めることができます。 このプラットフォームでは、開発者がエージェントのパフォーマンスを定義されたタスクへの比較検討によって評価することができ、その結果を経て行動を改良できるように、評価を行うことを主眼に置いています。これにより、顧客サポートの自動化、内部作業、か細かな知識作業の自動化を目的とする組織に適しています。 フォンダリーエーアイは、完全にソースからから機械学習エージェントを建てるのほうが遅いが、ノーコードビルダーでは管理ができない技術チームの方に適したソリューションです。
評価基準の詳細
- エージェント構築環境
- 評価とテストツール
- パフォーマンスモニタリング
- ワークフロー自動化サポート
- 迂回性向上ループ
- ビジネスシステムの統合










