過去のバトル · 2025-06-03 UTC
Observability 対決 — 2025年6月3日
Observabilityカテゴリーから。 7名の参戦者に20票が投じられました。 Quotient AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

Quotient AIはチームが搭載した AI機能を提供しているチーム向けの、観測性と評価プラットフォームです。AIパワーを搭載した実稼働システム、検索(RAG)、自動エージェントを含む—を、終ユーザーに到達する前にホログラム、リトリーベルエラー、質問の問題を表面化し、他にQuality Issuesを監視すること続けています プラットフォームは、自動評価をリアルタイムのアラートと組み合わせて、エンジニアリングとMLチームが根源的な原因を診断し、モデルまたはプログラム変更によるバックレッションのトラッキングを行い、可用性をメジャーに維持します。このプラットフォームは、AIパイプラインをインストルメンテーションすることで、デベロッパーがアプリケーションが実際にはどのように振る舞うかを参照できるものとなり、オフラインのベンチマークだけに頼るのではなく、
評価基準の詳細
- リアルタイムAIモニタリングとアラート
- ハリケーンと取り戻しエラーの検出
- RAGパイプラインの評価ツール
- エージェントの行動と診断
- モデルとプロンプトの変更によるレグレスの分析
- AIアプリケーション用の生産性観察


Arize AIは、LLMの評価プラットフォームにAI監視を組み込んでいます。AI開発者やデータサイエンティストがAIモデルの動作監視、対処、パフォーマンス向上に助けるプラットフォームです。そのプラットフォーム内には、問題の特定と修正を提案するツールを提供し、ユーザーがモデルの精度と安定性を向上させることができます。Arize AIは、そのモデルのパフォーマンスを最適化するために必要なAI開発者やデータサイエンティストのニーズを考慮し設計されています。プラットフォームの機能には、問題の迅速な特定と対処に役立つ監視と対処を含みます。Arize AIは、モデルのパフォーマンス評価と向上の機能も提供します。ユーザーはモデルを時間の経過とともに精細化することができます。Arize AIを利用することで、ユーザーはAIモデルの最適パフォーマンスを確保し、良い決定や結果につながることができます。プラットフォームの監視と評価の焦点は、その他のAI開発ツールとは一線を画し、そのような巨大言語モデルのほか複雑なAIシステムと取り組む人々にとって、貴重なリソースとなっています。
評価基準の詳細
- モデルモニタリング
- トラブルシューティングと問題の特定
- 提案済みの修正生成
- モデルパフォーマンスの評価
- LLMの評価と最適化

ファウンドリーエーアイは、実際のビジネスフローウォークを処理するAIエージェントの開発プラットフォームです。エージェント デザイン、テスト、継続的な改善のツールを組み合わせて、チームは別々のシステムをくっつけないことなく、プロトタイプから生産機器まで迅速に進めることができます。 このプラットフォームでは、開発者がエージェントのパフォーマンスを定義されたタスクへの比較検討によって評価することができ、その結果を経て行動を改良できるように、評価を行うことを主眼に置いています。これにより、顧客サポートの自動化、内部作業、か細かな知識作業の自動化を目的とする組織に適しています。 フォンダリーエーアイは、完全にソースからから機械学習エージェントを建てるのほうが遅いが、ノーコードビルダーでは管理ができない技術チームの方に適したソリューションです。
評価基準の詳細
- エージェント構築環境
- 評価とテストツール
- パフォーマンスモニタリング
- ワークフロー自動化サポート
- 迂回性向上ループ
- ビジネスシステムの統合
Helicone AIは、特にLLM(大規模言語モデル)を搭載したアプリケーション向けに開発者向けのオブザビリティプラットフォームです。 リクエスト、リソース、コスト、レイテンシーなどの情報を、プロバイダー横断してキャプチャすることで、エンジニアチームはプロダクション環境におけるLLMフィーチャーの動作を統合された視点で把握できます。 ログだけではなく、推論要素をデバッグ、多ステップエージェントワークフローをトレース、評価を実行、ユーザーごとの使用状況を追跡するツールまで、ヘリコンは提供しています。 チームではデータによる推論の予測と不正解の検出や使用コストを規制し、ワークフローに対する変更をデータによって行うことができます。 このツールは、軽量プロキシまたは非同期ロギングを用いた形で、人気のモデルプロバイダーとフレームワークとの統合をサポートしています。これにより、既存のスタックに追加することが簡単で、主要なコード変更を伴う必要がなくなります。
評価基準の詳細
- リクエストとレスポンスのロギング
- コストとトークン使用のトラッキング
- プロンプト管理とバージョニング
- エージェントとセッションのトレース
- カスタム評価とダッシュボード
- ユーザーとレート制限の分析


KeywordsAIは、生産要件を満たすLMMアプリケーションを展開するための、開発者のためのプラットフォームを構築します。これは複数のモデル プロバイダーにアクセスするために単一のAPIゲートウェイ、そしてアプリケーションの実世界でのパフォーマンスを理解するためにチームに支援する内蔵の観察可能性、ログ記録、および評価機能を提供します。 このプラットフォームは、LLMを活用した製品を実行する必要性による経営上の負担を軽減するように設計されています。開発者は、待ち時間やコストを監視できます。また、debugのための促śを変更する機能もあります。 また、評価の実行とプロンプトリバーション管理も可能です。このような個別のツールを組み合わせることなく、これらの作業を実行できます。これにより、エンジニアチームがAI機能の開発に迅速に反応し、利用量の増加にも耐えることが可能になります。
評価基準の詳細
- 複数のモデルの統一されたLLMゲートウェイ
- リクエストログとトレース
- コストとレイテンシモニタリング
- プロンプトのエクスペリメンテーションとバージョンコントロール
- 評価およびテストフローのワークフローウェイ
- SDKとAPI統合

Relariは、開発者向けのプラットフォームです。このプラットフォームでは、AIエージェントの信頼性を大幅に向上させることを目的とした、体系的なテストと評価を実施することを主な目標とともに開発しています。 このプラットフォームは、シナリオに基づくテストを行い、合成データセットを生成、自動評価の実行、および現実世界のシナリオにおけるエージェントのパフォーマンスのベンチマークを実施して、製品のリリースまでお客様のチームをサポートしています。 Y Combinator (W24) の支援を受けて、Relariは複雑な LLM アプリケーションとマルチステップ エージェントを構築しているエンジニアリング チームを対象としています。伝統的な QA では対応が困難となるそのようなシステムに対して、Relari のツールはソフトウェアエンジニアリングの厳密さ---ユニット テスト、回帰チェック、および測定可能なメトリック---を導入することを目指しています。 プレーヤー(production agents)の前ローンチ検証とオンドウング・クオリティ・アサランス(ongoing quality assurance)のために、サーバーレスプラットフォームはカスタム評価官(評価者評定官)、シナリオシミュレーション、継続的モニタリングをサポートします。
評価基準の詳細
- シンティチックデータセットの生成
- 自動エージェント評価パイプライン
- シナリオとコミュニケーションシミュレーション
- カスタマイズ可能な評価指標
- LLMアプリケーション向けのリグレッションテスト
- パフォーマンスベンチマークと報告

LLM Scoutは、生成型検索の時代に作られたブランドモニタリングツールです。 company、製品、競合他社が、主なAIアシスタントと答え用エンジンに何度も言及されているかを追跡して、 marketer、SEO チームは、このトラディショナルアナリティクツールが見逃しているチャンネルに対して、可視性を得ることができます。 このプラットフォームでは、ChatGPT、Claude、Perplexity、GoogleのAIオーバービューや他のAIシステムの再帰的プロンプトを実行し、話題シェア、Sentiment、引用元、時間の変化に関するレポートを生成します。 チームは、コンテンツ戦略を改善し、競合企業が代わりに推奨されているギャップを認識し、大きい規模の言語モデルへの最適化の効果を測定するために、これらの洞察を使用できます。
評価基準の詳細
- ブランドおよびライバル企業言及のトラッキング
- ChatGPT、Claude、Perplexity、そしてAI Overviewsをモニタリング
- 感情分析およびシェア率分析
- 引用およびソースの可視化
- カスタムプリモントトラッキング
- 歴史的トレンドレポート






