過去のバトル · 2023-12-27 UTC
Observability 対決 — 2023年12月27日
Observabilityカテゴリーから。 8名の参戦者に30票が投じられました。 Fiddler AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


エンタープライズプラットフォームであるFiddler AIは、プロダクションで稼働中の機械学習モデルの監視、分析、およびセキュリティをサポートするチームに助けを貸します。Lチューンワードモデル(LMM)やジェネレティブアイルームメントのリスクからモデルのパフォーマンス、データドラフト、偏り、品質問題に関する可視性を提供します。ハロウィンシン、指令投入、および安全な出力に対するリスクを防ぐセーフガードも提供されます。 機械学習 エンジニア、データサイエンティスト、リスクおよびコンプライアンスチーム向けに設計されたFiddlerは、説明可能性、リアルタイムモニタリング、ギャラードラيلを1つのワークフローに組み合わせます。このツールは、一般的な機械学習パイプラインおよびクラウド環境と統合され、組織は大規模な責任あるAI実践の運用を支援いたします。
評価基準の詳細
- モデルパフォーマンスの漂流監視
- LLM幻想と安全性の検出
- 暗示された投票保護および脱走対策
- 説明可能なAIと根因分析
- 偏りの評価と公平性評価
- 生産AIのダッシュボードと警告

ファウンドリーエーアイは、実際のビジネスフローウォークを処理するAIエージェントの開発プラットフォームです。エージェント デザイン、テスト、継続的な改善のツールを組み合わせて、チームは別々のシステムをくっつけないことなく、プロトタイプから生産機器まで迅速に進めることができます。 このプラットフォームでは、開発者がエージェントのパフォーマンスを定義されたタスクへの比較検討によって評価することができ、その結果を経て行動を改良できるように、評価を行うことを主眼に置いています。これにより、顧客サポートの自動化、内部作業、か細かな知識作業の自動化を目的とする組織に適しています。 フォンダリーエーアイは、完全にソースからから機械学習エージェントを建てるのほうが遅いが、ノーコードビルダーでは管理ができない技術チームの方に適したソリューションです。
評価基準の詳細
- エージェント構築環境
- 評価とテストツール
- パフォーマンスモニタリング
- ワークフロー自動化サポート
- 迂回性向上ループ
- ビジネスシステムの統合

Quotient AIはチームが搭載した AI機能を提供しているチーム向けの、観測性と評価プラットフォームです。AIパワーを搭載した実稼働システム、検索(RAG)、自動エージェントを含む—を、終ユーザーに到達する前にホログラム、リトリーベルエラー、質問の問題を表面化し、他にQuality Issuesを監視すること続けています プラットフォームは、自動評価をリアルタイムのアラートと組み合わせて、エンジニアリングとMLチームが根源的な原因を診断し、モデルまたはプログラム変更によるバックレッションのトラッキングを行い、可用性をメジャーに維持します。このプラットフォームは、AIパイプラインをインストルメンテーションすることで、デベロッパーがアプリケーションが実際にはどのように振る舞うかを参照できるものとなり、オフラインのベンチマークだけに頼るのではなく、
評価基準の詳細
- リアルタイムAIモニタリングとアラート
- ハリケーンと取り戻しエラーの検出
- RAGパイプラインの評価ツール
- エージェントの行動と診断
- モデルとプロンプトの変更によるレグレスの分析
- AIアプリケーション用の生産性観察

Portkeyは、アジャイルなAIチーム向けの統一されたコントロールプレーンです。AIチームが生産現場に進むための包括的なプラットフォームを提供し、高度なAI Gate Way、モニタリング、およびガバナンス機能などが含まれます。ユーザーは統一APIを通じて、1,600人以上のLLMへのアクセスを提供して、モデルと統合を簡素化し、チームが作成に集中できるようにします。また、リアルタイムのモニタリングを提供して、LLMの挙動を監視し、早期に異常を検出し、使用を事前に管理できるようにします。さらに、キャッシング機能を使用すると、重複テストを減らしてユーザーは数千ドルを節約できることが示されました。Portkeyは、幅広いLLMをサポートし、3,000を超えるGenAIチーム、および毎日数百万のトークン処理をサポートするため、AIチーム向けに設計されています。
評価基準の詳細
- マルチプロバイダーラーティングをサポートするAIゲートウェイ
- プロンプト管理とバージョニング
- リクエストログ、トレース、および分析
- 意味的なキャッシングとリトライ
- ゲールデール(Guardrails)による入力および出力検証
- 使用頻度およびコスト監視ダッシュボード
Helicone AIは、特にLLM(大規模言語モデル)を搭載したアプリケーション向けに開発者向けのオブザビリティプラットフォームです。 リクエスト、リソース、コスト、レイテンシーなどの情報を、プロバイダー横断してキャプチャすることで、エンジニアチームはプロダクション環境におけるLLMフィーチャーの動作を統合された視点で把握できます。 ログだけではなく、推論要素をデバッグ、多ステップエージェントワークフローをトレース、評価を実行、ユーザーごとの使用状況を追跡するツールまで、ヘリコンは提供しています。 チームではデータによる推論の予測と不正解の検出や使用コストを規制し、ワークフローに対する変更をデータによって行うことができます。 このツールは、軽量プロキシまたは非同期ロギングを用いた形で、人気のモデルプロバイダーとフレームワークとの統合をサポートしています。これにより、既存のスタックに追加することが簡単で、主要なコード変更を伴う必要がなくなります。
評価基準の詳細
- リクエストとレスポンスのロギング
- コストとトークン使用のトラッキング
- プロンプト管理とバージョニング
- エージェントとセッションのトレース
- カスタム評価とダッシュボード
- ユーザーとレート制限の分析


KeywordsAIは、生産要件を満たすLMMアプリケーションを展開するための、開発者のためのプラットフォームを構築します。これは複数のモデル プロバイダーにアクセスするために単一のAPIゲートウェイ、そしてアプリケーションの実世界でのパフォーマンスを理解するためにチームに支援する内蔵の観察可能性、ログ記録、および評価機能を提供します。 このプラットフォームは、LLMを活用した製品を実行する必要性による経営上の負担を軽減するように設計されています。開発者は、待ち時間やコストを監視できます。また、debugのための促śを変更する機能もあります。 また、評価の実行とプロンプトリバーション管理も可能です。このような個別のツールを組み合わせることなく、これらの作業を実行できます。これにより、エンジニアチームがAI機能の開発に迅速に反応し、利用量の増加にも耐えることが可能になります。
評価基準の詳細
- 複数のモデルの統一されたLLMゲートウェイ
- リクエストログとトレース
- コストとレイテンシモニタリング
- プロンプトのエクスペリメンテーションとバージョンコントロール
- 評価およびテストフローのワークフローウェイ
- SDKとAPI統合

Maxim AIは、信頼性のあるAIエージェントやLLMアプリケーションを開発チームに迅速にリリースするための開発プラットフォームです。このプラットフォームでは、プレモットエンジニアリング、評価、モニタリング、データセット管理を統合させて、品質を測定しながら急速に開発が進みます。 プラットフォームでは自動評価と人間による評価を、複数のモデルとプログラムにわたってサポートしています。これは、エンジニアがプロダクションにおける出力の比較、遷移の検出、そしてエラーの追跡を行うことを可能にしています。これはクロス関連的なコラボレーションに設計されています。ワークフローが技術的専門家だけでなく、非専門家の利益者がテストとレビューに貢献できるように、両方の参加を可能にします。 マキシムは、チャットボット、コピルート、ボイスエージェント、多ステップの意思決定フローなどを構築しているチームがよく利用していますが、その構築には、変化する質問、モデル、ユーザ入力に一貫したパフォーマンスを確保する必要があります。
評価基準の詳細
- プロンプティングPlaygroundおよびバージョニング
- 自動化されたエージェントおよびLLMの評価
- 生産性向上とトレース
- データセットの調整および管理
- ヒューマンレビューおよび注釈ワークフロー
- マルチモデルおよびマルチパブリッシャー対応

Relariは、開発者向けのプラットフォームです。このプラットフォームでは、AIエージェントの信頼性を大幅に向上させることを目的とした、体系的なテストと評価を実施することを主な目標とともに開発しています。 このプラットフォームは、シナリオに基づくテストを行い、合成データセットを生成、自動評価の実行、および現実世界のシナリオにおけるエージェントのパフォーマンスのベンチマークを実施して、製品のリリースまでお客様のチームをサポートしています。 Y Combinator (W24) の支援を受けて、Relariは複雑な LLM アプリケーションとマルチステップ エージェントを構築しているエンジニアリング チームを対象としています。伝統的な QA では対応が困難となるそのようなシステムに対して、Relari のツールはソフトウェアエンジニアリングの厳密さ---ユニット テスト、回帰チェック、および測定可能なメトリック---を導入することを目指しています。 プレーヤー(production agents)の前ローンチ検証とオンドウング・クオリティ・アサランス(ongoing quality assurance)のために、サーバーレスプラットフォームはカスタム評価官(評価者評定官)、シナリオシミュレーション、継続的モニタリングをサポートします。
評価基準の詳細
- シンティチックデータセットの生成
- 自動エージェント評価パイプライン
- シナリオとコミュニケーションシミュレーション
- カスタマイズ可能な評価指標
- LLMアプリケーション向けのリグレッションテスト
- パフォーマンスベンチマークと報告








