Vergangene Schlacht · 2024-01-11 UTC
Observability Duell — 11. Januar 2024
Aus der Kategorie Observability. 40 Marken verteilt auf 10 Kämpfer. Quotient AI holte sich die Krone.
Endstand
Die Aufstellung
Die Kämpfer
Profile aller Tools, die in dieser Schlacht angetreten sind, nach Endpunktzahl sortiert.

Quotient AI
Echtzeit-Überwachungs- und Bewertungsplattform zum Erkennen von KI-Ausfällen in Search, RAG und Agenten.
Quotient AI ist eine Observability- und Bewertungsplattform, die für Teams entwickelt wurde, die KI-gestützte Funktionen bereitstellen. Sie überwacht kontinuierlich KI-Systeme in der Produktion - einschließlich Search, Retrieval-augmented Generation (RAG) und autonomer Agenten -, um Halluzinationen, Abruffehler und andere Qualitätsprobleme zu erkennen, bevor Endnutzer sie erleben. Die Plattform kombiniert automatisierte Bewertungen mit Echtzeitwarnungen, um Ingenieurs- und ML-Teams bei der Diagnose von Root-Causes, der Verfolgung von Regressionen bei Modell- oder Prompt-Änderungen und der Aufrechterhaltung von Zuverlässigkeit im großen Maßstab zu unterstützen. Durch die Instrumentierung von KI-Pipelines gibt Quotient Entwicklern Einblick in das tatsächliche Verhalten ihrer Anwendungen in der Praxis, anstatt sich auf Offline-Benchmarks zu verlassen.
Kriterienaufschlüsselung
- Echtzeit-KI-Überwachung und -Alerting
- Halluzinationen- und Abruffehler-Erkennung
- Bewertungstools für RAG-Pipelines
- Verhaltensverfolgung und -diagnose für Agenten
- Regressionsanalyse bei Modell- und Prompt-Änderungen
- Produktionsobservabilität für KI-Anwendungen

Weave
Eine no-code-AI-Workflow-Builder, die Unternehmen dabei unterstützt, ihre Operationen durch das Integrieren mehrerer großer Sprachmodelle (LLMs) und das Verbinden von Promptes automatisieren.

W&B Weave ist eine Observability- und Evaluierungsplattform, die dabei hilft, Anwendungen mit großen Sprachmodellen (LLM) zu verfolgen und zu verbessern. Weave bietet Werkzeuge, um Sitzungen, LLM-Aufrufe und Tool-Aufrufe zu verfolgen, Metriken zu sammeln und Anwendungsantworten mithilfe von LLM-Richtern und benutzerdefinierten Scorern zu bewerten. Zu den Hauptfunktionen gehören das Verfolgen von Sitzungen, LLM-Aufrufen und Tool-Aufrufen sowie die manuelle Instrumentierung von benutzerdefinierten Agenten. Die Plattform unterstützt Integrationen mit beliebten SDKs und Harnesses sowie benutzerdefinierte Agentenobservabilität. Weave bietet Python- und TypeScript-Bibliotheken für die Installation und Nutzung der Plattform. Sie wird auf Weights & Biases (W&B) gehostet und erfordert ein W&B-Konto und einen API-Schlüssel für die Authentifizierung. Benutzer können Anrufe bei LLMs verfolgen, Eingaben und Ausgaben überprüfen und Agent-Metriken in der Weave-UI anzeigen. Während Weave die Automatisierung und Bewertung von LLM-Anwendungen erleichtert, handelt es sich nicht um einen No-Code-AI-Workflow-Builder, wie der Name vermuten lässt.
Kriterienaufschlüsselung
- Agenten-Spuren- und Metrik-Sammlung
- Benutzerdefinierte Agentenbeobachtung
- LLM-Spuren- und Bewertung
- OpenTelemetry-Span-Unterstützung
- Weights- & Biases-Integrationen (W&B)
- Python- und TypeScript-Bibliotheken
AgentOps
Observability- und Debugging-Plattform für die Entwicklung zuverlässiger KI-Agenten

AgentOps ist eine Entwicklerplattform, die sich auf den Lebenszyklus von KI-Agenten konzentriert und Tracking-, Monitoring- und Debugging-Tools bietet, die zeigen, was Agenten tatsächlich zur Laufzeit tun. Sie erfasst LLM-Aufrufe, Toolnutzung, Kosten und Fehler, damit Teams das Verhalten von Agenten über komplexe mehrstufige Workflows hinweg nachvollziehen können. Über die Sichtbarkeit hinaus bietet AgentOps Sitzungswiedergabe, Leistungsanalysen und Integrationen mit beliebten Agentenframeworks wie LangChain, CrewAI und AutoGen. Dies unterstützt Ingenieure dabei, von Prototypen bis zur Produktion mit messbarer Zuverlässigkeit zu gelangen, anstatt auf Vermutungen oder Log‑Scraping zu vertrauen. AgentOps richtet sich an Entwickler*innen und Teams, die agentische Anwendungen liefern, die Regressionsrückverfolgung, Kostenkontrolle und Nachweis der korrekten Funktionsweise ihrer Agenten vor und nach dem Deployment benötigen.
Kriterienaufschlüsselung
- Aufzeichnung und Wiedergabe von Agentensitzungen
- Verfolgung von LLM-Aufrufen und Tool-Nutzung
- Kosten- und Token-Analysen
- Fehler- und Ausfallerkennung
- SDKs für Python und JavaScript
- Dashboards für Leistungsmetriken von Agenten
Confident AI
PLattform für LLM-Bewertungen, basierend auf DeepEval, für die Tests, Überwachung und Verbesserung von AI-Anwendungen.

Confident AI ist eine Evaluations‑ und Beobachtungsplattform für Teams, die Anwendungen mit großen Sprachmodellen entwickeln. Angetrieben vom Open‑Source‑Framework DeepEval bietet sie einen einheitlichen Arbeitsbereich, um Benchmarks, Regressionstests und Qualitätsprüfungen über Prompts, Modelle und Retrieval‑Pipelines hinweg durchzuführen. Die Plattform unterstützt Ingenieure dabei, Halluzinationen, Prompt‑Regressionen und Retrieval‑Fehler bereits vor dem Release zu erkennen, und bietet gleichzeitig ein Produktions‑Monitoring, um reale Nutzerinteraktionen nachzuverfolgen. Teams können Datensätze zentralisieren, Testergebnisse teilen und Prompt‑Iterationen mit messbarem Feedback statt reiner Vermutung durchführen. Es richtet sich an Entwickler, ML‑Ingenieure und QA‑Teams, die einen strukturierten, metrisch‑getriebenen Ansatz für die Qualitätssicherung von LLMs bevorzugen, statt ad‑hoc manuelle Reviews durchzuführen.
Kriterienaufschlüsselung
- Kriterien aus DeepEval
- Regressionstests für Anreize und Modelle
- RAL und Rückmeldebahnevaluation
- Produktionsverfolgung und Überwachung
- Datenmenge- und Testfällenmanagement
- Kooperation am Bewertungsergebnis auf Teambasis

Fiddler AI
AI-Beobachtungsplattform für die Überwachung, Erklärung und Governance von ML- und LLM-Anwendungen.

Fiddler AI ist eine Enterprise-Plattform, die Teams dabei unterstützt, Machine-Learning-Modelle und generative KI-Anwendungen in der Produktion zu überwachen, zu analysieren und zu sichern. Sie bietet Transparenz hinsichtlich Modellleistung, Data Drift, Bias und Qualitätsproblemen und stellt gleichzeitig Schutzmechanismen gegen Risiken bereit, die speziell bei LLMs auftreten, wie Halluzinationen, Prompt-Injection und unsichere Ausgaben. Für ML‑Ingenieure, Data Scientists sowie Risk‑ und Compliance‑Teams entwickelt, kombiniert Fiddler AI Erklärbarkeit, Echtzeit‑Überwachung und Schutzmechanismen in einem einzigen Workflow. Es integriert sich in gängige ML‑Pipelines und Cloud‑Umgebungen und unterstützt Organisationen dabei, verantwortungsvolle KI‑Praktiken im großen Maßstab zu operationalisieren.
Kriterienaufschlüsselung
- Modelle-Leistung- und Drift-Überwachung
- LLM-Halluzination und Sicherheitsdetection
- Prompt-Injektion- und Häftlings-Schutz
- Erklärbares ML und Root-Cause-Analyse
- Voreingenommenheit- und Fairness-Aussagen
- Dashboards und -warnungen für Produktions-AI


Portkey ist eine einheitliche Kontrollfläche für die Entwicklung, Verwaltung und Überwachung von AI-Applikationen. Es bietet eine umfassende Plattform für AI-Teams, um in Produktion zu arbeiten und eine Vielzahl an Features hervorzureichen: [Features]: * AI-Gateway mit Mehrwohneregeln * Prompt-Versionsverwaltung für Teamverwaltung und -testung an Prompts ohne Deployment-Vermittlungskompatibilität * Guardrails-Politikum und -Regeln zum Kontrollflächen-Widerruf und -Verwendungsregelmässigkeiten, um an Produktion-AI-Anwendungen [Pros]: 1. Einheitlicher API für über 200± LLM-Anbieter 2. Einheitliche Lastbilanzierung und Kostenverfolgung in KEINE Produktionsapplikationen 3. In-house-Code nicht erforderlich 4. Prompt-Verwaltung für Forschungsträger und -Entwicklung von Angeboten mit einer geheraus sucht und -Leistungs-Verbesserungen an Produktionslösungen für Anwendungen [Cons]: 1. Zusätzliche Anbieterverknüpfungen zur Zeit 2. Zusätzliche API-Nutzung für eine große Anzahl von Anbieter und -Anbieter-Datenbanken 3. Reduziert die Angriffsflächenanwendungen [Cons]: 1. Einzelnen Anbieter-Adapterfelder 2. Aber LLM-Kontextdatensatz 3. Abhängigkeit auf Anbieter-API [Cons]: 1. Eingebuchten Anbieter-Kontextdatenbank 2. Eingabeauffassung von zusätzlichen LLM-Endpunkten 3. Abhängigkeiten zu LLM-Anbieterdatenseiten und API-Datenbanken [Pros]: 1. Samurai-Modus und -Plattform für Prüfung und -Features an Projekte in SaaS-Galaxie und -API-Facetten 2. Samurai-API und -SDK mit Funktionen in AI-Verbändessystem und -Lernen-Plattform 3. Samurai-Pläne und -Funktionen für AI-Dienstleister und -DAIS [Pros]: 1. Samurai-Ansatz und -Platorm für DevOps-Teams und -Analysten in SaaS-Galaxie und -API-Schnittstellensystem 2. Samurai-SDK und -Assistent mit Beitragsoptionen in AI-Leiste-Plaloyer und -DAIS 3. Sampleurai-Abschnitte und -Maustaten für Data-Destructoren und -DAIS [Features]: 1. Ersatzlogik und -Medienbibliothek für SaaS-Lernsystem und -DAIS 2. Ersatzlogik und -Kompetenzbibliothek für AI-Modulsystem und -DAIS 3. Ersatzlogik und -Kohortbibliothek für Data-Forschung und -DAIS [Features]: 1. Testlogik und -Medienbibliothek für SaaS-EAI-Plugin und -DAIS 2. Testlogik und -Kompetenzbibliothek für AI-Anlagen und -DAIS 3. Testlogik und -Kohortbibliothek für Data-Forschung und -DAIS [Use Cases]: 1. Versuchungsarbeit u. Verwaltung der Protokolle in nebenweisung des Gala-API und -DAIS 2. Trialarbeit und -Kompetenz in AI-Leistungseinheit und -DAIS 3. Trialablage und -Quelle für Data-Auswertung und -DAIS
Kriterienaufschlüsselung
- Gateway zu AI-Providern mit Multi-Routing-Kapazität
- Verwaltung und Versionierung von Prompten
- Logbuch, Spuren und Analysen zur Nachverfolgbarkeit von Anfragen
- Semantic-Caching und Wiederholungen
- Überwachung der Eingaben und Ausgaben durch Vorgabe-Schwellen
- Mitarbeiter-Dashboards zur Verwendung und Kostenüberwachung
Relari (YC W24)
Plattform für Testing, Bewertung und generierte synthetische Daten für KI-Agenten.

Relari ist eine Entwicklerplattform, die sich auf die Verbesserung der Zuverlässigkeit von KI-Agenten durch systematische Tests und Evaluierung konzentriert. Sie hilft Teams dabei, synthetische Datensätze zu erstellen, automatisierte Evaluierungen durchzuführen und die Leistung von Agenten in realistischen Szenarien zu bewerten, bevor sie in die Produktion gehen. Gestützt auf Y Combinator (W24) richtet sich Relari an Engineering-Teams, die komplexe LLM-Anwendungen und mehrstufige Agenten entwickeln, bei denen traditionelle QA- Methoden nicht ausreichen. Das Tooling zielt darauf ab, die Sorgfalt der Softwareentwicklung - Unit-Tests, Regressionstests und messbare Metriken - auf nicht-deterministische KI-Systeme zu übertragen. Die Plattform unterstützt benutzerdefinierte Evaluatoren, Szenariosimulationen und kontinuierliche Überwachung, was sie sowohl für die Validierung vor dem Launch als auch für die laufende Qualitätssicherung von Produktionsagenten nützlich macht.
Kriterienaufschlüsselung
- Synthetische Datenbankerzeugung
- Automatisierte Agentenevaluierungspipeline
- Szenario- und Gesprächssimulation
- Konfigurierbare Bewertungsmetriken
- Regressionstest für LLM-Anwendungen
- Leistungsbewertung und -berichterstattung

Arize AI
Eine Plattform für AI-Beobachtbarkeit und Bewertung von LLM, die Softwareentwicklern und Datenwissenschaftlern bei der Überwachung, Fehlersuche und Verbesserung der Leistung von AI-Anwendungen hilft.

Arize AI ist ein AI-Betrachtungs- und LLM-Bewertungsplattform. Es unterstützt AI-Entwickler und Data Scientists dabei, ihre AI-Modelle zu überwachen, zu problematisieren und zu optimalisieren. Die Plattform bietet Werkzeuge zum Identifizieren von Problemen und Vorschlägen für Lösungen, was es Nutzern ermöglicht, die Genauigkeit und Zuverlässigkeit ihrer Modelle zu verbessern. Arize AI ist für AI-Entwickler und Data Scientists gedacht, die ihre Modelle optimieren möchten. Die Plattform bietet Funktionen zur Überwachung und Fehlerbehebung, wodurch Nutzer Probleme schnell identifizieren und beheben können. Arize AI bietet außerdem Funktionen zum Evaluieren und Verbessern der Modellleistung, was es Nutzern ermöglicht, ihre Modelle im Laufe der Zeit zu verfeinern. Durch die Verwendung von Arize AI können Nutzer sicherstellen, dass ihre AI-Modelle optimal laufen, was zu besseren Entscheidungsfindungen und Ergebnissen führt. Die Schwerpunkt auf Betrachtbarkeit und Bewertung setzt Arize AI von anderen AI-Entwicklungstools ab, macht es jedoch zu einem wertvollen Ressourcen für diejenigen, die mit großen Sprachmodellen und anderen komplexen AI-Systemen arbeiten.
Kriterienaufschlüsselung
- Überwachung von KI-Modellen
- Troubleshooting und Identifizierung von Problemen
- Erstellung von Vorschlägen für Reparaturen
- Beurteilung der Modellleistung
- Auswertung und Optimierung von LLMs

Edwin AI
KI-Agent für IT-Betrieb, der den Einbruch von Eintrittsanfragen, -forschung und -lösung beschleunigt.

Edwin AI ist ein KI-Agent für IT-Operationen, der sich darauf spezitialisiert, die Eintrittsanfragenuntersuchung, -forschung und -lösung zu beschleunigen. Es bietet eine zentrale Plattform für IT-Teams, um Eintrittsanfragen zu erforschen, ihren Eintrag zu verstehen, Lösungen zu finden oder zu generieren und sie über bestehende Werkzeuge ohne Wechsel zwischen Systemen anzuwenden. Edwin AI korreliert Eintrittsanfragen, Identifiziert die Ursachen und initiieren Automatisierung der Abhilfe ab dem ersten Eintrittsanfragen bis hin zur bestätigten Lösung. Sie verwendet historische Muster und Beobachtungsdaten, um Vorhersagen und Abhilfe von Ausfällen vorzunehmen. Der Werkzeug korreliert mit mehr als 3.000 Werkzeugen in Beobachtbarkeit, APM, Sicherheit und CMDB, und bietet Echtzeit- und Handlungsinsights, und beseitigt Silos. Eine Studie der Forrester-Stiftung fand heraus, dass das Produkt das 313-%-R.O.I. für eine composite Organisation lieferte, mit einem Tilgungszeitraum von weniger als 6 Monaten.
Kriterienaufschlüsselung
- Alarmkorrelation und Reduzierung des störenden Geräuschs
- KI-gesteuerte Vorschläge zur Ursachenidentifizierung
- Natur-sprachliche Zusammenfassungen von Eintrittsanfragen
- Integrationsmodule für IT-Service-Managementplattformen und Beobachtbarkeitsplattformen
- Automatisierte Triage-Workflows
- Wissenserwerb durch Vergleichung mit Vergangenheitseintritten


FoundryAI ist eine Entwicklungsplattform, die sich auf die Erstellung von KI‑Agenten konzentriert, die reale Geschäftsabläufe abwickeln. Sie kombiniert Werkzeuge für das Agenten‑Design, das Testen und die kontinuierliche Verbesserung, sodass Teams vom Prototyp zur Produktion wechseln können, ohne separate Systeme zusammenzuschustern. Die Plattform legt den Schwerpunkt auf Evaluierung und bietet Entwicklern Möglichkeiten, die Leistung von Agenten anhand definierter Aufgaben zu messen und das Verhalten im Laufe der Zeit zu verfeinern. Das macht sie für Unternehmen geeignet, die den Kundenservice, interne Abläufe oder repetitive Wissensarbeit automatisieren und dabei auf Zuverlässigkeit angewiesen sind. FoundryAI richtet sich an technische Teams, die mehr Kontrolle benötigen als No‑Code‑Builder ermöglichen, aber eine schnellere Iteration wünschen, als wenn man Agenten komplett von Grund auf entwickelt.
Kriterienaufschlüsselung
- Agentenbauumgebung
- Evaluations- und Testwerkzeuge
- Leistungsmontiering
- Unterstützung für die Automatisierung von Abläufen
- Schleifen zur iterativen Verbesserung
- Integration mit Geschäftssystemen






