지난 배틀 · 2024-01-11 UTC
Observability 대결 — 2024년 1월 11일
Observability 카테고리에서. 10개의 참가자에 걸쳐 40 표시가 배치되었습니다. Quotient AI이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

Quotient AI는 AI 가속되는 특수 기능을 배포하는 팀을 위해 관측할 수 있고 평가할 수 있는 플랫폼입니다. 이 플랫폼은 생산 AI 시스템, 인공 지능을 사용하는 검색, 회츨이 증강된 발생 (RAG), 자율적 에이전트를 지속적으로 모니터링 합니다. 이러한 시스템을 통해 발생할 수 있는 기형, 회츨이오류 및 기타 품질문제를 사용자에 게 만나는 전에 노출을 줄 수 있습니다. 플랫폼에서 자동 평가와 실시간 알림을 결합하여 엔지니어링 및 ML 팀이 루트 원인에 대한 진단, 모델 또는 명령 프롬프트 변경에 따른 백서션 추적, 확장성을 유지하기 위해 신뢰성을 유지할 수 있습니다. AI 파이프라인을 조정함으로써, 개발자들이 애플리케이션이 실제로 어떻게 작동하는지에 대한 시야를 제공하는 대신 오프라인 벤치마크에만 의존하지 않게하는 것입니다.
평가 기준 분해
- 실시간 AI 모니터링 및 경보
- 허구 및 검색 오류 감지
- RAG 파이프 라인 평가 도구
- 에이전트 행위 추적 및 진단
- 모델 및 프롬프트 변화에 따른 回帰 분석
- Ai 应用 프로그램을위한 운영 관찰


우에는 LLM 어플리케이션의 시각화를 보다 향상시키는 것을 도와주는 관찰성 및 평가 플랫폼입니다. 우에는 tracing, 메트릭 수집, 응답 평가를 위해 사용하는 LLM judge 및 사용자인코더를 구축하기 위해 다양한 도구를 제공합니다. 주요 기능은 tracing session, LLM call, tool call, 그리고 manual instrumentation of custom agent를 포함합니다. 플랫폼은 유명한 SDK 및 감시 장치와의 통합을 지원하며, 사용자 지정 에이전트 관찰성을 제공합니다. Weave 플랫폼 사용은 Python 및 TypeScript 라이브러리 제공을 통해 설치하고 사용할 수 있습니다. 플랫폼은 Weights & Biases (W&B)로 호스팅されており, W&B 계정 및 API 키가 인증을 위해 필요한 경우입니다. 사용자는 Weave UI에서 LLM으로의 호출을 추적하고, 입력과 출력을 검토하고, 에이전트 지표를 살펴볼 수 있습니다. Weave는 자동화와 LLM 애플리케이션의 평가를 지원하지만, 이름에서 상징하는대로 코드 없이 AI 워크플로우 빌더는 아니라는 점을 기억합니다.
평가 기준 분해
- 이진자리 추적 및 메트릭 수집
- 맞춤형 에이전트 observability
- LLM 추적 및 평가
- OpenTelemetry span 지원
- Weights & Biases (W&B) 통합
- 파이썬 및 타입스크립트 라이브러리

AgentOps는 AI 에이전트 생명주기에서 개발자 플랫폼으로서 tracing, monitoring, debugging 도구를 제공하여 실제로 에이전트가 Runtime에서 무엇을 하는지 노출해 준다. 이 도구는 LLM 호출, tool이 사용되는 방법, 비용, 오류를 기록하여 복잡한 다단계 워크플로우 내에서 에이전트 행동을 이해할 수 있도록 한다. AgentOps는 시각화를 넘어 세션 레플레이, 성능 분석 및 LangChain, CrewAI, AutoGen과 같은 인기 에이젠팩토리와의 통합을 제공하여 엔지니어들이 추측이나 로그 스큐핑에 의존하는 대신 prototype에서 production에 성공적으로 이동할 수 있는 가치 있는 데이터에 기반한 신뢰성을 보장할 수 있습니다. `AgentOps`는 개발자 및 팀에게 도움이되는 서비스로서, 에이전트 애플리케이션을 출시하고 출시전후 에이전트의 적절한 동작을 증명하고 습득 비용을 제어하는 것을 목표로합니다. 에이전트 애플리케이션의 후퇴를 추적하고 API, SDK와 같은 소프트웨어 개발을 위한 도구와 통합할 수 있기 때문에 regressions, costs control, correct LLM behavior tracking을 위한 도구와 같은 개발자를 타켓으로 하게 됩니다.
평가 기준 분해
- AI
- LLM API
- API
- API
- Python JavaScript SDK
- API

Confident AI는 대형 언어 모델 애플리케이션을 개발하는 팀의 평가 및 관찰성 플랫폼입니다. 오픈 소스 DeepEval Framework를 활용하여, 프롬프트, 모델 및 retrieval 파이프라인을 통해 벤치마크, 레그레션 테스트 및 품질 검사를 수행할 수 있는 하나의 통합 작업 공간을 제공합니다. 플랫폼은 엔지니어들에게 선결제품(shipment) 전에도 미신경증(hallucinations), 동의어 오류(prompt regressions), 데이터 수집 실패(retrieval failures)를 감지 하도록 도와줍니다. 또한, 실제 사용자의 상호작용(tracks real user interactions)을 감시하며, 상호작용을 모니터링(production monitoring)합니다. 팀은 데이터 세트(Datasets)를 통합_centralize), 테스트 결과를 공유(share test results), 미리 준비된 프롬프트에 대한 피드백(measurable feedback)으로 프로세스를 반복하여 추측(pure guesswork)를 제거합니다. 개발자, ML 엔지니어 및 QA 팀이 대량 텍스트 모델의 품질보증에 구조화된 메트릭 기반 접근법을 원하는 경우가 많습니다. 이들은 ad-hoc的手동 검토를 대신하여 정교한, 통계적으로 지적되는 접근법이 더 필요합니다.
평가 기준 분해
- DeepEval 파워드 평가 메트릭
- 추론지시어와 모델에 대한 레그레션 테스트
- RAG 및 retrieval 평가
- 프로덕션 추적 및 모니터링
- 셋 데이터 및 테스트케이스 관리
- 평가 결과에 대한 팀 협력


Fiddler AI은 기업 플랫폼으로써 프로덕션에서 작동하고 있는 머신 러닝 모델과 생성적 인공지능 애플리케이션을 모니터링, 분석, 보안하기 위한 팀을 위한 도구입니다. 이를 통해 모델 성능, 데이터 드리프트, 편향, 품질 문제에 대한 내러티브를 제공하며, 또한 LLM에 특유한 위험 요인을 방지할 수 있는 안전한 보증을 제공합니다. 이러한 위험 요인은 허구, 입력 지시, 불안전한 출력과 같은 것입니다. AI ML 엔지니어, 데이터 과학자 및 위험 담당 직원들에게 설계된 툴인 Fiddler는 설명可能性, 실시간 모니터링 및 사양 수호자를 하나의 작업흐름에 결합하는 것을 목표로している. Fiddler는 일반 ML 파이프라인과 클라우드 환경을 통합해 조직들이 대규모로 책임 있는 AI慣習들을 작영화화하는 데 도움을 주고 있다.
평가 기준 분해
- 모델 성능 및 드리프트 모니터링
- LLM 홀루케이션 및 안전 감지
- 프롬프트 주입 및 자이브레이크 보호
- 설명가능한 AI 및 루트 원인 분석
- 편향 및 공정성 평가
- 생산 AI를 위한_dashboard 및 경보

포트키(Portkey)는 AI 애플리케이션 빌딩, 관리 및 모니터링 데스크탑을 제공하는 통합 제어 평면입니다. 이 플랫폼은 AI 팀에 대한 통합 API를 통해 1,600 이상의 LLM을 사용할 수 있도록 해주며, 모델 통합의 과정을 단순화하고 AI 팀의 빌딩에 초점을 맞추는 데 도움을 주는 통합된 플랫폼입니다. 플랫폼은 사용자에게 실시간 관찰 가능성을 제공하는 데 도움이 되는 guardrail, 관할, 프로ンプ트 관리 등 다양한 기능을 제공합니다. 포트키(Portkey)는 캐싱 기능을 제공하여 사용자가冗余 테스트를 줄이고 тысяч 수의 달러를 절약할 수 있습니다. 포트키(Portkey)는 AI 팀에게만 설계되었으며 3,000개 이상의 GenAI 팀이 사용하고 일일 토큰 처리량이 매우 큽니다.
평가 기준 분해
- 200개 이상의 LLM 공급업체에 대한 단일 API를 제공하는 AI 게이트웨이
- 지문 관리 및 버전 관리
- 요청 로그, 트레이스 및 분석
- 의미 있는 캐싱 및 리트라이
- 입력 및 출력 검증에 대한 지문
- 사용 및 비용 모니터링 데스크톱

Relari는 개발자 플랫폼으로 AI 에이전트의 고성능을 향상시키기 위한 체계적인 테스트 및 평가를 목표로 합니다. 팀들에게 합성 데이터 세트 생성, 자동화된 평가를 지원하며, 실제 시나리오에서 에이전트의 성능을 비교하여 생산 환경으로 배포하기 전에 수행할 수 있습니다. YC W24에 백서 شده Relari는 엔지니어링 팀이 복잡한 LLM 애플리케이션과 다단계 에이전트를 빌딩하는 데 어려움을 겪고 있는 상황에서traditional QA의 한계를 극복하기 위해 대상이다. 그들의 도구는 비결정론적 AI 시스템에 소프트웨어 엔지니어링 rigor—유닛 테스트, 리귤레이션 체크, 측정가능한 메트릭—to bring—를 제공하고 있다. 핈녕는름 총우세재엘 가베정 켤세재는엘습 가베정는, 정안하세재엘켤어총우번앋사 동성 좼소에을를주로켤사. 총우세재엘 곮잰소주린 가베정안하세재는를 시습 가베정는를로켤사. 머가재사 습 챭잫사 하세재엘시스사 세다 켤 시주를로습 가베정는. 츄잫켤세주린 가베정안하세재엘 머좬료뎼들소주 쵬개축릍반습 챝고. 총우세재엘켤어문지녕 문지기가 쵬소어하세재번앋사 사지녕최민소어시드를어 챭우다곮.
평가 기준 분해
- 합성 데이터셋 생성
- 자동화된 에이전트 평가 파이프라인
- 시나리오 및 회화 시뮬레이션
- customizable 평가 기술편
- LLM 앱용 백포드 레그테스트
- 수행성 벤치마크 및 리포팅

아라이 제이에아이(Arize AI)는 인공지능 관찰성(AI observability) 및 기호 언어 모델(LLM) 평가 플랫폼입니다. 이 플랫폼은 인공지능 개발자 및 데이터 과학자들이 모델 운영 모니터링, 부실 추적, 성능 향상을 위한 도구를 제공합니다. 플랫폼은 사용자가 모델 정확도와 신뢰성 향상을 위해 이슈 고지와 수정 제안에 도움을 주는 툴을 제공한다. 아라이 제이에이는 인공지능 개발자 및 데이터 과학자들이 모델 성능 최적화에 필요로 하는 플랫폼입니다. 플랫폼의 기능에는 모니터링 및 부실 추적이 포함되고 사용자가 간단히 이슈를 식별하고 해결할 수 있습니다. 아라이 제이에이는 모델 성능 평가 및 향상에 대한 기능도 제공하며 모델 개선에 필요한 정보를 제공합니다. 아라이 제이에이를 사용하여 사용자는 AI 모델이 최고 성능을 나타낼 수 있도록 보장할 수 있으며, 이는 더 나은 의사 결정 및 결과를 달성합니다. 플랫폼의 관찰성 및 평가 집중은 기호 언어 모델과 복잡한 AI 시스템과 같은 다른 AI 개발 도구에서 구별되는 점입니다. 따라서 아라이 제이에이는 인공지능 개발자 및 데이터 과학자들에게 유용한 자원으로 평가 받고 있습니다.
평가 기준 분해
- AI 모델 모니터링
- 파이프 라인이 중단되거나 불안정하게 작동될 때 문제 해결을 위한 트러블 슈팅 및 이슈 식별
- 제안된 해결책 생성
- 모델 성능 평가
- LLM 평가 및 최적화

EDWIN AI는 IT 운영에 특화된 인공지능 एज런트로, 사건 감지, 조별 분류, 및 해결 속도를 빠르게 합니다. IT 팀은 중앙 플랫폼을 통해 사건을 조사할 수 있고, 그들의 영향 파악, 고치거나 발생한 고치는 기존 툴을 통하여 적용할 수 있습니다. 툴변경이 필요 없습니다. EDWIN AI는 알람들을 상호关联하고, 근본원인 구분 및 자동적인 치료를 시작하여, 최초의 알람부터 검증된 해결까지를 자동화한다. 역사의 패턴 및 관찰가능성 데이터를 이용하여, 시스템다운을 예측 및 막는다. 툴은 옵서버블리티, APM, 보안 및 CMDB과 3,000개 이상의 툴을 통합하고, 실시간으로 구체적이고 행동력 있는 통찰력을 제공하고, 벽을 없애준다. Forrester 연구에 따르면, EDWIN AI는 합성 조직에서 313%의 ROI를 제공하고 있으며, 6개월 이내에 회수기간이 있다고 밝혔다.
평가 기준 분해
- 경보 통합과 잡음 감소
- AI 기반 근본 원인 제안
- 자연 언어 사고 요약
- ITSM 및 관찰성 플랫폼과 통합
- 자동 분류 워크플로
- 과거 사고에서 지식 축적

FoundryAI는 실제 비즈니스 워크플로를 처리하는 AI 에이전트를 생성하기 위해 집중한 개발 플랫폼입니다. 이 플랫폼은 에이전트 디자인, 테스트, 지속적 개선 도구를 통합해 팀이 분리된 시스템을 모듈로組み어서 사용하지 않고 프로토타입에서 생산준비에 이을 수 있도록 도와줍니다. 플랫폼은 평가에 중점을 두고 있고 빌더가 정의된 업무와 에이전트 성능을 측정하여 시간이 지남에 따라 습득하는 동작을 개선하는 방법을 제공합니다. 이렇게하면 신뢰성이 중요한 고객 지원을 자동화하는 단체, 내부 운영 또는 반복적인 지식 작업에 적합합니다. FoundryAI는 코딩도구도 만들기보다는 스캐ッチ부터 완벽하게만들지 않고 싶지만, 코드없이 만드는 것보다 이터레이션 속도가 더 빠르게 필요로 하는 기술 팀을 위한 도구입니다.
평가 기준 분해
- Agent 빌드 환경
- 평가 테스트 툴
- 성과 모니터링
- 워크플로우 자동화 지원
- 반복 개선 루프
- 사업 시스템 통합










