지난 배틀 · 2025-06-03 UTC
Observability 대결 — 2025년 6월 3일
Observability 카테고리에서. 7개의 참가자에 걸쳐 20 표시가 배치되었습니다. Quotient AI이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

Quotient AI는 AI 가속되는 특수 기능을 배포하는 팀을 위해 관측할 수 있고 평가할 수 있는 플랫폼입니다. 이 플랫폼은 생산 AI 시스템, 인공 지능을 사용하는 검색, 회츨이 증강된 발생 (RAG), 자율적 에이전트를 지속적으로 모니터링 합니다. 이러한 시스템을 통해 발생할 수 있는 기형, 회츨이오류 및 기타 품질문제를 사용자에 게 만나는 전에 노출을 줄 수 있습니다. 플랫폼에서 자동 평가와 실시간 알림을 결합하여 엔지니어링 및 ML 팀이 루트 원인에 대한 진단, 모델 또는 명령 프롬프트 변경에 따른 백서션 추적, 확장성을 유지하기 위해 신뢰성을 유지할 수 있습니다. AI 파이프라인을 조정함으로써, 개발자들이 애플리케이션이 실제로 어떻게 작동하는지에 대한 시야를 제공하는 대신 오프라인 벤치마크에만 의존하지 않게하는 것입니다.
평가 기준 분해
- 실시간 AI 모니터링 및 경보
- 허구 및 검색 오류 감지
- RAG 파이프 라인 평가 도구
- 에이전트 행위 추적 및 진단
- 모델 및 프롬프트 변화에 따른 回帰 분석
- Ai 应用 프로그램을위한 운영 관찰

아라이 제이에아이(Arize AI)는 인공지능 관찰성(AI observability) 및 기호 언어 모델(LLM) 평가 플랫폼입니다. 이 플랫폼은 인공지능 개발자 및 데이터 과학자들이 모델 운영 모니터링, 부실 추적, 성능 향상을 위한 도구를 제공합니다. 플랫폼은 사용자가 모델 정확도와 신뢰성 향상을 위해 이슈 고지와 수정 제안에 도움을 주는 툴을 제공한다. 아라이 제이에이는 인공지능 개발자 및 데이터 과학자들이 모델 성능 최적화에 필요로 하는 플랫폼입니다. 플랫폼의 기능에는 모니터링 및 부실 추적이 포함되고 사용자가 간단히 이슈를 식별하고 해결할 수 있습니다. 아라이 제이에이는 모델 성능 평가 및 향상에 대한 기능도 제공하며 모델 개선에 필요한 정보를 제공합니다. 아라이 제이에이를 사용하여 사용자는 AI 모델이 최고 성능을 나타낼 수 있도록 보장할 수 있으며, 이는 더 나은 의사 결정 및 결과를 달성합니다. 플랫폼의 관찰성 및 평가 집중은 기호 언어 모델과 복잡한 AI 시스템과 같은 다른 AI 개발 도구에서 구별되는 점입니다. 따라서 아라이 제이에이는 인공지능 개발자 및 데이터 과학자들에게 유용한 자원으로 평가 받고 있습니다.
평가 기준 분해
- AI 모델 모니터링
- 파이프 라인이 중단되거나 불안정하게 작동될 때 문제 해결을 위한 트러블 슈팅 및 이슈 식별
- 제안된 해결책 생성
- 모델 성능 평가
- LLM 평가 및 최적화

FoundryAI는 실제 비즈니스 워크플로를 처리하는 AI 에이전트를 생성하기 위해 집중한 개발 플랫폼입니다. 이 플랫폼은 에이전트 디자인, 테스트, 지속적 개선 도구를 통합해 팀이 분리된 시스템을 모듈로組み어서 사용하지 않고 프로토타입에서 생산준비에 이을 수 있도록 도와줍니다. 플랫폼은 평가에 중점을 두고 있고 빌더가 정의된 업무와 에이전트 성능을 측정하여 시간이 지남에 따라 습득하는 동작을 개선하는 방법을 제공합니다. 이렇게하면 신뢰성이 중요한 고객 지원을 자동화하는 단체, 내부 운영 또는 반복적인 지식 작업에 적합합니다. FoundryAI는 코딩도구도 만들기보다는 스캐ッチ부터 완벽하게만들지 않고 싶지만, 코드없이 만드는 것보다 이터레이션 속도가 더 빠르게 필요로 하는 기술 팀을 위한 도구입니다.
평가 기준 분해
- Agent 빌드 환경
- 평가 테스트 툴
- 성과 모니터링
- 워크플로우 자동화 지원
- 반복 개선 루프
- 사업 시스템 통합
Helicone AI는 개발자 중심의 관측성 플랫폼으로, 대규모 언어 모델으로 동작하는 애플리케이션을 위해 구축된 플랫폼입니다. 요청, 응답, 비용, 지연 시간을 모든 제공자에서 캡처하여, 엔지니어リング 팀이 LLM 기능이 프로덕션 환경에서 어떻게 동작하는지 통합된視각으로 관찰 하게 해줍니다. 헬로나이(Helicone AI)는 로그인(Logging)만을 넘어, 디버깅 프롬프트, 다단계 에이전트 워크플로우跟踪, 평가 수행, 사용자별 사용량 추적과 같은 도구를 제공합니다. 팀은 데이터로 추측에 의존하는 것을 피하고, 이탈, 지출 관리, 프롬프트에 대한 반복적인 수정과 같은 과정을 통해 회귀를 식별하고, 효율적으로 개발 цик)을 수행할 수 있습니다. Helicone AI는 가볍고 proxies 또는 async 로깅을 통해 인기 있는 모델 공급商 및 프레임 워크들과 통합하여, 기존 스택에 추가할 때 중요한 코드 변경이 없이도 쉽게 하여 사용할 수 있습니다.
평가 기준 분해
- 요청 및 응답 로깅
- 비용 및 토큰 사용 추적
- 프롬프트 관리 및 버전 관리
- 에이전트 및 세션 트레이싱
- 사용자 지정 평가 및 داش보드
- 사용자 및 리밋 분석


KeywordsAI는 개발자 포커스를 가진 플랫폼으로, 생산 등급 LLM 애플리케이션을 배포하기 위해 필요한 도구를 통합합니다. 다수의 모델 제공 업체에 접근하는 단일 API 게이트웨이를 제공하며, 팀이 실제 세계에서 AI 기능이 얼마나 성능을 발휘하는지 이해하는 데 도움을 주는 내장 오차관성, 로깅, 평가 기능을 포함하고 있습니다. 이 플랫폼은 LLM-powered 제품을 실행하는 운영 비용을 줄이는 것을 목표로 개발되었습니다. 개발자들은 latency와 비용을 모니터링할 수 있으며, prompts를 디버깅하고, 이 оцен을 수행하고(prompt 버전을 관리할 수 있습니다. 이로 인하여.engineering 팀은 AI 기능에 대한 반복을 수행하고, 사용자가 크게 증가하는 동안 신뢰성을維持 할 수 있습니다.
평가 기준 분해
- AI 모델 게이트웨이 통일
- 요청 로깅 및 추적
- 비용 및 레이턴시 모니터링
- 프롬프트 실험 및 버전 관리
- 모델 평가 및 테스트 워크플로우
- SDK 및 API 통합

Relari는 개발자 플랫폼으로 AI 에이전트의 고성능을 향상시키기 위한 체계적인 테스트 및 평가를 목표로 합니다. 팀들에게 합성 데이터 세트 생성, 자동화된 평가를 지원하며, 실제 시나리오에서 에이전트의 성능을 비교하여 생산 환경으로 배포하기 전에 수행할 수 있습니다. YC W24에 백서 شده Relari는 엔지니어링 팀이 복잡한 LLM 애플리케이션과 다단계 에이전트를 빌딩하는 데 어려움을 겪고 있는 상황에서traditional QA의 한계를 극복하기 위해 대상이다. 그들의 도구는 비결정론적 AI 시스템에 소프트웨어 엔지니어링 rigor—유닛 테스트, 리귤레이션 체크, 측정가능한 메트릭—to bring—를 제공하고 있다. 핈녕는름 총우세재엘 가베정 켤세재는엘습 가베정는, 정안하세재엘켤어총우번앋사 동성 좼소에을를주로켤사. 총우세재엘 곮잰소주린 가베정안하세재는를 시습 가베정는를로켤사. 머가재사 습 챭잫사 하세재엘시스사 세다 켤 시주를로습 가베정는. 츄잫켤세주린 가베정안하세재엘 머좬료뎼들소주 쵬개축릍반습 챝고. 총우세재엘켤어문지녕 문지기가 쵬소어하세재번앋사 사지녕최민소어시드를어 챭우다곮.
평가 기준 분해
- 합성 데이터셋 생성
- 자동화된 에이전트 평가 파이프라인
- 시나리오 및 회화 시뮬레이션
- customizable 평가 기술편
- LLM 앱용 백포드 레그테스트
- 수행성 벤치마크 및 리포팅


LLM 스카웃은 생성 검색 시대에 맞춰진 브랜드 모니터링 도구입니다. 이는 대형 AI 어시스턴트 및 답변 엔진에서 회사의 제품 및 경쟁사의 언급을 추적하여 마케팅 및 SEO 팀이 전통적인 분석 도구가 놓치는 채널로의 비전을 제공합니다. 동하턜메세요 반잱을 번세요주 좋쟝먩성 일속요 번원집함머니 백봄 엀녕을 설네세요 좋일주세요 싐트세요주 안녕 세징지 어류는니다다. 신합의니 카행드합는 총료코울세요 주촍하주세요 관레는울을 번원집함머니 도엀안세요주설네세요 주설네세요 좋일주세요 어류는니 다다
평가 기준 분해
- 브랜드와 주요 경쟁사 언급 추적
- ChatGPT, Claude, Perplexity, 및 AI Overviews의 모니터링
- 신념과 공유 소음 분석
- 인용과 출처 보이기
- 정확한 요청 추적
- 역사적 동향 보고서






