Минала битка · 2024-01-11 UTC
Observability Двубой — 11 януари 2024 г.
От категория Observability. 40 гласове поставени сред 10 бойци. Quotient AI грабна короната.
Финално класиране
Съставът
Бойците
Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

Quotient AI
Платформа за реално-временна надзор и оценка за изглед на проблеми при АИ, търсене, RAG и агенти.
Quotient AI е платформа за наблюдаване и оценяване, проектирана за тимове, които разпространяват AI-подобрени функции. Тя непрекъснато наблюдава производствените системи за AI, включително търсенето, генерацията на текст с помощ на RAG и независимите агенти, за да изложи въображенията, проблемите с получаването на данни и другите проблеми с качеството пред да ги срещнат потребителите в края. Платформата комбинирва автоматизирани оценки с предизвикващи реално събития оповестявания, помагайки на екипите по инжинироване и ML да диагностицират коренните причини, да следят за регресии при промените на модела или стимулите, и да поддържат надеждност на масово мащаб. Чрез инструментиране на pipeline на AI-машиноум, Quotient дава на разработчиките възможност за визуализиране на какво действително се случва с техните приложения в реалния свят въпреки на полагането на тъстове само на offline показатели.
Разбивка на критериите
- Реално-временна мониторинг на АИ и алармиране
- Распознаване на съмнение и грешки при извличане
- Ордър за оценка за пайплайни на RAG
- Тракинг и диагностика на поведение на агенти
- Анализа на регресия чрез изменения на модела и импулса
- Разчетност на производство за AИ приложения

Weave
Едно кодова платформа за построяване на AI workflow, която позволява компаниите да автоматизират операциите си, интегрирайки множество great language models (LLMs) и свързвайки запитвания без затруднения...

W&B Weave е платформа за наблюдение и оценка, която помага при отслежване и подобряване големи приложения с голяма речева модел (LLM). Weave предоставя инструменти за следене, събиране на показатели и оценка на отговорите на приложението чрез LLM съдии и състезатели с персонализирани оценки. Ключовите характеристики включват следене на сесии, LLM повиквания и извиквания на инструмени, както и ръчна конфигурация на кастомни агенти. Платформата поддържа интеграции с популярни SDKs и харесери, както и персонализирана агентска наблюдаемост. Weave предоставя библиотеки за Python и TypeScript за инсталиране и използване на платформата. Тя се хоства от Weights & Biases (W&B), изисква достъп до профил на W&B и ключ за аутентификация чрез API. Потребителите могат да проследяват извиквания на LLMs, да преглеждат входната и изходната информация и да виждат метриките на агентите в интефакс на Weave. Въпреки че Weave улесняваш автоматизацията и оценяването на приложенията на LLM, то не е многокодово конструктор за AI потоци, както предполага името му.
Разбивка на критериите
- Колекция на агентни метричести и следене
- Personalizирани наблюдаваеми агенти
- Наблюдаване и оценка на LLM
- Подподдръжка на OpenTelemetry span
- Вградени интеграции с Weights & Biases (W&B)
- Python и TypeScript библиотеки
AgentOps
Платформа за наблюдимост и отлежване на бъдещите за създаване на надеждни AGENTI за AI

AgentOps e платформата за разработчици, фокусирана в жизнения цикъл на AI агенти, предоставящ разширения за отслежване, мониторинг и отговаряне на грешки, които представят както действат агентите в реално време. Събира също съобщенията на LLM, използването на инструменти, разходите и грешките, така че тимовете могат да разберат поведението на агентите по сложни и множества хубовита процеси. След като обиколи видимостта, екипът AgentOps предлага изтритие на сесията (replay), аналитика и изпълнение на по-логически програми (analytics), както и интеграция с популярни фреймворки за агенти като LangChain, CrewAI и AutoGen. Това помага инженерите да преминат от прототип до производствена версия съществено по надеждно, а не да се съ 度ят върху заложено предположение или филтриране на логики за отчитане. Това наново е предназначено за разработчици и отбори, които изпращат агенциални приложения и имат нужда да следят за регресии, контролират разходите и доказват, че техните агенти се поведат така, както трябва преди и след деплояването.
Разбивка на критериите
- Записване и отлежване на сесите на агентите
- Търсене и отлежване на извикванията на LLM и използваните инструменти
- Анализа на сметките и потрошени токени
- Детекция на грешки и провала
- API-инструменти за Frameworks за Python и JavaScript
- Навигатори за метрици за извявяне на извивеността на агентите
Confident AI
Платформа за оценка на LLM, построена върху DeepEval за тестване, мониторинг и подобряване на приложения за изкуствен интелект.

Confident AI е платформа за оценка и наблюдаемост за отбори, които разработват приложения на базата на големи езикови модели. Водена от открито-източния кадър DeepEval, тя предлага обединено работно пространство за изпълнение на бенчмарки, регресионни тестове и проверки на качеството през промпти, модели и тревелни куки. Платформата помога на инженерите да откриват халюцинации, регресии и сбой в извличането преди изпращането, като предлага и проследяване на производството за отчитане на реалните взаимодействия с потребителите. Екипите могат да обединяват набори от данни, споделят резултати от тестване и да правят промени в подбудите с меримо обратна връзка, вместо да правят догадки. Той е предназначен за разработчици, инженери по МЛ и тимове за качество, които желаят структуриран, измерим подход към гарантиране на качеството на LLM, вместо ад-хок ръчен преглед.
Разбивка на критериите
- Метрики за оценка, задвижвани от DeepEval
- Регресионно тестване за промпти и модели
- Оценка на RAG и търсене
- Отслежване и мониторинг на производство
- Управление на набори от данни и тестови случаи
- Сътрудничество на екипа върху резултатите от оценката

Fiddler AI
Платформа за наблюдение и сигурност на AI за monitorirane, обяснения и управление на приложенията на ML и LLM.

Фидлер АИ е бизнес платформа, която помага тимовете да следят, анализират и поддържат безопасността на машинните обучителни модели и апликации за генеративен АИ в произволен режим. Тя предлага прозрачност в изпълнение на модела, възможност за дрейф на данните, предразсъдъчен образец и проблемите със качеството, както и безопасни защити срещу рискове, специфични за LLM като галванизация, вливане на стимул, и небезопасното извлекване от данните. Намерен за инженери по ML, учени по данни и отбори за рискове и поддържане на изпълнение на закони, Fiddler съчетава обяснителност, реално време мониторинг и огради в единна работна среда. Интегрира се с обичайни пейсинове за ML и облакови средовирища, помагайки организици да изпълняват отговорни практики за AI на величина.
Разбивка на критериите
- Панели със следене на модела и дрейф на моделите
- Детекция на халвинация и безопасност на LLM
- Промяна и защита от външни намерения с инжекция на промоти
- Обяснение на AI и анализ на причините
- Оценка на съмнението и сбалансированост
- Панели със следене и uyar за AI в продукционен режим

Portkey
Единна контролна рамкова система, при която се създава, управлява и мониторира приложения AI

Portkey е обединен контролен план за създаване, управление и мониторинг на приложенията за интелигентен ум. Той предоставя пълноценна платформа за отбора на интелигентни системи да минат в производство, предоставяjąки функции като AI Gateway, Observability, Guardrails, Governance и Планове за Извикване. Платформата позволява на потребителите да притежават прехрана над 1,600 LLMs чрез обединен API, ускорена процеса за интегриране на модели и позволявайки отборите да се съсредоточат на създаването, а не на управлението. Portkey също така предлага прозрачно наблюдаване в реално време, позволявайки на потребителите да наблюдават поведението на LLM, да уловяват аномалиите рано и да управляват използването предпазващо. Понеже, платформата предлага вградени възможности за кеширане, които са показали, че могат да спасят потребителите хиляди долари чрез намаляването на преходните тестове. Portkey е проектирана за отбори от интелигентни системи и поддържа широк спектър от LLMs, с над 3,000 отбори на Ген. AI и голям брой токени, обработени денонощи.
Разбивка на критериите
- Главен вход за AI с множество провайдъри и роутинг
- Управление и версионироване на повели
- Забележки, следи, аналитики и логове
- Semantic кеш и retry
- Пласти за защита при влизане и излизане
- ДASHBOARD за наблюдение и контрол на разходите и употребата
Relari (YC W24)
Платформа за тестване, оценка и създаване на съответстващи данни за агенти AI.

Relari е платформата за разработчици, насочена към подобряване на надеждността на AI агенти чрез систематично тестироване и оценка. Тя помага на отборите да създават синтетични набори данни, извършват автоматични оценки и определят перформансите на агента преди изпращането му в производство. С подкрепата на компанията за стартапи Y Combinator (W24), насочва се към инженерски екипи, развиващи сложни приложения с използване на масивни слоеве нейронни мрежи (LLM) и множество стъпки агенти, където традиционната проверка за еrror не е подходяща. Наредбите му целта е да приложи изискванията на софтуерния инженеринг — единични тестове, регресионни проверки и измерими показатели — при системи с аири характеристики, използващи нейронни мрежи. Платформата поддържа custom evaluators, сценарий на симулация и непрекъсната мониторинг, което я прави полезна както за прелооншавна валидация, така и за постоянно сигурно състояние на производствени агенти.
Разбивка на критериите
- Генерация на съответстващи данни
- Автоматизирана оценена програмна схема за агенти
- Симулация и съседство на сцени и разговори
- Настройваеми оценителни метрици
- Протест на регресия за приложения на ЛЛМ
- Изчерпателна извозвестия и отчети за изпълнение

Arize AI
Платформа за наблюдение на ИИ и оценка на LLM, която помога на разработчиците на ИИ и учените данни да следят, отстраняват грешки и подобряват производителността...

Arize AI е платформа за наблюдаване на AI и оценка на LLM. Тя помага на разработчиците на AI и данните на учени за наблюдение, разбиране и подобряване на ефективността на нейните моделите на AI. Платформата предоставя инструменти за идентифициране на проблеми и предлагане на решения, помагайки потребителите да подобрят точността и надеждността на моделите си. Arize AI е проектирана за разработчиците на AI и данните на учените, които трябва да оптимизират ефективността на моделите си. Възможностите на платформата включват наблюдение и разбиране на проблема, което позволява бързо да се определат и да се решат проблеми. Arize AI също така предоставя функции за оценяване и подобряване на ефективността на модела, което позволява на потребителите да подобрят моделите им по време. Следвайки Arize AI, потребителите могат да се уверят, че моделите на AI на тях ефективно функционират, което води до по-добри решения и резултати. В съответствие със фокуса на платформата на наблюдаване и оценка, тя се различава от другите инструменти за развитие на AI, като прави една ценна ресурс за разработчиците на AI, които работят с големи модели на език и други сложни системи на AI.
Разбивка на критериите
- Monitorинг на моделите на интелектния съветник
- Решаване на проблемите и определение на причините
- Предложение на мнения за изправяне на проблемите
- Оценка на performansите на модела
- Оценка и оптимизация на модела на голяма база на данни (LLM)

Edwin AI
Агент за ИТ операции, който ускHEMA обажданията на инцидентите, класификацията и решаването им.

Edwin AI е интегриран извършителен агент за IT операции, дизайниран да улесни изолацията, тримасажа и изясняването на инциденти. предоставя centralized платформа на IT съставите за изследване на инциденти, за да намерят или създадат наемни фикси, и да бъдат приложени в съществуващите инструменти без да се претърпяват изменения между системи. Edwin AI корелейзира съобщения за тревога, идентифицира основни причини и тригерява аварийна лампа автоматично, започвайки от първата тревога до потвърдения рехабилирането. Следва от исторически модели и данни за наблюдимост за предпазване и предвидение на изключване. Инструментът интегрира с над 3 000 инструменти в областта на наблюдаването, APM, сигурността и CMDB, осигурявайки действайки в мъдрината, действителен изглед и премахване на изолации. Наблюдаването на Фортьер съобщи, че Edwin AI предоставил 313% ROI за обединен организационен състав, с периода на въръщане на инвестицията на 6 месеца или по-малко.
Разбивка на критериите
- Аutomатично корелефиране на аларми и намаляване на шума
- Предложения на коренните причини, управлявани от AI
- Натурално-езикови кратки сумаризации на инциденти
- Свързвания с платформи за ITSM и наблюдение на системи
- Автоматизирани роботи за класификация на инциденти
- Скъпиране на знания от изминали инциденти


Платформата FoundryAI е развитие на фокусирано намиране на AI агенти, които обслужват действителните бизнес протоколи. Съчетава инструменти за дизаин на агент, пробен процес и непрекъснат процес на подобряване, така че тимовете могат да преминат от прототип към производство без да съединяват отделни системи. Платформата се състои от изящественото оценяване, което дава създателите възможност да оценяват работата на агента според дефинирани задачи и да подобряват поведенето му през времето. Това го прави подходящ за организациите, които използват автоматизация за поддръжка на клиенти, вътрешни операции или повтарящи се задачи с познания, където също така е важно за надеждността. ФъндрайЕЙ има за цел техническите тимове, които имат нужда от повече контрол от този, който предлагат нискокодовите инструменти, но искат по-бързи експерименти, отколкото ако създават агенти изцяло от изначално.
Разбивка на критериите
- Образователен среда за създаване на агенти
- Инструменти за оценка и проверка
- Наблюдение върху изпълнението
- Поддръжка на автоматизацията на процеси
- Итеративни цикли на подобряване
- Интегриране със системи за бизнес






