Минала битка · 2023-12-27 UTC
Observability Двубой — 27 декември 2023 г.
От категория Observability. 30 гласове поставени сред 8 бойци. Fiddler AI грабна короната.
Финално класиране
Съставът
Бойците
Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

Fiddler AI
Платформа за наблюдение и сигурност на AI за monitorirane, обяснения и управление на приложенията на ML и LLM.

Фидлер АИ е бизнес платформа, която помага тимовете да следят, анализират и поддържат безопасността на машинните обучителни модели и апликации за генеративен АИ в произволен режим. Тя предлага прозрачност в изпълнение на модела, възможност за дрейф на данните, предразсъдъчен образец и проблемите със качеството, както и безопасни защити срещу рискове, специфични за LLM като галванизация, вливане на стимул, и небезопасното извлекване от данните. Намерен за инженери по ML, учени по данни и отбори за рискове и поддържане на изпълнение на закони, Fiddler съчетава обяснителност, реално време мониторинг и огради в единна работна среда. Интегрира се с обичайни пейсинове за ML и облакови средовирища, помагайки организици да изпълняват отговорни практики за AI на величина.
Разбивка на критериите
- Панели със следене на модела и дрейф на моделите
- Детекция на халвинация и безопасност на LLM
- Промяна и защита от външни намерения с инжекция на промоти
- Обяснение на AI и анализ на причините
- Оценка на съмнението и сбалансированост
- Панели със следене и uyar за AI в продукционен режим


Платформата FoundryAI е развитие на фокусирано намиране на AI агенти, които обслужват действителните бизнес протоколи. Съчетава инструменти за дизаин на агент, пробен процес и непрекъснат процес на подобряване, така че тимовете могат да преминат от прототип към производство без да съединяват отделни системи. Платформата се състои от изящественото оценяване, което дава създателите възможност да оценяват работата на агента според дефинирани задачи и да подобряват поведенето му през времето. Това го прави подходящ за организациите, които използват автоматизация за поддръжка на клиенти, вътрешни операции или повтарящи се задачи с познания, където също така е важно за надеждността. ФъндрайЕЙ има за цел техническите тимове, които имат нужда от повече контрол от този, който предлагат нискокодовите инструменти, но искат по-бързи експерименти, отколкото ако създават агенти изцяло от изначално.
Разбивка на критериите
- Образователен среда за създаване на агенти
- Инструменти за оценка и проверка
- Наблюдение върху изпълнението
- Поддръжка на автоматизацията на процеси
- Итеративни цикли на подобряване
- Интегриране със системи за бизнес

Quotient AI
Платформа за реално-временна надзор и оценка за изглед на проблеми при АИ, търсене, RAG и агенти.
Quotient AI е платформа за наблюдаване и оценяване, проектирана за тимове, които разпространяват AI-подобрени функции. Тя непрекъснато наблюдава производствените системи за AI, включително търсенето, генерацията на текст с помощ на RAG и независимите агенти, за да изложи въображенията, проблемите с получаването на данни и другите проблеми с качеството пред да ги срещнат потребителите в края. Платформата комбинирва автоматизирани оценки с предизвикващи реално събития оповестявания, помагайки на екипите по инжинироване и ML да диагностицират коренните причини, да следят за регресии при промените на модела или стимулите, и да поддържат надеждност на масово мащаб. Чрез инструментиране на pipeline на AI-машиноум, Quotient дава на разработчиките възможност за визуализиране на какво действително се случва с техните приложения в реалния свят въпреки на полагането на тъстове само на offline показатели.
Разбивка на критериите
- Реално-временна мониторинг на АИ и алармиране
- Распознаване на съмнение и грешки при извличане
- Ордър за оценка за пайплайни на RAG
- Тракинг и диагностика на поведение на агенти
- Анализа на регресия чрез изменения на модела и импулса
- Разчетност на производство за AИ приложения

Portkey
Единна контролна рамкова система, при която се създава, управлява и мониторира приложения AI

Portkey е обединен контролен план за създаване, управление и мониторинг на приложенията за интелигентен ум. Той предоставя пълноценна платформа за отбора на интелигентни системи да минат в производство, предоставяjąки функции като AI Gateway, Observability, Guardrails, Governance и Планове за Извикване. Платформата позволява на потребителите да притежават прехрана над 1,600 LLMs чрез обединен API, ускорена процеса за интегриране на модели и позволявайки отборите да се съсредоточат на създаването, а не на управлението. Portkey също така предлага прозрачно наблюдаване в реално време, позволявайки на потребителите да наблюдават поведението на LLM, да уловяват аномалиите рано и да управляват използването предпазващо. Понеже, платформата предлага вградени възможности за кеширане, които са показали, че могат да спасят потребителите хиляди долари чрез намаляването на преходните тестове. Portkey е проектирана за отбори от интелигентни системи и поддържа широк спектър от LLMs, с над 3,000 отбори на Ген. AI и голям брой токени, обработени денонощи.
Разбивка на критериите
- Главен вход за AI с множество провайдъри и роутинг
- Управление и версионироване на повели
- Забележки, следи, аналитики и логове
- Semantic кеш и retry
- Пласти за защита при влизане и излизане
- ДASHBOARD за наблюдение и контрол на разходите и употребата
Helicone AI
Всебирна платформа за наблюдение, отбелязване и усъвършенстване на производствени приложения с LLM.
Хеликейн е разпространителска платформа, съсредоточена върху разработчиците, създадена специално за приложения, използващи големи модела на езика. Тя записва издаваните запитвания, отговорите, разходите и задължителната задържаност из средата на провайдъри, осигурявайки създателските отбори обединение гледна точка за начина на нашия LLM характеристики се изявяват в производства. Нараствявайки над записите изходяше от тях, Helicone предлага инструменти за отгласни за изтребване на грешки, следене на потоци на агенти с множество етапа, изпълнение на оценки и отчитане на използване при потребителско ниво. Съвместителските екипировки могат да разпознаят регресии, управляват разходите и дават шанс да подготвят изстроя с данни без да полагат на голямата теория. Включва се в популярните доставчици на модела и фреймворки чрез лековеждаща среда за сървър или асинхронен лог, което прави добавянето му в съществуващи стъкло лесно, без необходимост от значителни модификации в кода.
Разбивка на критериите
- Регистриране на заявки и отговори
- Намиране и отслежване на експенсове и токени
- Управление и версия използване на предимства
- Следене и агент-сеансна трасировка
- Тактилни оценки и конзоли за dashboard
- Анализа на потребители и лимитиране на скорост за извеждане на данни

KeywordsAI
Единен платформен интерфейс за разработчиките за създаване, мониторинг и скалане на приложенията на LLM.

KeywordsAI е платформа, съсредоточена върху разработчиците, която събира инструментите, необходими за доставянето на производствени LLM приложения по стандарт. Предлага обща API врата за достъп до множество моделни провайдъри, както и вградени функции за наблюдение, логироване и оценка за да помага екипите да разберат как изискателите на AI функциите работят в действителния свят. Платформата е дизайнета, за да намали изпълнителното натоварване от експлоатация на производителствата, използващи LLM. Разработчиците могат да следят разточителността и разходите, отгледватят грешки при командите, изпълняват оценки, и управляват версиите на командите без да трябва да обединяват отделни инструменти. Това ги прави по-лесно за екипите по разработка да разработват AI функции и поддържат надеждност при намаляване на потребляването.
Разбивка на критериите
- Обединена връзка за LLM от повече провайдъра
- Дневни записи за заявки и трассировка
- Мониторинг на изтегляние и затъвеност
- Изпитване на промтове и контрол в версия
- Набори тестове за изпитване и оценка
- Интеграции с SDK и API

Maxim AI
Платформа от начало до край за оценяване, мониторинг и усъвършенстване на агенти AI

Maxim AI е платформа за разработчици, проектирана да осигури на сътрудничествата в екипи да разполагат с надеждни агенти за AI и приложения на моделите с голяма памет на масова обработка. Разработчиците използват Maxim AI за синтезиращо инженерство, оценка, наблюдаване и управление на данни, което позволява бързо подобряване на производството с измеримо качество. През платформата се осъществява оценка от автоматизации и хора като цяло за единствено модел и промпт, което позволява на инженерите да сравняват изходите, да откриват регресии и да следят провалите в произвеждането. Притежава дизайн, който е подходящ за сътрудничеството в рамките на функционални групи и се състои от процеси, които допускат както и сътрудничество между технически, така и не-технически стажери в процеса на тестване и оценка. Maxim обикновено се използва от екипи, създаващи консултанти чрез чат, копилоти, гласови агенти и множество етапен агентен поток, които необходимите константна изработка в променливи извиквания, модели и възпроизвеждащи въвеждането от потребителите.
Разбивка на критериите
- Промейлница за тестване и версии
- Автоматично оценяване на агенти и LLM
- Працюващите наблюдения и трасиране в производство
- Кураторство и управление на набори данни
- Събирателни работници и работници на човешки оценяване
- Подподкрепа за повече модели и провайдъра
Relari (YC W24)
Платформа за тестване, оценка и създаване на съответстващи данни за агенти AI.

Relari е платформата за разработчици, насочена към подобряване на надеждността на AI агенти чрез систематично тестироване и оценка. Тя помага на отборите да създават синтетични набори данни, извършват автоматични оценки и определят перформансите на агента преди изпращането му в производство. С подкрепата на компанията за стартапи Y Combinator (W24), насочва се към инженерски екипи, развиващи сложни приложения с използване на масивни слоеве нейронни мрежи (LLM) и множество стъпки агенти, където традиционната проверка за еrror не е подходяща. Наредбите му целта е да приложи изискванията на софтуерния инженеринг — единични тестове, регресионни проверки и измерими показатели — при системи с аири характеристики, използващи нейронни мрежи. Платформата поддържа custom evaluators, сценарий на симулация и непрекъсната мониторинг, което я прави полезна както за прелооншавна валидация, така и за постоянно сигурно състояние на производствени агенти.
Разбивка на критериите
- Генерация на съответстващи данни
- Автоматизирана оценена програмна схема за агенти
- Симулация и съседство на сцени и разговори
- Настройваеми оценителни метрици
- Протест на регресия за приложения на ЛЛМ
- Изчерпателна извозвестия и отчети за изпълнение





