Минула битва · 2023-12-27 UTC
Observability Протистояння — 27 грудня 2023 р.
З категорії Observability. 30 позначок поставлено серед 8 бійців. Fiddler AI здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

Fiddler AI
Аналітична платформа AI спостереження та безпеки для моніторингу, пояснення та керування aplikáciami ML і LLM.

Fiddler AI є підприємницькою платформою, яка допомагає командам монтувати, аналізувати та забезпечувати безпеки машинних навчальних моделей та генеративних мереж нейронних мереж, розміщених на виробництві. Вона забезпечує візуалізацію якості моделей, змінювання даних, упередженості та питань якості, а також пропонує захист від ризиків, пов’язаних із LLM, наприклад, галлюцинацій, втілення prompts та небезпечні виходи. Навдіяний для інженерів з машинного навчання, науковців даних і команд з ризику та забезпечення відповідності, Fiddler об’єднує наочність, ре-тайм-відслідковування та бар’єри в одному робочому процесі. Його інтеграція в звичайні лінії процесу машинного навчання та облаштованих навколо них навколишніх середовищ допомагає організації оперувати відповідальними практиками у сфері штучного інтелекту на величезних масштабах.
Розподіл критеріїв
- Моніторинг ефективності моделі та зміна даних.
- Детекція галюцинацій та безпеки LLM.
- Захист від втілення стимулів і нападу jailbreak.
- Пояснення AI та аналіз причин.
- Оцінка спрямованості та різниці.
- Дашборди та попередження для продукції AI.


FoundryAI – це платформа розробки, спрямована на створення агентів AI, які обробляють справжні бізнес-потоки роботизації. Вона поєднує інструменти дизайну, перевірки та постійної вдосконалення агентів, щоб команди змогли перейти від прототипу до виробництва без зшивки окремих систем. Платформа ґрUNTоці evaluation, надаючи будівельникам засоби оцінки виконуваності агента щодо заданих завдань і вдосконалення поведінки зі часом. Це робить її підійдящою для організаційних середовищ, які автоматизують підтримку клієнтів, внутрішні операції або повторні роботи зі знань, де дієвість має важливе значення. FoundryAI звертається до технічних команд, які потребують більшого контролю порівняно з будівництвом безконтактними будівельниками, але бажають швидше експериментувати ніж будувати агентів цілком зі зброєю з нуля.
Розподіл критеріїв
- Працівні середовища будівництва агентів
- Інструменти оцінювання та підтвердження
- Надзор за виконанням
- Підтримка автоматизації бізнес-сценаріїв
- Путівки для поступового покращення
- Інтерграція з бізнес-системами

Quotient AI
Платформа реального часу для моніторингу та оцінювання, що виявляє невдачі AI у пошуку, RAG та агентах.
Quotient AI — платформа спостереження й оцінки, розроблена під особливу увагу до команд, які створюють функції зі зусиллями штучного інтелекту. Вона постійно моніторить виробництво системи зі штучним інтелектом - в тому числі пошукову, отримання й генерацію за допомогою отримання даних (RAG), й автономні агенти - для виділення галюцинацій, помилок отримання даних й інших питань якості до тих пір, поки користувачі не зможуть потрапити на них. Платформа поєднує автомatisовані оцінки зі справжніми ввімкнутими попередженнями, допомагаючи командам з розвитку програми та AI роз'ясовувати причини виникнення проблем, слідкувати за регресією після зміни моделі чи запиту, та зберігати надійність масштабу. Інструментуючи pipelines AI, Quotient надає розробникам прозорість у тому, як їхні застосування насправді працювати на волах, а не залежати лише від офілайн бенчмарків.
Розподіл критеріїв
- Моніторинг AI в реальному часі та сповіщення
- Виявлення галюцинацій та помилок під час пошуку
- Інструменти оцінки RAG‑пайплайнів
- Відстеження поведінки агентів та діагностика
- Аналіз регресій при зміні моделі та підказок
- Спостережливість продуктивних AI‑додатків


Portkey є єдиним контрольним шаром для створення, керування та моніторингу AI‑додатків. Він забезпечує комплексну платформу, за яку AI‑команди переходять у продакшн, пропонуючи функції такі як AI Gateway, Observability, Guardrails, Governance та Prompt Management. Платформа дозволяє користувачам отримувати доступ до понад 1 600 LLM через єдиний API, спрощуючи процес інтеграції моделей та дозволяючи командам концентруватися на розробці, а не на управлінні. Portkey також забезпечує реальний час моніторингу, що дозволяє відстежувати поведінку LLM, виявляти аномалії на ранньому етапі та проактивно керувати використанням. Додатково платформа надає можливості кешування, що допомагає зекономити тисячі доларів, зменшуючи зайві тести. Portkey призначений для AI‑команд і підтримує широкий спектр LLM, з понад 3 000 GenAI‑команд та великою кількістю оброблених токенів щодня.
Розподіл критеріїв
- AI Gateway з багатопровайдерною маршрутизацією
- Керування та версіонування Prompt
- Журнали запитів, трасування та аналітика
- Семантичне кешування та повторні запити
- Guardrails для валідації входу й виходу
- Панелі моніторингу використання та витрат
Helicone AI
Повноціленна платформа спостереження для моніторингу, відлагодження та покращення роботи продуктивних застосунків із великими мовними моделями.
Helicone AI - це спеціально розроблений для розробників платформу спостереження, збудований для застосунків, які використовують великі мовні моделі. Цей продукт захоплює запити, відповіді, витрати та затримки за різними постачальниками, дозволяючи командам інженерів отримувати єдине уявлення про те, як їхні особливості мовних моделей працюють в процесах виробництва. У додовженні до логування Helicone пропонує інструменти для валідації промптів, слідкуванню за багатоступовими потоками роботи агента, виконанню оцінок та відслідковуванні індивідуального використання. Командам вдається ідентифікувати регресії, регулювати витрати та виконувати кроки щодо промптів на основі даних, а не за підозами. Господарює з популярними провайдерами моделей та фреймворками за допомогою легкосинхронного проксі або асинхронного запису лога, чим полегшує інтеграцію з існуючими стектами без необхідності глибоких змін коду.
Розподіл критеріїв
- Зарежування запитів та відповідей
- Надбання та облік витрат
- Управління запрошеннями та версіографія
- Трекінг агентів та сесій
- Додаткова оцінка та панелі керування
- Аналітика користувача та швидкісної обмеження

KeywordsAI
Єдина платформа розробників для побудови, спостереження та масштабування додатків LLM.

KeywordsAI є розробницькою платформою, яку спрямовано на інтеграцію всіх необхідних інструментів для забезпечення виробництва високої якості додатків із використанням глибоких мереж лексичних моделей (LLM). Вона пропонує єдиний вхідний інтерфейс API для доступу до декілька провайдерів моделі, а також інтегрованих можливостей спостереження, логування та оцінки, щоб допомогти групам розвитку розуміти як працюють їх функції AI у світі реальних викликів. Платформа розроблена з метою зменшити операційне навантаження на роботу продуктів, що залежать від LLM. Виробники можуть слідкувати за затримкою та витратами, відлагоджувати запитання, виконувати оцінки та керувати версіями запитань без складання окремих інструментів. Це робить краще можливості для інженерних команд на виконання розробки можливостей AI та підтримку надійності під час зростання використання.
Розподіл критеріїв
- Єдиний шлюз API для різних провідників LLM
- Запис і розпізнавання запитів
- Моніторинг затрат та затримок
- Іспитування та керування_promptами
- Робочі процеси оцінки та перевірки
- Інтеграції SDK та API


Maxim AI — це платформа для розробників, створена, щоб допомогти командам випускати надійних AI-агентів та LLM-застосунки. Вона поєднує в собі prompt-інжиніринг, оцінювання, спостережуваність і керування наборами даних, що дозволяє командам швидко ітерувати, зберігаючи вимірювану якість. Платформа підтримує автоматизовані та людські оцінювання за різними моделями й промптами, даючи інженерам змогу порівнювати результати, виявляти регресії та відстежувати помилки у продакшені. Вона розроблена для міжфункціональної співпраці, з робочими процесами, які дають змогу як технічним, так і нетехнічним учасникам долучатися до тестування та рев'ю. Maxim зазвичай використовують команди, що створюють чат-ботів, копілотів, голосових агентів і багатокрокові агентні робочі процеси, яким потрібна стабільна продуктивність за змінних промптів, моделей і користувацьких вхідних даних.
Розподіл критеріїв
- Playground для промптів і версіонування
- Автоматизовані оцінювання агентів та LLM
- Спостережуваність і трасування у продакшені
- Курування та керування наборами даних
- Робочі процеси людського рев'ю та анотування
- Підтримка кількох моделей і провайдерів
Relari (YC W24)
Платформа для тестування, оцінки та генерації синтетичних даних для AI‑агентів.

Relari — платформа розробників, спрямована на підвищення віддаленої вірогідності штучного інтелекту шляхом систематичної перевірки та оцінки. Вона допомагає командам створювати синтетичні набори даних, виконувати автоматизовані оцінки та оцінювати ефективність агентів у реалістичних сценаріях перед відправленням до виробництва. Натхнений успішними проектами Y Combinator (W24), Relari вихідним завданням є забезпечення інженерним командам висококомерџайних застосунків за допомогою LLM та багатошарових агентів, які вимагають підвищених вимог щодо якості. З цією метою, засоби Relari спрямовані на впровадження високого рівня техніки програмістських робіт – створення юніт-тестів та регресійних перевірок, а також вимірювань метрик – для небезпечних по зв'язку з цим AI-систем. Платформа підтримує особисті оцінювачі, симуляцію сценаріїв та постійне моніторинг, що зробило її корисною як для попередньої перевірки випуску, так і для тривалої забезпечення якості виробничих агентів.
Розподіл критеріїв
- Генерація синтетичних наборів даних
- Автоматизовані пайплайни оцінки агентів
- Симуляція сценаріїв та розмов
- Налаштовувані метрики оцінки
- Регресійне тестування для LLM‑застосунків
- Бенчмаркінг продуктивності та звітування





