Минула битва · 2026-07-24 UTC
Observability Протистояння — 24 липня 2026 р.
З категорії Observability. 21 позначок поставлено серед 9 бійців. Coval (YC S24) здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

Coval (YC S24)
Платформа симуляції та оцінки для випробувань системи спілкування з голосовим допоміжником на масштабі.

Коваль - це платформа для розробників, створена для симуляції, тестування та оцінки штучних інтелектуálních агентів перед їх виходом до виробництва. Вона дозволяє командам виконувати тисячі синтетичних rozhovрів щодо своїх голосових чи чат-агентів, вимірюючи як вони справляються із межними випадками, перервами, викликами інструментів та багатотурнієвою діалогією. Підтриманий Y Combinator (S24), Coval позиціонує себе як "потрійний приладний рівень управління" щодо надійності агентів, застосовуючи строгі тестування за допомогою симуляції щодо інтелектуальної мови. Інженери можуть визначати сценарії, відтворювати випускну трафіку, оцінювати виходи за допомогою індивідуальних показників та відстежувати регресію по версіям агентів. Платформа спрямована на команди, що відправляють клієнтський агентів у підтримці, розробках продажів та операцій, де надійність та сталість є критичними для розгортання.
Розподіл критеріїв
- Рядкові симуляції розмов
- Тестування голосових агентів з реалістичними діалогами
- Власні оціночні метрики та оцінки
- Слідкування за регресіями через версії агентів
- Виробництво трафіку з переглядом сценаріїв та випадкових випадків
- Налагоджені ігри сценаріїв та випадкових випадків

Fiddler AI
Аналітична платформа AI спостереження та безпеки для моніторингу, пояснення та керування aplikáciami ML і LLM.

Fiddler AI є підприємницькою платформою, яка допомагає командам монтувати, аналізувати та забезпечувати безпеки машинних навчальних моделей та генеративних мереж нейронних мереж, розміщених на виробництві. Вона забезпечує візуалізацію якості моделей, змінювання даних, упередженості та питань якості, а також пропонує захист від ризиків, пов’язаних із LLM, наприклад, галлюцинацій, втілення prompts та небезпечні виходи. Навдіяний для інженерів з машинного навчання, науковців даних і команд з ризику та забезпечення відповідності, Fiddler об’єднує наочність, ре-тайм-відслідковування та бар’єри в одному робочому процесі. Його інтеграція в звичайні лінії процесу машинного навчання та облаштованих навколо них навколишніх середовищ допомагає організації оперувати відповідальними практиками у сфері штучного інтелекту на величезних масштабах.
Розподіл критеріїв
- Моніторинг ефективності моделі та зміна даних.
- Детекція галюцинацій та безпеки LLM.
- Захист від втілення стимулів і нападу jailbreak.
- Пояснення AI та аналіз причин.
- Оцінка спрямованості та різниці.
- Дашборди та попередження для продукції AI.

Future AGI
Платформа, яка підвищує точність AI за допомогою повної оцінки та оновлення інструментів.

Завданням майбутнього AGI є створення можливості для підвищення точності обробки даних за допомогою комплексних засобів оцінки та оптимізації. Виглядає він так, що користувачі можуть будувати самовідкликану агентів, пізнання чого згубного відбувається та чому воно відбувалось. Платформа пропонує широкий спектр можливостей, починаючи від оцінки та оптимізації агентів, до симульованих розмов, користувачі можуть створювати та керувати сценарієм, а платформа надає аналітичні та оптимізаційні інструменти для поліпшення агентської здатності. Будучий AGI здається відповідає розробникам та бізнесам, які шукають розповсюдження чатботів і агентів із інтеграцією AI. Він дозволяє користувачам симульовано спілкуватися, оцінювати та оптимізувати ефективність агентів, а також інтегрувати з базами знань. Підсумком видається, що це інструмент для розробників створення та вдосконалення агентів AI, а не інтерфейс, звернений до клієнтів. Платформа надає функції, такі як оцінка агента, імітування діалогу та управління сценарієм. Вона дозволяє користувачам редагувати та керувати запрошеннями, додавати кроки пошуку для статті знань у базі даних, та інтегрувати з глобальними запрошеннями для обробляння складних ситуацій. Хоча Future AGI надає цінні феатри для розвитку та оптимізації штучного інтелекту, вона також має свої обмеження. Наприклад, вона заснована на загальній знанні та може вимагати додаткових кроків для більш складних сценаріїв. Окрім цього, залежність платформи від згенерованих діалогів може обмежувати її здатність обробляти реальні світові невизначеності. Навіні АГІ здається пропонує своєрідний набір особливостей для розробки та оптимізації AI. Її багатовимірна оцінка та оптимізація інструментів роблять її цінним джерелом для розробників, які намагаються допрацювати свої агенти за допомогою AI. Однак, для обробки більш складних сценаріїв та справжніх невизначенностей може бути потрібно додатковий розвиток чи інтеграція.
Розподіл критеріїв
- Оцінка та ранжування агентів
- Мультисимульовані розмови та управління сценаріями
- Інтеграція бази відомостей та вилучення даних
- Глобальне оброблення запитів у складних ситуаціях
- Аналітика та інструменти оптимізації

AI2AI project
Спогляньте, як дві агенти Інтернету-міжсвітньої взаємодіють у реальному часі

На сайті проекту AI2AI користувачі можуть спостерігати реальні розмови між двома агентами ІМ. Для початку розмови користувач повинен створити два окремих індивідууми, розподіливши їм попереднє повідомлення, контекст, голос та стать, а також вибрати мовний модель. Розмову можна запустити, зберегти та поділитися нею з іншими користувачами на сайті. Приведені приклади взаємодії демонструють різні сценарії, такі як спокус, гнів, цікавість та продажескі тачіни. Нові користувачі потрібно реєструватися та отримувати 1 долар для вивчення можливостей платформи. Ціна залежить від облікової ставки за хвилину, яка починається від 0.01 долара за хвилину.
Розподіл критеріїв
- Показ реальної AI-вимірювання
- Два окремих агенти ІМ у діалозі
- Наблюдувальний, бездітний досвід користувача
- Вид показу вихідної AI-влади
- Доступна інтерфейс-браузерів
- Відновлення моделі мовлення

Arize AI
Платформа спостереження за AI та оцінки мовного генерування ЛЛМ, яка допомагає розробникам AI та науковцям даних у моніторингу, відшукуванні проблем і покращенні виконання...

Arize AI — це платформа для спостережуваності ШІ та оцінки LLM. Вона допомагає розробникам ШІ та дата‑науковцям моніторити, діагностувати та покращувати продуктивність їхніх AI‑моделей. Платформа надає інструменти для виявлення проблем і пропозицій щодо їх усунення, допомагаючи користувачам підвищувати точність і надійність моделей. Arize AI розрахована на розробників ШІ та дата‑науковців, яким потрібно оптимізувати продуктивність моделей. Можливості платформи включають моніторинг і діагностику, що дозволяє швидко виявляти та вирішувати проблеми. Arize AI також пропонує функції оцінки та покращення продуктивності моделей, що дає змогу користувачам поступово удосконалювати свої моделі. Використовуючи Arize AI, користувачі можуть забезпечити, щоб їхні AI‑моделі працювали на максимумі, що призводить до кращих рішень та результатів. Орієнтація платформи на спостережуваність і оцінку виділяє її серед інших інструментів розробки ШІ, роблячи її цінним ресурсом для роботи з великими мовними моделями та іншими складними AI‑системами.
Розподіл критеріїв
- Моніторинг AI‑моделей
- Виявлення проблем та їх діагностика
- Генерація пропонованих виправлень
- Оцінка продуктивності моделі
- Оцінка та оптимізація LLM

Edwin AI
Агент IA для IT операцій, які прискорюють виявлення, відбір та розв'язування випадків.

Edwin AI - це агент IA для операцій IT, призначений для прискорення виявлення, відбірки та розв'язання випадків. Його платформа централізує дослідження випадків, розуміння їхнього впливу, знаходження чи створення пропозицій розв'язання та їхнє застосування по існуючим засобах без необхідності мінімізувати переміщення між системами. Edwin AI корелює повідомлення про виникнення випадків, визначає основні причини, а також розпочинає автоматичний процес ліквідації від початку повідомлення щодо випадків аж до підтвердженої ліквідації. Він використовує історичні шаблони та дані спостережень, щоб передбачити та уникнути виходів з ладу. Інструмент інтегрується з більше ніж 3000 засобами за допомогою спостереження, відслідковування виконання програми, безпеки і базових даних CMDB, забезпечуючи можливість отримання справжніх та дієвих даних та виведення із існуючих сіл.
Розподіл критеріїв
- Кореляція повідомлень про виникнення випадків та зменшення шуму
- Підстановка основних причин за допомогою агенту IA
- Кореспондентські матеріали про виникнення випадків у природній мові
- Інтеграції з ITSM та спостережуваними системами
- Автоматичні потоки робіт відбірки
- Пов'язування нових знань зі спостережуваними матеріалами від попередніх виникненням випадків


FoundryAI – це платформа розробки, спрямована на створення агентів AI, які обробляють справжні бізнес-потоки роботизації. Вона поєднує інструменти дизайну, перевірки та постійної вдосконалення агентів, щоб команди змогли перейти від прототипу до виробництва без зшивки окремих систем. Платформа ґрUNTоці evaluation, надаючи будівельникам засоби оцінки виконуваності агента щодо заданих завдань і вдосконалення поведінки зі часом. Це робить її підійдящою для організаційних середовищ, які автоматизують підтримку клієнтів, внутрішні операції або повторні роботи зі знань, де дієвість має важливе значення. FoundryAI звертається до технічних команд, які потребують більшого контролю порівняно з будівництвом безконтактними будівельниками, але бажають швидше експериментувати ніж будувати агентів цілком зі зброєю з нуля.
Розподіл критеріїв
- Працівні середовища будівництва агентів
- Інструменти оцінювання та підтвердження
- Надзор за виконанням
- Підтримка автоматизації бізнес-сценаріїв
- Путівки для поступового покращення
- Інтерграція з бізнес-системами
Helicone AI
Повноціленна платформа спостереження для моніторингу, відлагодження та покращення роботи продуктивних застосунків із великими мовними моделями.
Helicone AI - це спеціально розроблений для розробників платформу спостереження, збудований для застосунків, які використовують великі мовні моделі. Цей продукт захоплює запити, відповіді, витрати та затримки за різними постачальниками, дозволяючи командам інженерів отримувати єдине уявлення про те, як їхні особливості мовних моделей працюють в процесах виробництва. У додовженні до логування Helicone пропонує інструменти для валідації промптів, слідкуванню за багатоступовими потоками роботи агента, виконанню оцінок та відслідковуванні індивідуального використання. Командам вдається ідентифікувати регресії, регулювати витрати та виконувати кроки щодо промптів на основі даних, а не за підозами. Господарює з популярними провайдерами моделей та фреймворками за допомогою легкосинхронного проксі або асинхронного запису лога, чим полегшує інтеграцію з існуючими стектами без необхідності глибоких змін коду.
Розподіл критеріїв
- Зарежування запитів та відповідей
- Надбання та облік витрат
- Управління запрошеннями та версіографія
- Трекінг агентів та сесій
- Додаткова оцінка та панелі керування
- Аналітика користувача та швидкісної обмеження

llm scout
Наблюдайте, як ваша бренд з'являється в оглядах ChatGPT, Клод, Перплексіті та Google AI Overviews.

LLM Scout – інструмент моніторингу бренду для епохи пошуку на основі генеруючих моделей. Він слідкує за тим, як згадується Ваш компанія, товари та конкуренти на головних асистентів AI та системи відповідей, надаючи знімок ситуації для команд з маркетингу та SEO в каналу, який залишається нерозрізаним традиційним інструментами для аналітики. Платформа видає перевірки періодичних запитань щодо систем, зокрема ChatGPT, Claude, Perplexity та оглядів AI компанії Google, згодом відображає частку мовлення, рівень настрою, джерела цитованої інформації та зміни протягом часу. Команди можуть використовувати отримані відомості для вдосконалення стратегії вмісту, ідентифікації прогалин, у яких конкуренти рекомендуються замість того, а також вимірювання впливу спроб оптимізації щодо великих мовних моделей.
Розподіл критеріїв
- Надання інформації про відстежування згадок про бренд та конкурентів
- Моніторинг через ChatGPT, Клод, Перплексіті та огляди AI
- Аналіз.sentimentу та ділення голосу
- Відсутність інформаці про цитування джерел
- Скалярне відслідковування запитів
- Дані звітності історичних тенденцій







