Geçmiş savaş · 2023-12-27 UTC
Observability Hesaplaşma — 27 Aralık 2023
Observability kategorisinden. 8 savaşçıya 30 işaret yerleştirildi. Fiddler AI tacı aldı.
Nihai sıralama
Kadro
Savaşçılar
Bu savaşta yarışan her aracın profilleri, nihai puanlarına göre sıralandı.

Fiddler AI
Bildirim ve güvenlik platformu olarak ML ve LLM uygulamalarının izlenmesinde, açıklanmasında ve yönetilmesinde AI gözlemciliği için geliştirilmiştir.

Fiddler AI, işletmeler için bir platformdur. Üretim ortamlarında makine öğrenimi modelleri ve yaratıcı AI uygulamalarını izlemek, analiz etmek ve güvence altına almak gibi ekibin işlerini kolaylaştırmak mụcludur. Ayrıca LLM'lerde özel risklere karşı koruma sağlayarak model performansı, verilerde kayma, önyargı ve kalite sorunları gibi konulara net görünürlük sağlar. Fiddler AI, ML mühendisleri, veri bilimcileri ve risk ve uyum ekibi için tasarlanmıştır. Fiddler, açıklama, gerçek zamanlı izleme ve koruma duvarları gibi özellikleri bir araya getirmektedir ve bunun için tek bir akış işlevini kullanır. Genellikle kullanılan ML.pipeline'ler ve cloud ortamları arasında entegre olarak çalışır ve bu sayede organizasyonların sorumluluk sahibi AI pratiğini büyük ölçekte işleyecekleri bir şekilde optimize edebilir.
Kriterlerin ayrıştırılması
- Model performansı ve kayma izleme
- LMM Hallüsinasyonu ve güvenlik algılama
- Prompt enjeksiyon ve hapsetme koruması
- Açıklanabilir AI ve neden tespit analizi
- Cihetilik ve adalet değerlendirmeleri
- Üretim AI için dashboardlar ve uyarılar


FoundryAI, gerçek iş akışı yönetimine odaklı AI agentleri yaratan bir geliştirme platformudur. Agent tasarım, test ve sürekli iyileştirme araçlarını bir araya getirerek, takımlar birlikte ayrı sistemleri birer birer bağlamadan prototip üzerinden üretim hattına geçebilmektedirler. Platform, kuruculara belirledikleri görevlere göre agent performansını ölçmeye ve zamanla davranışları iyileştirmeye yollar sunar. Bu nedenle, müşteri desteği, iç işlemler veya tekrarlayan bilgi işleme gibi güvenilirlik ön planda olduğu organizasyonlarda uygun bir platformdur. FoundryAI, teknik ekipleri hedefleyerek, kodlamadan codeless binacılar sunanlarla daha fazla kontrol isteyen ancak tamamen baştan ajanlar inşa etmek kadar hızlı geliştirme hızını isteyenleri target yapıyor.
Kriterlerin ayrıştırılması
- Ajan oluşturma ortamı
- Değerlendirme ve test araçları
- Performans izleme
- İş akış otomasyonu desteği
- Geleneksel iyileşme döngüleri
- İş sistemleri ile entegrasyon

Quotient AI
Hızlı zaman diliminde izleme ve değerlendirme platformu, arama, RAG ve agentler için AI hatalarını yakalamak için
Quotient AI, AI güçlendirilmiş özellikler gönderen ekibler için oluşturulmuş gözlemlilik ve değerlendirme platformudur. Sürekli üretim AI sistemleri – arama, geri dönüşüm-Augmente edilen üretim (RAG) ve özerk ajanlar dahil - gözden geçirir, endüstriyel kullanıcılar onları bulmeden önce yanıtlar, geri alma hataları ve kalite sorunlarını sallaştırmak. The platform, otomasyon ile birleştirilen değerlendirmeler ile gerçek zamanlı alarmlar sunarak, mühendislik ve ML ekibi, model veya istek değişikliklerinde gerilemelerin takip edilmesini, kök nedenlerin tanınılmasını ve ölçeklenebilir güvenilirliği korumayı kolaylaştırmaktadır. AI dillerini instrumente ederek, uygulamaların gerçek dünyada nasıl davrandığını geliştiricilere görmesini sunar ve offline benchmarklere dayanarak değil.
Kriterlerin ayrıştırılması
- Hızlı zaman diliminde AI izleme ve uyarı alma
- Hallüsinasyon ve retrieval hataları tanımı
- RAG.pipeline
- lari için değerlendirme yardımcı programı
- Ajan davranışlarının izlenmesi ve tanısı
- Model ve ilke değişikliklerinde regresyon analizi


Portkey, AI uygulamalarını oluşturmak, yönetmek ve izlemek için tek bir kontrol plağıdır. Bir dizi özelliğini içerirken, AI Gateway, İzlenebilirlik, Yöntem Bariyerleri, Yönetim ve Uyarı Yönetimi gibi üretim için kapsamlı bir platform sunar. Platform, 1600 den fazla LLM'ı birleştirilmiş bir API üzerinden erişilmesini sağlar, böylece modelleri entegrasyon sürecini basitleştirir ve ekibleri inşa etmeye odaklanmaya yönlendirir. Portkey, gerçek zamanlı izlenebilirlik sunarak LLM davranışını izleme olanağı sağlar, anomalileri erken yakalamayı ve kullanımını proaktif olarak yönetmeyi sağlar. Ayrıca, platform, kullanicılara binlerce dolar kazandıran gereksiz.testleri azaltarak bellek kullanan yetenekler sunar. Portkey, AI ekibi için tasarlanmış olup, geniş bir范围L'LMleri destekliyor vegÜç binlikGenAI ekibi ile her gün büyükbir sayı token işleniyor.
Kriterlerin ayrıştırılması
- AIOSS için多供应商路由
- İçin istemci önbelleği ve sürümlendirme
- İstek kayıtları, iz ve analitik
- Semantik önbelleği ve yeniden deneme
- Girdi ve çıktı doğrulaması için bariyerler
- Kullanım ve maliyet izleme dashbordü
Helicone AI
Tamamı gözden geçirilebilir platform, üretim LLM uygulamalarını izlemek, hata ayıklamak ve geliştirmek için.
Helicone AI, geliştirici odaklı gözlemselliği için özel olarak büyük dil modelleriyle güçlendirilmiş uygulamalar için inşa edilen bir platformdur. Talepler, yanıtlar, maliyetler ve gecikmeler, sağlayıcılar üzerinden izleniyor; bu sayede mühendislik ekipleri, LLM özelliklerinin üretim ortamında nasıl davrandığını tek bir panodan görebilmektedir. Görüntüleme ötesinde, Helicone araçlar sağlar: girdi komutları için hata ayıklama, birden çok adımlık agent akışlarının izlenmesi, değerlendirmeleri çalıştırma ve kullanıcı düzeyinde kullanım takibi. Tekrarlı hata ayıklama, bütçe kontrolü ve kullanıcıların hata yapmadan veri dayanımı ile komutların üzerine giderek geliştirilmesi, Takımı Regresyonu Ayıklama, Bütçe Kontrolü ve Veri Dayandırarak Komutları Geliştirme. Popüler model sağlayıcıları ve çerçeveleri ile entegre olmak için hafif bir proxy veya.async günlüğe kaydolma kullanıyor, bu yüzden mevcut düzenlerin üzerine büyük kod değişiklikleri yapmadan dahil etmek kolaylaşıyor.
Kriterlerin ayrıştırılması
- İstek ve yanıt loglanması
- Maliyet ve token kullanım izlenmesi
- Prompt yönetimi ve sürümleme
- Agent ve session izlenmesi
- Müşterî değerlendirmeler ve ekranlar
- Kullanıcı ve limit analizleri

KeywordsAI
Geliştirici platformu için bir araya gelen LLM uygulamalarını inşa etmek, izlemek ve ölçeklendirmek.

KeywordsAI, geliştiricilere odaklanan bir platform olarak, üretim düzeyinde LLM uygulamalarını teslim etmek için gereken araçları birleştirir. Çeşitli modül sağlayıcılarına erişim için tek bir API gateway sunar, yanında yapıcı özetlik, günlüğe kaydetme ve değerlendirme özellikleri içermektedir. Bu özellikler, ekibin gerçek dünyada AI özelliklerinin nasıl performans gösterdiğini anlamalarına yardımcı olur. Platform, LLM destekli ürünler çalıştırmakta işlemsel yükü azaltmak için tasarlanmıştır. Geliştiriciler latency ve maliyeti izleyebilir, özet metinleri hata ayırt edebilir, değerlendirme işlemini gerçekleştirebilir ve özet metin sürümlerini yönetebilirler. Böylece geliştirme takımları daha kolay bir şekilde AI özellikleri üzerinde geliştirip güvenilirliği ölçeklendirme olduğunda koruma altına alabilir.
Kriterlerin ayrıştırılması
- Hizmet sağlayıcılar arasında birleşik LLM kapıları
- İstek günlüğü ve izleme
- Fiyat ve gecikme izleme
- İstek deneyi ve sürüm yönetimi
- Değerlendirme ve test akışları
- SDK'ler ve API entegrasyonları

Maxim AI
Sonuçtan sonuç-a platform için AI agent'lerin değerlendirmesi, izlenmesi ve geliştirilmesi

Maxim AI, geliştirici ekibine güvenilir AI agentleri ve LLM uygulamalarını hızlı bir şekilde teslim etmelerine yardımcı olmak için tasarlanmış bir geliştirici platformudur. Uygulama geliştirme aşamasında dil deneyi, değerlendirme, izleme ve veri kümesi yönetimini bir araya getirerek, kalite ölçülebilir olmasına rağmen, ekiplerin hızlı bir şekilde iterasyon yapmasına olanak tanır. Platform, otomatik ve insan değerlendirme işlemlerini destekleyerek çoklu modeller ve isteklerle beraber mühendislerin çıktıları karşılaştırmasına, gerilemelerini tanımlamasına ve üretimde başarısızlıklarını izlemesine olanak tanır. Kapsamlı bir işbirliği tasarımı olarak, hem teknik hem de teknik olmayan paydaşların test ve review süreçlerine katkıda bulunmalarına yönelik akışlar bulunur. Maxim genellikle sohbet robotları, yardımcı programlar, seslı agentler ve birden fazla adımda agresif akışlar oluşturan takımlar tarafından kullanılır. Bu ekibler, tutarlı performans isteyen değişken isteklerde, modellerde ve kullanıcı girişlerinde gereklidir.
Kriterlerin ayrıştırılması
- Prompt alanının ve sürümleme
- Otomatize edilen agent ve LLM değerlendirmeleri
- Üretim izleme ve takip
- Veri kümesi yönetimi ve bakım
- İnsan review'undan ve etiketlemekten oluşan akışlar
- Çoklu model ve servis destek
Relari (YC W24)
AI araçları için test, değerlendirmesi ve sentetik veri oluşturma platformu.

Relari, YC W24, geliştirici platformu, AI ajanlarının güvenilirliğini geliştirmek için sistematik testleme ve değerlendirme üzerinde odaklanmaktadır. Takımları oluşturulmuş datasetler oluşturmayı, otomatik değerlendirmeleri işleyip ve gerçekçi senaryolarda ajan performansını ölçümleyerek üretim ortamına göndermeden önce göndermektedir. Y Combinator'ın (W24) desteklediği Relari, geleneksel kalite güvencesinin yetersiz olduğu karmaşık LLM uygulamaları ve sıralı agresler inşa eden mühendis团lar için tasarlanmıştır. Ardışıl QA'nın sınırlarının ötesinde bulunan araçları, deterministik olmayan AI sistemlerine yazılım mühendisliği kuralları ile beraber - birim testleri, geri kazanım kontrolleri ve ölçülebilir istatistikler - tanıtmayı amaçlar. Platform, özel değerlendiriciler, senaryo simülasyonu ve sürekli izleme desteği sunuyor, böylece hem önceden yayınlanmadan önce doğrulama hem de üretim.agentlarının kalite güvencesi sağlama gibi kullanım durumlarının destekleniyor.
Kriterlerin ayrıştırılması
- Sentetik veri kümesi oluşturma
- Otomatik agent değerlendirme.pipeline'leri
- Senaryo ve konuşma simülasyonu
- Özenli değerlendirme ölçütleri
- Geliştirilmiş LLM uygulamaları için gerileme testleri
- Sürat performansı ve raporlama için benchmarking





