Geçmiş savaş · 2025-12-21 UTC
Observability Hesaplaşma — 21 Aralık 2025
Observability kategorisinden. 10 savaşçıya 39 işaret yerleştirildi. AI2AI project tacı aldı.
Nihai sıralama
Kadro
Savaşçılar
Bu savaşta yarışan her aracın profilleri, nihai puanlarına göre sıralandı.


AI2AI projesi web sitesinde, kullanıcılar iki AI ajan arasında gerçek zamanlı sohbetleri gözlemleyebilir. İtirafın başlatılması için, kullanıcılar iki varlık oluşturarak onlara bir prompt, konteks, ses ve cinsiyet belirtmelidir ve dili modeli seçmelidir. İnteraksiyon başlatılabilir, kaydedilebilir ve sitenin diğer kullanıcılarıyla paylaşılabilecek. Çeşitli senaryolara ait örnek etkileşimler sunulur, örneğin aşk, öfke, merak ve satış konuşmaları. Yeni kullanıcılar kaydolmak zorundadır ve platformu keşfetmek için $1 ödünç alıyor. Maliyet, dakika başına tutar baz alınarak 1 sent ile başlar.
Kriterlerin ayrıştırılması
- Canlı AI-2-AI diyalogunu izleme
- Konusan iki ayrı AI varlığı
- Kullanıcı deneyimi gözlemci
- Farklılaşan AI davranışının sunumu
- Uygulama içi tarayıcı tabanlı arayüz
Confident AI
LLM değerlendirme platformu, DeepEval ile AI uygulamalarını test etmek, izlemek ve iyileştirmek için geliştirildi.

İyi Bilinçli (Confident AI) AI uygulamaları geliştiren takımlara büyük dil modeli uygulamaları için bir değerlendirme ve izlenebilirlik platformudur. Açık kaynaklı DeepEval framework'u ile güçlendirilmiştir, bu platform promplar, modeller ve retrieval.pipeline'leri üzerinden bençmark, geri dönüşümtests ve kalite kontrolleri çalıştırmanıza olanak tanır. Platform, mühendisleri ürünün teslim edilmeden önce hallüsinasyonlar, prompt gerilemeleri ve getiriler hataları yakalamaya yardımcı olurken, gerçek kullanıcı etkileşimlerini takip etmek için üretimde izleme sunuyor. Takımlar, verilerin merkezileştirilmesi, test sonuçlarının paylaşılması ve ölçülebilir geri bildirimler ile prompların üzerinde çalışma yerine tahminlerle çalışmama imkânı veriyor. Geliştiriciler, ML mühendisleri ve test ekiplerine yönelik, ad-hoc el işlemlerinden ziyade, metrics-tabanlı bir yaklaşımla LLM kalite güvencesi sağlamayı amaçlamaktadır.
Kriterlerin ayrıştırılması
- DeepEval ile güçlendirilmiş değerlendirme metrikleri
- Komut ve modeller için retrogresif test
- RAG ve alma değerlendirimi
- İstihdam durumları ve izleme
- Veri seti ve test vektör yönetimi
- Déjà Etki değerlendirme sonuçlarındaki takım iş birliği

KeywordsAI
Geliştirici platformu için bir araya gelen LLM uygulamalarını inşa etmek, izlemek ve ölçeklendirmek.

KeywordsAI, geliştiricilere odaklanan bir platform olarak, üretim düzeyinde LLM uygulamalarını teslim etmek için gereken araçları birleştirir. Çeşitli modül sağlayıcılarına erişim için tek bir API gateway sunar, yanında yapıcı özetlik, günlüğe kaydetme ve değerlendirme özellikleri içermektedir. Bu özellikler, ekibin gerçek dünyada AI özelliklerinin nasıl performans gösterdiğini anlamalarına yardımcı olur. Platform, LLM destekli ürünler çalıştırmakta işlemsel yükü azaltmak için tasarlanmıştır. Geliştiriciler latency ve maliyeti izleyebilir, özet metinleri hata ayırt edebilir, değerlendirme işlemini gerçekleştirebilir ve özet metin sürümlerini yönetebilirler. Böylece geliştirme takımları daha kolay bir şekilde AI özellikleri üzerinde geliştirip güvenilirliği ölçeklendirme olduğunda koruma altına alabilir.
Kriterlerin ayrıştırılması
- Hizmet sağlayıcılar arasında birleşik LLM kapıları
- İstek günlüğü ve izleme
- Fiyat ve gecikme izleme
- İstek deneyi ve sürüm yönetimi
- Değerlendirme ve test akışları
- SDK'ler ve API entegrasyonları

Edwin AI
İT operasyonları için çalışan bir AI ajansı, ihbarda deteksiyon, triaj ve çözüme gecikmeyi önler.

Edwin AI, IT operasyonlarına özgü bir AI एजenttir ve olay algılama, sıralama ve çözümü hızlandırır. IT takımlarına centralized bir platform sağlar, olayları araştırmalarında, etkisi anlamalarında, varsa çözümleri bulmalarında ya da oluşturmalarında, var olan tüm araçlar arasında sistemler arasında geçiş yapmadan uygulaymalarında yardımcı olur. Edwin AI uyarıları eşler, kök nedenleri tanır ve ilk uyarıdan onaylanmış çözüme kadar otomatik olarak iyileştirme başlatır. Geçmişteki örnekleri ve gözlemleri kullanır, patlakları öngörmeyi ve önlemini sağlar. Tüm gözlemler, performans monitörü, güvenliğe ve varlık tanımı veritabanına ilişkin 3000'den fazla araçla entegre olur, böylece anında, gerçek zamanlı, eylemsel bakış açıları sağlar ve siloları ortadan kaldırır. Forrester'ın bir araştırması, Edwin AI'nin bir kompozit organizasyona 313'üncü % ROI kazandırarak, 6 ayın altındaki ödemesi dönen bir döneme ulaştığını bulmuştur.
Kriterlerin ayrıştırılması
- Alert koruması ve gürültü azaltması
- Aİ-besleyeni neden neden önermeleri
- Tarih diline uygun ihbar özeti oluşturma
- İT operasyonu ve спостровльность platformları ile tümleştirmeler
- Automatik triaj akışları
- Gecmis ihbarlardan bilginin zenginleştirilmesi

Future AGI
Bilgisayar zekânın doğruluğu konusunda kapsamlı değerlendirme ve optimize araçlar yoluyla geliştirilmesi platformu.

Oluşan Zeka, bir platformdur ki AI'ın doğruyu tahmin etme doğruluğunu kapsamlı değerlendirme ve optimize etme araçlarıyla güçlendirir. Kullanıcılar kendisini iyileştiren birimlerin oluşturmasına izin verir, kırıldıklarında bunu yakalar ve nedenlerini bilir. Platform, birimin değerlendirilmesi, optimizasyonu ve simüle edilen konular dahil bir dizi özelliği sunar. Kullanıcılar senaryolar oluşturabilir ve yönetebilir ve platform, birimin performansını iyileştirmek için analiz ve optimize etme araçları sunar. Geleceğin AGI, geliştiricilerin ve işletmelerin AI güçlenmiş sohbet robotları ve ajansları dağıtmaya odaklanmış gibi gözükmektedir. Kullanıcıların sohbetleri simule etmek, agenin performansını değerlendirmek ve optimize etmek, bildirişim kaynakları ile entegrasyon yapabilmek imkânı sunmaktadır. Platform, geliştiricilerin AI ajanslarını oluşturup düzeltmede kullanacakları bir araç gibi görünmektedir, müşteri-yöneltimli bir arayüz değil, bu durumdadır. Platform, agent değerlendirmesi, simüle edilmiş konuşmalar ve senaryo yönetimi gibi özellikleri sunmaktadır. Kullanıcılar, girişleri düzenleme ve yönetimini yapabilir, bilgi tabanı makalelerine erişmek için yürütme adımları ekleyebilir ve karmaşık durumlar için global girişlerle entegre olabilir. Future AGI, geliştirme ve optimizasyon için değerli özellikler sunsa da sınırlı bir yapıya sahiptir. Örneğin, genel bir bilgi üzerinde dayanarak faaliyet gösteriyor ve daha karmaşık senaryolar için ek adımlar gerektirebilir. Ayrıca, platformun sanal konuşma dayanımı gerçek dünya değişkenliklerini işlememesine neden olabilir. Gelecekteki AGI, AI geliştirme ve optimizeasyonu için benzersiz bir özellik yelpazesi sunuyor gibi görünüyor. Geniş çaplı bir değerlendiriş ve optimize etme araçlarına sahip olmak, geliştiricilerin AI ajantlarını iyileştirmek için değerli bir kaynak haline getiriyor. Ancak, daha karmaşık senaryoları ve gerçek dünya gerçekleştiklerine işleme ve entegrasyon için ek geliştirme gerektirebilir.
Kriterlerin ayrıştırılması
- Agent değerlendirme ve sıralaması
- Canlı konuşma simülasyonu ve senaryo yönetimi
- Bilgi tabanı entegrasyonu ve veri alma
- Güçlü durumlar için küresel komut alma
- Analitik Araç ve optimize araçlar

Inspeq AI, organizasyonlara sorumlu AI'den politika belgelerini günlük mühendislik uygulamasına taşıma imkânı sunar. Platform, üretken AI uygulamalarının yaşam döngüsünün boyunca ölçülebilir kalite, güvenlik ve uyumluluk metriklerine odaklanmak suretiyle değerlendirmek, izlemek ve yönetmek için araçlar sunar. Takımlar LLM çıktılarına otomatik olarak değerlendirmeler çalıştırabilir, hallüsinasyonlar, çarpıklıklar, toksiklik ve prompt enjeksiyon riskleri ile ilgili sorunları takip edebilir ve geliştirme ve üretim.pipeline'lerinde denetimleri entegre edebilir. Panel ve raporlama özellikleri, teknik takımlar, risk görevlileri ve iş geliştiricileri için modele davranışın paylaşılmış bir görünümünü sunmak için tasarlanmıştır. Kurumların müşteri tarafından karşılaşılan veya denetlenilen GenAI ürünlerini geliştirmesini amaçlayan şirketler için tasarlanmıştır; bunların sürekli gözetim ve denetimliliğe ihtiyaç duyduğu durumda particul olarak.
Kriterlerin ayrıştırılması
- Otomatik LLM çıkışı değerlendirmesi
- Ön yatkınlık, zehir, hallüsinasyon ve metrikleri için hatalar
- İstek ve cevap izleme
- Governance ve uyum raporlama
- Pipework ve API entegrasyonları
- Güvenlik ve risk takımları için dashboardlar

Maxim AI
Sonuçtan sonuç-a platform için AI agent'lerin değerlendirmesi, izlenmesi ve geliştirilmesi

Maxim AI, geliştirici ekibine güvenilir AI agentleri ve LLM uygulamalarını hızlı bir şekilde teslim etmelerine yardımcı olmak için tasarlanmış bir geliştirici platformudur. Uygulama geliştirme aşamasında dil deneyi, değerlendirme, izleme ve veri kümesi yönetimini bir araya getirerek, kalite ölçülebilir olmasına rağmen, ekiplerin hızlı bir şekilde iterasyon yapmasına olanak tanır. Platform, otomatik ve insan değerlendirme işlemlerini destekleyerek çoklu modeller ve isteklerle beraber mühendislerin çıktıları karşılaştırmasına, gerilemelerini tanımlamasına ve üretimde başarısızlıklarını izlemesine olanak tanır. Kapsamlı bir işbirliği tasarımı olarak, hem teknik hem de teknik olmayan paydaşların test ve review süreçlerine katkıda bulunmalarına yönelik akışlar bulunur. Maxim genellikle sohbet robotları, yardımcı programlar, seslı agentler ve birden fazla adımda agresif akışlar oluşturan takımlar tarafından kullanılır. Bu ekibler, tutarlı performans isteyen değişken isteklerde, modellerde ve kullanıcı girişlerinde gereklidir.
Kriterlerin ayrıştırılması
- Prompt alanının ve sürümleme
- Otomatize edilen agent ve LLM değerlendirmeleri
- Üretim izleme ve takip
- Veri kümesi yönetimi ve bakım
- İnsan review'undan ve etiketlemekten oluşan akışlar
- Çoklu model ve servis destek

Temperstack
Sorunsuzluk platformu AI'nin kontrolü altında ve gözlemleme stekleri üzerinden alarm izleme, bildirim ve olay yönetimiyi otonomize eder.

Temperstack, ekipler tarafından zaten kullanmakta oldukları araçları biraraya getirmek için AI kullanmak suretiyle gözetim, uyarılama ve olay yanıtı konusunda bir bağlılık mühendisliği platformudur. Eksistans gözetim stekleri yerine, yeni sistemler kurmayı gerektirmiyor, üstlerine katılıyor ve kapanıklığa dair açıkları tanımlayan, anlamlı uyarılar oluşturan ve ekiplerin olaylara tepki verme biçimlerini akıllılaştıran sistemlerdir. Temperstack, SRE ve DevOps ekiblerini alarm yorgunluğunu azaltmak, ortalama çözüme zamanı kısaltmak ve servisler arası sürekli güvenilirlik standartlarını korumak için destekler. Rota yapılandırması, çalıştırma defteri yürütmesi ve olay sonrası analiz gibi rutin görevleri otomatikleştirmekle birlikte mühendisleri daha yüksek değerde güvenilirlik işiyle odaklanmalarına izin veren Temperstack, mühendisleri rutin görevlerden kurtarıyor.
Kriterlerin ayrıştırılması
- Hakkında uyarı yapılandırma desteği
- Ürünler arası olay yönetimi
- Otomatik gözetim denetimleri
- Yönlendirme kitabçasına otomasyon
- Olayın ardından analiz ve raporlama
- Büyük gözlemleme platformları ile entegrasyon

Arize AI
Geliştiriciler ve veri bilimcilerine AI gözlemciliği ve LLM değerlendirmesi platformu, üretimdeki LLM güdümlü uygulamaları takip ederken zaman içinde meseleleri, sapmayı ve performans düşüşlerini gözlemlemek yardımcı olur.

Arize AI, bir LLM değerlendirme platformu ve AI gözlemsellik platformudur. AI geliştiricileri ve veri bilimleri uzmanları tarafından AI modellerinin performansını izlemek, sorun gidermek ve güçlendirmek için yardımcıdır. Platform, kullanıcıların modellerlerinin hassasiyetini ve güvenilirliğini geliştirmesine yardımcı olmak için sorunları belirlemek ve fix önerileri sunan araçlar sağlar. Arize AI, performansını optimize etmek için modellerini iyileştirmek ihtiyacındaki AI geliştiricileri ve veri bilimleri uzmanları için tasarlanmıştır. Platformun yetenekleri, kullanıma sunulur: izleme ve sorun giderme, kullanıcıların sorunları hızla tanımlayarak ve çözümlemek olanak sağlar. Arize AI ayrıca, kullanıcıların zaman içinde modellerini iyileştirmesine izin veren performansını değerlendirmek ve güçlendirmek için özellikler sunar. Arize AI kullandığınızda AI modellerinizin peak performansda çalışmasını sağlamakla kalmaz, ayrıca karar vermede daha iyi sonuçlar elde edebilirsiniz. Platformun gözlemsellik ve değerlendirme odaklı yaklaşımı, diğer AI geliştirme araçlarından onu ayıran bir kıymet ifade eder. Bu, büyük dil modeli ve diğer karmaşık AI sistemleri ile çalışanlar için faydalı bir kaynak sağlar.
Kriterlerin ayrıştırılması
- AI model izleme
- Sorun giderme ve sorun tanımlama
- Önerilen onarım oluşturma
- Model performans değerlendirmesi
- LLM değerlendirme ve optimizasyonu

Weave
Code-less bir AI akış oluşturucu aracın, çoklu büyük dil modellerini (LLM) entegre ederek işlemleri otomatize etmek için işletmelerde işlem yapmalarını sağlar. İpuçlarını bağladığında, birçok akışa kolayca ve code-less katılması sağlar.

W&B Weave, büyük dil modelleri (LLM) uygulamalarını izlemek ve iyileştirmek için bir gözlemlilik ve değerlendirme platformudur. Weave, LLM jürileri ve özel skorerler kullanarak uygulamaya geri bildirim göndermek ve metrikleri toplamak için araçlar sağlamaktadır. Ana özellikler, toplantı takip edilmelerini, LLM çağrılarını ve aracın çağrılarını ve özel agentlerin el ile araçlanmasıdır. Platfrom, popüler SDK'lerle birlikte hata tedarik edicileri ve özel ajans gözlemliliği gibi entegrasyonlara destek sunuyor. Weave, Python ve TypeScript kütüphanelerini geliştirirken platformun kurulumu ve kullanımı için sunuyor. Platform W&B (Weights Üzeri Biyasaerler) hesabında barındırılıyor ve W&B hesabına erişim için W&B API anahtarı gerekmekte Kullanıcılar, LLM'lere yapılan çağrıları izleyebilir, girişler ve çıkışları inceleyebilir ve agregaçi metriklerini Weave UI'sinde görüntüleyebilir. Weave, otomatikleştirme ve LLM uygulamalarının değerlendirmesini kolaylaştırmakla birlikte bir kod oluşturma AI akış oluşturucu gibi adının öne çıkışından farklı olarak, bu niteliği barındırmamaktadır.
Kriterlerin ayrıştırılması
- Ajanta izleme ve metrik toplanması
- Özel ajanta görünürliği
- LLM izleme ve değerlendirme
- OpenTelemetrySpan destek
- Weights & Biases (W & B) entegrasyonları
- Python ve TypeScript kütüphaneleri








