Geçmiş savaş · 2026-07-24 UTC
Observability Hesaplaşma — 24 Temmuz 2026
Observability kategorisinden. 9 savaşçıya 21 işaret yerleştirildi. Coval (YC S24) tacı aldı.
Nihai sıralama
Kadro
Savaşçılar
Bu savaşta yarışan her aracın profilleri, nihai puanlarına göre sıralandı.

Coval (YC S24)
Büyük ölçekli sözleşme simülasyonu ve AI ses ve chat temsilcilerini geniş çapta test etme platformu.

Coval, üretim aşamaya ulaştıkları önce AI agenlerine simülasyon, test ve değerlendirmeleri sağlamak amaçlı tasarlanmış bir geliştirici platformudur. Takımlar, ses veya sohbet agenlarıyla kaçınılmaz durumları, kesintileri, araç çağrıları ve multi-turn diyalog yönetimi gibi durumlar karşısında ne kadar iyi performans gösterdireceklerini ölçmek için binlerce sentetik sohbeti çalıştırmaya olanak tanır. Y Combinator (S24) tarafından desteklenen Coval, etkileşimli AI için 'otomatik araçlar yaklaşımı' olarak kendisini konumlandırır. Etkileşimli AI'nin güvenilirliğini sağlamak için katı bir simülasyon temelli test uygulaması kullanır. Mühendisler senaryolar belirleyebilir, üretim trafiğini yeniden çekebilir, özel ölçütler karşılaştırısında çıktıları puanlayabilir ve agent sürümleri arasında gerilemeleri Takib edebilir. Platform, destek, satış ve operasyonlarda müşteriyle yüzleşen agentleri kullanan ekiplere yöneliktir ve deployment için güvenilirlik ve tutarlılık kritik önem taşımaktadır.
Kriterlerin ayrıştırılması
- Büyük ölçüde sözleşme simülatörü
- Gerçekçi diyaloglu ses temsilcisidir denetleme
- Özel değerlendirme ortamları ve puanlamalar
- Ajan sürümleri arasında gerileme tracking
- Senaryo ve kenar durum oluşturma
- Üretim trafik yeniden oynatma

Fiddler AI
Bildirim ve güvenlik platformu olarak ML ve LLM uygulamalarının izlenmesinde, açıklanmasında ve yönetilmesinde AI gözlemciliği için geliştirilmiştir.

Fiddler AI, işletmeler için bir platformdur. Üretim ortamlarında makine öğrenimi modelleri ve yaratıcı AI uygulamalarını izlemek, analiz etmek ve güvence altına almak gibi ekibin işlerini kolaylaştırmak mụcludur. Ayrıca LLM'lerde özel risklere karşı koruma sağlayarak model performansı, verilerde kayma, önyargı ve kalite sorunları gibi konulara net görünürlük sağlar. Fiddler AI, ML mühendisleri, veri bilimcileri ve risk ve uyum ekibi için tasarlanmıştır. Fiddler, açıklama, gerçek zamanlı izleme ve koruma duvarları gibi özellikleri bir araya getirmektedir ve bunun için tek bir akış işlevini kullanır. Genellikle kullanılan ML.pipeline'ler ve cloud ortamları arasında entegre olarak çalışır ve bu sayede organizasyonların sorumluluk sahibi AI pratiğini büyük ölçekte işleyecekleri bir şekilde optimize edebilir.
Kriterlerin ayrıştırılması
- Model performansı ve kayma izleme
- LMM Hallüsinasyonu ve güvenlik algılama
- Prompt enjeksiyon ve hapsetme koruması
- Açıklanabilir AI ve neden tespit analizi
- Cihetilik ve adalet değerlendirmeleri
- Üretim AI için dashboardlar ve uyarılar

Future AGI
Bilgisayar zekânın doğruluğu konusunda kapsamlı değerlendirme ve optimize araçlar yoluyla geliştirilmesi platformu.

Oluşan Zeka, bir platformdur ki AI'ın doğruyu tahmin etme doğruluğunu kapsamlı değerlendirme ve optimize etme araçlarıyla güçlendirir. Kullanıcılar kendisini iyileştiren birimlerin oluşturmasına izin verir, kırıldıklarında bunu yakalar ve nedenlerini bilir. Platform, birimin değerlendirilmesi, optimizasyonu ve simüle edilen konular dahil bir dizi özelliği sunar. Kullanıcılar senaryolar oluşturabilir ve yönetebilir ve platform, birimin performansını iyileştirmek için analiz ve optimize etme araçları sunar. Geleceğin AGI, geliştiricilerin ve işletmelerin AI güçlenmiş sohbet robotları ve ajansları dağıtmaya odaklanmış gibi gözükmektedir. Kullanıcıların sohbetleri simule etmek, agenin performansını değerlendirmek ve optimize etmek, bildirişim kaynakları ile entegrasyon yapabilmek imkânı sunmaktadır. Platform, geliştiricilerin AI ajanslarını oluşturup düzeltmede kullanacakları bir araç gibi görünmektedir, müşteri-yöneltimli bir arayüz değil, bu durumdadır. Platform, agent değerlendirmesi, simüle edilmiş konuşmalar ve senaryo yönetimi gibi özellikleri sunmaktadır. Kullanıcılar, girişleri düzenleme ve yönetimini yapabilir, bilgi tabanı makalelerine erişmek için yürütme adımları ekleyebilir ve karmaşık durumlar için global girişlerle entegre olabilir. Future AGI, geliştirme ve optimizasyon için değerli özellikler sunsa da sınırlı bir yapıya sahiptir. Örneğin, genel bir bilgi üzerinde dayanarak faaliyet gösteriyor ve daha karmaşık senaryolar için ek adımlar gerektirebilir. Ayrıca, platformun sanal konuşma dayanımı gerçek dünya değişkenliklerini işlememesine neden olabilir. Gelecekteki AGI, AI geliştirme ve optimizeasyonu için benzersiz bir özellik yelpazesi sunuyor gibi görünüyor. Geniş çaplı bir değerlendiriş ve optimize etme araçlarına sahip olmak, geliştiricilerin AI ajantlarını iyileştirmek için değerli bir kaynak haline getiriyor. Ancak, daha karmaşık senaryoları ve gerçek dünya gerçekleştiklerine işleme ve entegrasyon için ek geliştirme gerektirebilir.
Kriterlerin ayrıştırılması
- Agent değerlendirme ve sıralaması
- Canlı konuşma simülasyonu ve senaryo yönetimi
- Bilgi tabanı entegrasyonu ve veri alma
- Güçlü durumlar için küresel komut alma
- Analitik Araç ve optimize araçlar


AI2AI projesi web sitesinde, kullanıcılar iki AI ajan arasında gerçek zamanlı sohbetleri gözlemleyebilir. İtirafın başlatılması için, kullanıcılar iki varlık oluşturarak onlara bir prompt, konteks, ses ve cinsiyet belirtmelidir ve dili modeli seçmelidir. İnteraksiyon başlatılabilir, kaydedilebilir ve sitenin diğer kullanıcılarıyla paylaşılabilecek. Çeşitli senaryolara ait örnek etkileşimler sunulur, örneğin aşk, öfke, merak ve satış konuşmaları. Yeni kullanıcılar kaydolmak zorundadır ve platformu keşfetmek için $1 ödünç alıyor. Maliyet, dakika başına tutar baz alınarak 1 sent ile başlar.
Kriterlerin ayrıştırılması
- Canlı AI-2-AI diyalogunu izleme
- Konusan iki ayrı AI varlığı
- Kullanıcı deneyimi gözlemci
- Farklılaşan AI davranışının sunumu
- Uygulama içi tarayıcı tabanlı arayüz

Arize AI
Geliştiriciler ve veri bilimcilerine AI gözlemciliği ve LLM değerlendirmesi platformu, üretimdeki LLM güdümlü uygulamaları takip ederken zaman içinde meseleleri, sapmayı ve performans düşüşlerini gözlemlemek yardımcı olur.

Arize AI, bir LLM değerlendirme platformu ve AI gözlemsellik platformudur. AI geliştiricileri ve veri bilimleri uzmanları tarafından AI modellerinin performansını izlemek, sorun gidermek ve güçlendirmek için yardımcıdır. Platform, kullanıcıların modellerlerinin hassasiyetini ve güvenilirliğini geliştirmesine yardımcı olmak için sorunları belirlemek ve fix önerileri sunan araçlar sağlar. Arize AI, performansını optimize etmek için modellerini iyileştirmek ihtiyacındaki AI geliştiricileri ve veri bilimleri uzmanları için tasarlanmıştır. Platformun yetenekleri, kullanıma sunulur: izleme ve sorun giderme, kullanıcıların sorunları hızla tanımlayarak ve çözümlemek olanak sağlar. Arize AI ayrıca, kullanıcıların zaman içinde modellerini iyileştirmesine izin veren performansını değerlendirmek ve güçlendirmek için özellikler sunar. Arize AI kullandığınızda AI modellerinizin peak performansda çalışmasını sağlamakla kalmaz, ayrıca karar vermede daha iyi sonuçlar elde edebilirsiniz. Platformun gözlemsellik ve değerlendirme odaklı yaklaşımı, diğer AI geliştirme araçlarından onu ayıran bir kıymet ifade eder. Bu, büyük dil modeli ve diğer karmaşık AI sistemleri ile çalışanlar için faydalı bir kaynak sağlar.
Kriterlerin ayrıştırılması
- AI model izleme
- Sorun giderme ve sorun tanımlama
- Önerilen onarım oluşturma
- Model performans değerlendirmesi
- LLM değerlendirme ve optimizasyonu

Edwin AI
İT operasyonları için çalışan bir AI ajansı, ihbarda deteksiyon, triaj ve çözüme gecikmeyi önler.

Edwin AI, IT operasyonlarına özgü bir AI एजenttir ve olay algılama, sıralama ve çözümü hızlandırır. IT takımlarına centralized bir platform sağlar, olayları araştırmalarında, etkisi anlamalarında, varsa çözümleri bulmalarında ya da oluşturmalarında, var olan tüm araçlar arasında sistemler arasında geçiş yapmadan uygulaymalarında yardımcı olur. Edwin AI uyarıları eşler, kök nedenleri tanır ve ilk uyarıdan onaylanmış çözüme kadar otomatik olarak iyileştirme başlatır. Geçmişteki örnekleri ve gözlemleri kullanır, patlakları öngörmeyi ve önlemini sağlar. Tüm gözlemler, performans monitörü, güvenliğe ve varlık tanımı veritabanına ilişkin 3000'den fazla araçla entegre olur, böylece anında, gerçek zamanlı, eylemsel bakış açıları sağlar ve siloları ortadan kaldırır. Forrester'ın bir araştırması, Edwin AI'nin bir kompozit organizasyona 313'üncü % ROI kazandırarak, 6 ayın altındaki ödemesi dönen bir döneme ulaştığını bulmuştur.
Kriterlerin ayrıştırılması
- Alert koruması ve gürültü azaltması
- Aİ-besleyeni neden neden önermeleri
- Tarih diline uygun ihbar özeti oluşturma
- İT operasyonu ve спостровльность platformları ile tümleştirmeler
- Automatik triaj akışları
- Gecmis ihbarlardan bilginin zenginleştirilmesi


FoundryAI, gerçek iş akışı yönetimine odaklı AI agentleri yaratan bir geliştirme platformudur. Agent tasarım, test ve sürekli iyileştirme araçlarını bir araya getirerek, takımlar birlikte ayrı sistemleri birer birer bağlamadan prototip üzerinden üretim hattına geçebilmektedirler. Platform, kuruculara belirledikleri görevlere göre agent performansını ölçmeye ve zamanla davranışları iyileştirmeye yollar sunar. Bu nedenle, müşteri desteği, iç işlemler veya tekrarlayan bilgi işleme gibi güvenilirlik ön planda olduğu organizasyonlarda uygun bir platformdur. FoundryAI, teknik ekipleri hedefleyerek, kodlamadan codeless binacılar sunanlarla daha fazla kontrol isteyen ancak tamamen baştan ajanlar inşa etmek kadar hızlı geliştirme hızını isteyenleri target yapıyor.
Kriterlerin ayrıştırılması
- Ajan oluşturma ortamı
- Değerlendirme ve test araçları
- Performans izleme
- İş akış otomasyonu desteği
- Geleneksel iyileşme döngüleri
- İş sistemleri ile entegrasyon
Helicone AI
Tamamı gözden geçirilebilir platform, üretim LLM uygulamalarını izlemek, hata ayıklamak ve geliştirmek için.
Helicone AI, geliştirici odaklı gözlemselliği için özel olarak büyük dil modelleriyle güçlendirilmiş uygulamalar için inşa edilen bir platformdur. Talepler, yanıtlar, maliyetler ve gecikmeler, sağlayıcılar üzerinden izleniyor; bu sayede mühendislik ekipleri, LLM özelliklerinin üretim ortamında nasıl davrandığını tek bir panodan görebilmektedir. Görüntüleme ötesinde, Helicone araçlar sağlar: girdi komutları için hata ayıklama, birden çok adımlık agent akışlarının izlenmesi, değerlendirmeleri çalıştırma ve kullanıcı düzeyinde kullanım takibi. Tekrarlı hata ayıklama, bütçe kontrolü ve kullanıcıların hata yapmadan veri dayanımı ile komutların üzerine giderek geliştirilmesi, Takımı Regresyonu Ayıklama, Bütçe Kontrolü ve Veri Dayandırarak Komutları Geliştirme. Popüler model sağlayıcıları ve çerçeveleri ile entegre olmak için hafif bir proxy veya.async günlüğe kaydolma kullanıyor, bu yüzden mevcut düzenlerin üzerine büyük kod değişiklikleri yapmadan dahil etmek kolaylaşıyor.
Kriterlerin ayrıştırılması
- İstek ve yanıt loglanması
- Maliyet ve token kullanım izlenmesi
- Prompt yönetimi ve sürümleme
- Agent ve session izlenmesi
- Müşterî değerlendirmeler ve ekranlar
- Kullanıcı ve limit analizleri

llm scout
Size ait markanızın ChatGPT, Claude, Perplexite, ve Google AI Özetleri üzerinden nasıl gösterildiği izlenir.

LLM Scout, genel katmanlı arama döneminin işlevselliğini gerçekleştirmek üzere tasarlanmış bir marka izleme aracıdır. Şirketleriniz, ürünleriniz ve rakipleriniz gibi sizinle ilgili yorum ve haberleri AI yardımcı altyapıları ve cevap motorları üzerinden izler ve bu sayede pazarlama ve SEO ekibine, geleneksel analiz araçları tarafından gözden kaçırılan bir kanalın içyoluna ışık tutar. Platform, ChatGPT, Claude, Perplexity ve Google'nin AI Overview gibi sistemlere tekrarlayan sorular göndermektedir. Bunlara yanıt olarak ses payı,_sentiment, referans kaynakları ve zamana göre değişimler raporlanır. Ekibler bu açıklamalar icerisinde buldukları faydalardan yararlanmak suretiyle içerik stratejilerini optimize edebilmektedir. Ayrıca rakiplerinin yerine önerildigi kac alan var, ne zaman ve neden optimizeleme calismalarinin bir sonucu olarak nasil daha etkili oldugu gibi sorulara yanit olarak optimizeleme calismalarinin etkilerini belirleyerek bu bilgileri elde edebilirsiniz.
Kriterlerin ayrıştırılması
- Kendi markanız ve rakiplerinizin zikredilişini izleme
- ChatGPT, Claude, Perplexite ve AI Özetleri üzerinden gerçek zamanlı izleme
- Nitelik öykünüm ve pay öyküleme analizi
- Referans gösterme ve kaynağı görme
- Özel prompt izleme
- Tarihsel eğilim raporu







