Geçmiş savaş · 2024-01-17 UTC
LLM Hesaplaşma — 17 Ocak 2024
LLM kategorisinden. 8 savaşçıya 37 işaret yerleştirildi. ASI:One tacı aldı.
Nihai sıralama
Kadro
Savaşçılar
Bu savaşta yarışan her aracın profilleri, nihai puanlarına göre sıralandı.

ASI:One
Özneyi AI yardımcıları arasında otomatik ajansları koordine eden multi-adım görevleri tamamlamak için özendirici bir AI yardımcısı.

ASI:One, agnetik zekâya dayalı bir AI yardımcısıdır. Bu yardımcısı, bir söyleşi arayüzü aracılığıyla karmaşık talepleri işletebilecek uzman özerk ajansları gönderebilir ve koordine edebilir. Tek metin döndürmesi yerine, ASI:One planlama, araç çağrısı ve kullanıcının adımlarını gerçekleştirmek için akış işlemleri gerçekleştirebilir. Artfakirli Süper Zekâ Allianse ekosistemine dayalı olarak tasarlanıyor ASI:One, merkezi olmayan ajan ağı ile entegre edilebilir kişisel bir AI.agent. Kullanıcılar her gün gelen sorular için ona sohbet edebilir ya da bağlantılu hizmetler üzerinden yapılacak aramalardan ödünç alınan daha uzun görevler gibi karşılaştırmalar, araştırmalar, planlama ve veri aramaları için onu yetkilendirebilirler.
Kriterlerin ayrıştırılması
- Sürdürülebilir diyalog arayüzü
- Otonom agent koordinasyon
- Çok adımlı görev planlama ve uygulanması
- Dış agent ve servis bağlantılar
- Bireysel yardımcı gibi hafıza ve bağlam
- ASI Alandağı Stack a alınmak

Gemini 2.0 Flash
Google tarafından geliştirilen ve 1M-token bağlam penceresine sahip gerçek zamanlı ajitör görevler için hızlı çokmodlı AI modeli.

Gemini 2.0 Flash, Google DeepMind'in hız, ölçek ve çok modlu düşünme için optimize edilmiş sonraki nesil bir modelidir. Metin, görüntü, ses ve video gibi inputler alır ve metin, görüntü veya ses gibi output oluşturabilir, bu da zengin interaktif uygulamalar için uygun kılmaktadır. Ağ Üstü (Agent) akışları için tasarlanmış, model native araç kullanılmasını destekler, fonksiyon çağrısında bulundurur ve 1M-token konteksti penceresi büyük belgeleri, kod tabanlarını ya da uzun süren session'ları işler. Düşük gecikme (Latentce) nedenleriyle, asistanlar, gerçek zaman analizi ve üretkenlik açısından büyük ölçekli dağıtım için pratik bir seçimdir. Geliştiriciler, Gemini API üzerinden, Google AI Studio ve Vertex AI üzerinden Gemini 2.0 Flash'a erişebilir. Başlıca dillerde SDK'lar mevcuttur.
Kriterlerin ayrıştırılması
- 1M-token bağlam penceresi
- Metin, resim, audio, video gibi çokmodlu giriş
- Kabile araç çağrısı ve kod yürütme
- Gerçek zamanlı akış cevapları
- Resim ve ses üretim
- Gemini API ve Vertex AI üzerinden kullanılabilir

Mistral Small 3
Kompakt bir açık kaynak LLM, daha düşük hesaplama talepleri ile rekabetçi performans sunar.

Mistral Small 3, hafif ancak güçsüz olmayan büyük dil modellerinden biridir. Hafif donanımlı ortamlarda yüksek verimlilik sağlayan Mistral Small 3, geliştiriciler ve kuruluşlar için frontier seviyesindeki modellerin altyapı maliyetlerinden arınma imkanı sunmayı amaçlıyor. Açık lisans altında yayınlanacak olan bu model, kendi sunucuda barındırma, küçültülmüş, ve ticari uygulamalara entegre edilebilir. Hızın, doğruluğun ve kaynak verimliliğinin dengelediği nedenlerle, chat asistanları, içerik oluşturma, kod görevleri, ve gecikme veya gizlilik kümelerinde önemsediği uygulamalarda uygun bir modeldir.
Kriterlerin ayrıştırılması
- Genel ağırlık modeli çıkışı
- Verimli inferans için optimize
- Rekabetçi benchmark sonuçları
- Tayin ve özelleştirmeyi destekler
- On-premise dağıtım için uygun
- Diller arası metin üretimini destekler

OpenAI o3
Kompleks, çok adımlı problem çözmek için OpenAI'nin gelişmiş mantıksal modülü

OpenAI o3, dikkatli ve adım başı düşmeyi gerektiren problémeleri ele almak için tasarlanmış bir sınır düşüncesi modelidir. Ö-serisi yaklaşımını temel alır ve cevapları planlamak, doğrulamak ve gözden geçirmek için inferences zamanında daha çok işlem yapmakta, matematik, kodlama, bilim ve mantıksal analize ilişkin görevler için uygun bir modeldir. Genel amaçlı sohbet modellerine kıyasla, o3 derinlikten hız üzerinde önceliklendirir. Belirsiz emirleri parçalamak, birden fazla şekilde değerlendirmek ve düşünme ve araç kullanımı gibi stres testlerine tabi olan ölçütlere güvenilir daha fazla girdi üretmeyi hedefler. Geliştiriciler, OpenAI API'sinden ve ChatGPT'den ulaşım sağlayarak web tarayımı, Python ve dosya analizine benzer araçlarla entegre olmak suretiyle erişebilir. Model, zor sorunlara kesinlik için daha yüksek kalite sonuçları sağlamak için bazı gecikme ve maliyeti ödemek istemeyen araştırmacılar, mühendisler ve deneyimli kullanıcıları hedef alan bir modeldir.
Kriterlerin ayrıştırılması
- Geniş zincir mantık düşüncesi
- Araç kullanım dahil kod, web ve dosya girişleri
- Büyük bağlam penceresi uzun belgeler için
- API ve ChatGPT erişimi
- STEM gösterge kümelerinde geliştirilen doğruluk
- Destekli kompleks aganjik akışlar

DeepSeek R1
Genel amacıyla olan büyük dil modellerinden biri olan DeepSeek R1, mantıklarında, matematik hesaplamalarında ve kodlama görevlerinde çok yüksek başarıya ulaştı ve MIT lisansı ile ücretsiz olarak kullanım ve değiştirme sağlar.

DeepSeek R1, mantık, matematik ve kodlama görevlerinde üstün performans gösteren açık kaynaklı büyük dil modelidir. 37 milyar etkin parametresi ile 671 milyar toplam parametresi bulunan bir Mixture of Experts (MoE) mimarisi kullanır ve 128K metin uzunluğu destekler. Model, selbst doğrulama, çok adımlı yansıtma ve insan-çerçevede mantık yetenekleri için gelişmiş reforlama öğrenme teknikleri kullanır. DeepSeek R1, MATH-500'de %97.3 doğruluk, AIME 2024'te %79.8 geçme oranı ile çeşitli ölçütlerde en iyi performans göstermiştir ve Codeforces katılımcılarını %96.3'ten daha fazla atlatabilmiştir. Model 1,5 milyar ila 70 milyar parametreye varan birden fazla varyansta mevcuttur ve MIT lisansıyla ücretsiz olarak kullanılıp modifiye edilebilir. DeepSeek R1, online olarak ücretsiz olarak kullanılabilir ve WebGPU hızlandırmalı bir sürümü de yerel olarak bir tarayıcıda çalıştırılabilir. Model, karmaşık problem çözme, çok dilli anlayış ve üretim sınıfı kod oluşturma için tasarlanmıştır. Güçleri, olağanüstü matematiksel mantık becerileri, kod oluşturma ve doğallaşmış dil anlayış yeteneklerdir. Ancak, açık kaynak olan bu model, belirli kullanım alanları için konuşlandırmaya ve ayarlamaya teknik uzmanlık gerektirebilir. DeepSeek R1, küresel çapta lider özel çözümlere benzeyen performansıyla üst sıralarda yer almaktadır. Açık kaynaklı yapısı ile topluma açık geliştirme ve sürekli güncellemelere izin veriyor, planlanan multimodal destek, sohbet iyileştirme ve dağıtımlı inferences optimizations dahil. Model, GPT-4 seviyesindeki matematik performansı elde etmek için çok daha düşük bir maliyetle geliştirilmiş bir güçlendirilmiş öğrenme temelinde çalışır. Zincirleme düşünme görüntüleme yeteneği AI'de 'kazanılırsa açıklanmaz' (black box) zorluklarını giderir ve modelin düşünme sürecine ışık tutar. DeepSeek R1'in API'si, entegrasyon için OpenAI uyumlu bir uç nokta sunmakta, 1000000 token için 0,14 dolara satılmaktadır. Modelin ağırlıkları açık kaynakte olup, ticari kullanma ve değişiklik yapma imkanı sunmaktadır.
Kriterlerin ayrıştırılması
- Sertifikalı Araçlar Mimarisine Gecis (Mixture of Experts / MoE) mimarisi
- Gelişmiş Teşvik Öğrenme Teknolojileri
- Kendiliğinden Doğrulama ve Çok Adımli Düşünce Yetenekleri
- İnsan Odaklı Mantık
- 128K Kontekst Uzunluğu Desteklemesi
- OpenAI-Kompatible API Endpoint'i

DeepSeek V3
Açık kaynaklı bir uzmanın uzmanların bir arada çalışmasının ötesinde, GPT-4 seviyesindeki akıl yürütme yeteneklerini çok daha düşük maliyetlerde sunar.

DeepSeek V3, DeepSeek AI tarafından geliştirilen büyük ölçekli bir mixture-of-expert (MoE) dil modelidir. Tek bir token için yalnızca toplam parametrelerinin birSubset'ini aktif eder, bu sayede derin düşünme, matematik ve kodlama gibi görevlerde güçlü performans sunarken, kıyaslayamayacağınız yoğunluklu modellerden katma maliyetini önemli ölçüde düşürür. Açık ağırlıklarla DeepSeek V3, geliştiriciler ve araştırmacılar tarafından kendini barındırmak,ayarlamak ya da API aracılığıyla entegre etmek için güçlü bir temel modeli içeren yaygın bir tercih haline geldi.Benchmark sonuçlarına göre, matematiksel ve logiksel akıl yürütme ölçütlerinde özellikle GPT-4o gibi lider tüzel modellerine karşı rekabetçi bir konuma yer almayı başardı. Model, teknik yardımcılar, kod oluşturma pipeline'leri, araştırma akışlarını ve bütçe verimliliğine sahip herhangi bir uygulama için geçerli bir nedenleme kalitesi sağlar.
Kriterlerin ayrıştırılması
- Uzmanların uzmanların bir arada çalışması mimarisi
- Kompotatif akıl yürütme ve matematik performansı
- Açık kaynaklı model ağı
- API erişimi DeepSeek platformu üzerinden
- Geniş bir contexto penceresi desteği
- Üstüne uzmanlaşmış bir model
Llama 3.3
Meta'nın açık-önlü multibölgesel LLM'nin yüksek kaliteli metin oluşumu için verimli bir şekilde ayarlanmış sürümü.

Llama 3.3, Meta tarafından tasarlanmış büyücek dil modeli güçlü mantıksal düşünme yetenekleri, kodlama yetenekleri ve çoklu dil desteği sağlayarak daha önceki bayrak modellerinden daha verimli bir şekilde çalışılmasını sağlamak için tasarlanmıştır. Geniş dil yelpazesini destekler ve sohbet yardımcı programları, içerik üretimi, özetleme ve geliştirici araçları için uygundur. Açık ağırlıklar ile yayınlandı, araçlar için bulut ve varsayım sağlayıcıları ile önceden yüklenmesi veya geçici olarak kurulumu mümkün kılıyor. Bu sayede takımlar arasındaki maliyet, gecikme ve veri yönetimi konusunda esneklik sağlıyor. İşlemler için optiklenen variantı doğru talimatları takip ettiği ve yardımcı, konuşmacı yanıtlar üretebildiği için optimize edildi. Geliştiriciler, LLaMa 3.3'ü genellikle alan özgü uygulamalar için incelme eğitimi yapmak, veri getirme artırımı jenerasyon sistemleri ve ajanlı akışlar olarak kullanır.
Kriterlerin ayrıştırılması
- Çoklu dil metin oluşumu
- Tartışmalı sürüşü ayarlanmış sohbet varyantı
- Uzun-koşulsal destek
- Kodlama ve mantık becerileri
- Açık ağırlıklar için ince ayar
- Büyük veri işleme için kullanılabilen büyük olan temel çalışma ortamı desteği
Pronoia
Büyük dil modelinin Arapça-öncesi hali, natiftir kaliteye anlama ve oluşturma için optimize ediliyor.
Pronoia, genel-purpose çok dilli modellere kıyasla daha doğru comprehension, generation ve reasoning sunmak için özel olarak fine-tuned Arapça bir dil modelidir. Arapça odaklı bir lider LLM olarak konumlandırılmış olup, diyalektler, klasik formlar ve modern standart Arapça için optimizasyonlar içerir. Model, içerik oluşturma, özetleme, çeviri, müşteri desteği ve Arapça konuşma AI dahil olmak üzere Arapça konuşma pazarlarında görevler için kullanılabilir. İkincil veri üzerinde yoğunlaşmak suretiyle Arapça morphology, aksan ve kültürel bağlam gibi daralan modellerin tutarlı bir şekilde içermeye çalıştığı nuances'u hedefleyen Pronoia, Arapça konuşma için daha iyi sonuçlar sağlar.
Kriterlerin ayrıştırılması
- Arapça-özlendirilmiş dil modeli
- Metin oluşturma ve özetleme
- Çeviri desteği
- Söylenen ve sohbet botu özellikleri
- Arapca NLP'li企业 için uygun
- MSA ve lehçelerin kapsamı





