Iepriekšējā cīņa · 2024-01-17 UTC

LLM Sadursme — 2024. gada 17. janvāris

No LLM kategorijas. 37 atzīmes izvietotas starp 8 cīnītājiem. ASI:One izcīnīja kroni.

Gala rezultāti

Sastāvs

Cīnītāji

Katra rīka profili, kas piedalījās šajā cīņā, sarindoti pēc to gala rezultāta.

1ASI:One logo

ASI:One

Agentiska AI palīdzība, kas koordinē neattīstītu agentus, lai izpildītu multi-steps uzdevumus.

4.5 (4)
Bezmaksas
ASI:One ekrāna attēls

ASI:One ir cīņas spēka asistents, kas ir būvēts ap ideju par agentu spēju, kurā saziņas interface uzraudzībā var izsaukt un koordinēt specializētas autonomas agentes, lai nodarbotos ar komplikātām pieprasījumiem. Tomēr vietais nav tikai pievienot tekstu, bet tas var plānot, sazināties ar instrumentiem, un izpildīt darbplūsas naudas kontu aizņēmnieka uzrādīšanos. Tas tika izstrādāts cits starp Artificial Superintelligence Alliance ekosistēmu un taisnesīgu agentu tīklu. Tas ir paredzēts kā personas AI pārstāvja, lai pievienotos decentralizētiem agentu tīkliem. Lietotāji var uzrunāt to par visas dienas jautājumiem vai piešķirt tam ilgākas uzdevumus, kā piemēram, pētniecību, saskanību, programmēšanu un dati izmaiņas, kas ir savienoti ar citiem pakalpojumiem.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Konversācijas chat interfeisa
  • Neattīstītu agentu orkestrēšana
  • Multi-steps uzdevumu plānošana un izpildīšana
  • Saites saīsināšana ar ārējiem agentiem un pakalpojumiem
  • Personiska palīdzības stils memori un konteksts
  • Būtībā uztaisīta uz ASI apvienība agenta staka
2Gemini 2.0 Flash logo

Gemini 2.0 Flash

Google ātrs, multimediju AI modelis, izstrādāts reāllaika agentu uzdevumiem ar 1M tokenu konteksta logu.

4.6 (5)
Bezmaksas
Gemini 2.0 Flash ekrāna attēls

Gemini 2.0 Flash ir nākamās paaudzes modelis no Google DeepMind, kas ir optimizēts ātrumā, rādvērtībai un multimodālai prasmē. Tas piešķir teksstu, bildes, audioskopu un video ievadi ar iepriekš un var ģenerēt tekstu, bildes un audioskopu izvadi, kas to padara pareizu izvēlu saistībā ar izkusiņiem. Izdots ar agendentu darbiem sevī piesātinātiem workflowu, modelis atbalsta savdabisko tools lietošanu, funkciju saukšanu un 1 M tokenu kontekstva logu, lai apsūtītu lielus dokumentus, kodu bāzes vai ilgāku sesiju apstrādi. Neliela trūkuma laiks padara to izdzīvotāju izvēli par asistentiem, reālbraukšanas analizēm un ražošanas skaliņos uzturēšanai. Programmatūras izstrādātāji var piekļūt Gemini 2.0 Flash atbalstam caur Gemini API, Google AI Studio un Vertex AI, ar SDK palīdzību pieejamu galvenajās valodās.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 1M tokenu konteksta logs
  • Multimodālais ievads: teksts, attēls, audio, video
  • Nativs rīku izsaukums un koda izpilde
  • Reāllaika straumēšanas atbildes
  • Attēlu un audio ģenerēšana
  • Pieejams caur Gemini API un Vertex AI
3Mistral Small 3 logo

Mistral Small 3

Kompakts atvērtā koda LLM, kas nodrošina konkurētspējīgu veiktspēju ar zemākām aprēķinu prasībām.

4.5 (4)
Bezmaksas
Mistral Small 3 ekrāna attēls

Mistral Small 3 ir viegls liela valodas modelis no Mistral AI, kas paredzēts, lai sniegtu spēcīgas loģikas un ģenerēšanas iespējas, vienlaikus efektīvi darbojoties uz maigākas aparatūras. Tas ir paredzēts izstrādētājiem un organizācijām, kas vēlas spēcīgu mākslīgā intelekta risinājumu bez robežas mēroga modeļu infrastruktūras izmaksām. Izlaists ar atvērtu licenci, modelis var tikt pašpiedalīts, precīzi justots un integrēts komerciālajās lietojumprogrammās. Tās ātruma, precizitātes un resursu efektivitātes līdzsvars padara to piemērotu tērzēšanas asistentiem, saturu ģenerēšanai, kodēšanas uzdevumiem un vietējai izvietošanai, kur svarīga reakcijas laiks vai privātums.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Atvērtas svara modeļa izlaide
  • Optimizēts efektīvai inferencijai
  • Konkurētspējīgi testu rezultāti
  • Atbalsta precīzu ielietošanu un pielāgošanu
  • Piemērots vietējai izvietošanai
  • Daudzvalodu teksta ģenerēšana
4OpenAI o3 logo

OpenAI o3

OpenAI vērsts uz prasmīgu domāšanu sarežģītām, vairāku soli problēmu risināšanai

4.0 (4)
Bezmaksas
OpenAI o3 ekrāna attēls

OpenAI o3 ir priekšstāvjiesto precesiju modelis, kas saskaņota ar problēmu risināšanu, kas prasa pazīstigu saskarsmi un noteiktu, kārtātu domāšanu. Tam ir pamatsērija o-sērijas pieejas principos, kurās koksā daudz lieliem datorzinību resursiem izmantodami tiešās ieteikšanas laikā, veidojot plānu, pārbaudot un izrādījumu, tādējādi tas ir īpaši piemērots uzdevumiem matematikā, programmatūras izstrādē, zinātnē un logiskajā analizē. Salīdzinot ar vispusīgām dialoga modelēm, o3 piesaista dziļumu pie ātruma. Tas var saskatīt neizpratnīgas norīšanas priekšmetus, vērtē dažādas metodes un izveidot vērtspilnu iegultus uz biežotākajām testem, kas piesaista domāšanu un lietojumprogrammām. Ražotāji var piekļūt to nolūkiem caur OpenAI API un ChatGPT, kur tas tiešsavienojas ar līdzekliem, tādiem kā web brīvība, Python, un failu pārvalde. Modelis tiek veidots pēc pamatprogrammatūras, inženieriem, izstrādātājiem un enerģisks lietotājiem, kurajiem nepieciema stiprāka precizitāte īsā laika problēmās un tas jāsaskaņo ar augstāku kvalitāti, kas varētu ietverēt pieauga lētājā un kustību dēļ latences. Jālieto sākotnējie resursi maksimāli efektīvi, lai iegūtu lielāko izaiciendas.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Paplašināta domāšanas ķēde
  • Rīku izmantošana, tostarp kods, tīmeklis un failu ievades
  • Liela konteksta logs garajiem dokumentiem
  • API un ChatGPT pieejamība
  • Uzlabota precizitāte STEM pārbaudē
  • Atbalsta sarežģītus agentu darbplūsmas
5DeepSeek R1 logo

DeepSeek R1

Atvērts lielais valodas modelis, kas izceļas loģikas, matemātikas un kodēšanas uzdevumos, ar MIT licence brīvas izmantošanas un modificēšanas tiesībām.

4.8 (4)
Bezmaksas
DeepSeek R1 ekrāna attēls

DeepSeek R1 ir atvērtais kodeksa liela valodu modelis, kas pārveidojas ar analīzi, matemātikas uzdevumiem un programmēšanas uzskaņošanai. Tā lieto Mixture of Experts (MoE) architektūru ar 37T aktīviem parametriem un 671T parametriem kopsummu, atbalstot 128T T maiņu ilgumu. Modelis iekļauj pazīstītus apmācības mācīšanas tehnikas, lai sasniegtu pašizcelšanos, daudzgadīgu refleksiju un cilvēkam piemērotu analīzes spēju. DeepSeek R1 ir sasniedzis uzlabotu panākumu daudzos benchmarkiem, to skaitā 97,3% precīzību MATH-500, 79,8% veiksmību AIME 2024, un ir pārspējušis 96,3% Codeforces dalībnieku. Modelis ir pieejams dažādos variantos, no 1,5T līdz 70T parametru, un tiek izdodams ar MIT licenzi no bezmaksas izmantošanas un modificēšanas. DeepSeek R1 var tiešsaistē lietot bez maksas, un WebGPU-accelerētais variantam ir iespēja izmantot to arī lokāli pārlūkā. Modēls ir paredzēts kompleksu problēmu risināšanai, daudzu valodu saprīšanai un ražošanas kvalitātes koda izveidošanai. To pamatīgās prasības ietver izņēmuma matemātisko argumentāciju, kodu izveidošanu un natīviegas valodu saprīšanu spējas. Tomēr, kā atvērtā-souce modēla, to saskaņošana un speciālu lietotāju gadījumu papildināšana var prasīt tehnisko pieredzi. DeepSeek R1 atrodas tajos pamatos, kur ir augsti ierindoti pasaules AI modeli, savas iespējas izvietojoties virs vadošo, privātīgu risinājumu līmeņa modeliem. Atvērtā sūtīšanas dabība ļāwa ar komūnu sadarbību veikt attīstību un aizsāk, ietverot plānotos multimodālās atbalsta, saruninieka paplašinājumu un sadali atvasiņu palielinājumu. Modelis ir pilnīgi cēloņu mācīšanās attīstība, kas ļauj to sasniedzēt GPT-4 līmeņa matemātikas rezultātus ar vēlams zemāku cenu. Ceļa gatavības vizualizācijas iespēja skar ar IA "melna došu" izaicinājumiem, nododot ieksversmu modela domāšanas procesā. DeepSeek R1 API piedāvā atvērtā izmantošanas OpenAI atbilstīgu punktu, integrēšanai cenā 0,14 USD miljonos tokenu. Modela svarus ir atvērtā izmantošanas, ļaujot komerciālu izmantošanu un modificēšanu.

Kritēriju sadalījums

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Ekspertu sajaukuma (MoE) arhitektūra
  • Paplašinātas pastiprināšanas mācīšanās tehnoloģijas
  • Pašpārbaudes un vairāku soļu refleksijas iespējas
  • Cilvēka saskaņota loģiskā domāšana
  • Atbalsts 128 K konteksta garumam
  • OpenAI-saderīgs API galapunkts
6DeepSeek V3 logo

DeepSeek V3

Atvērtā pirmkoda "mixture-of-experts" modelis, kas piedāvā GPT-4o līmeņa izpēti par daļi no izdevumiem.

4.8 (6)
Bezmaksas
DeepSeek V3 ekrāna attēls

DeepSeek V3 ir liela skala līdzekļu (MoE) valodu modelis, kas tika izstrādāts ar DeepSeek AI. Tas aktivizē tikai daļu no visa sava pārmērīga parametriem katrā tokenā, ļaujot to pieejamiem rezultātiem uzskaitīšanai, matematikai un programmatūras uzdevumiem, saglabājot izvadusmaksu izdevumu noteicošāki zemīgi salīdzinājumā ar līdzīgiem blīviem modeliem. Pabeigts ar atvērtām svaru vienībām, DeepSeek V3 ir kļuvis par populāru izvēli raksturotājiem un zinātniekiem, kas ir jāiekārto spēcīga pamatskate, kas var būt pašreizēji jāiekārto pārbaudīti vai integretā ar API. Pierādījumi iekļauj to kā vienu no vadošajām privātpiedāvējamām modelēm, kā GPT-4o, galvenokārt ar matemātikas un logiskās izvēles pārbaudes. Modela ir labi izvēlēta par tehniskajiem palīgiem, kodu ģenerēšanas plūsmām, pētniecības darbdarību un jebkuru lietojumprogrammu, kurās lielākā nozīme ir rādītāju kvalitāte un biļetenam efektivitāte.

Kritēriju sadalījums

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs1
Reliability0
  • Mixture-of-experts arhitektūra
  • Konkurētspējīgas izpētes un matemātikas pārbaudījumu rezultāti
  • Atvērtā pirmkoda modeļa svarbaji
  • API piekļuve caur DeepSeek platformu
  • Lielas konteksta loga atbalsts
  • Piemērots precizēšanai
7Llama 3.3 logo

Llama 3.3

Meta daudzvalodu atvērtās svara LLM, pielāgota efektīvai, augstas kvalitātes teksta ģenerācijai.

4.8 (5)
Bezmaksas
Llama 3.3 ekrāna attēls

Llama 3.3 ir Meta liels valodu modelis, kas paredzēts sniegt spēcīgu loģisku domāšanu, kodēšanu un daudzvalodu iespējas, vienlaikus būdams efektīvāks darbībā nekā agrākie galvenie modeļi. Tas atbalsta plašu valodu spektru un ir piemērots tērzēšanas asistentiem, saturu ģenerēšanai, kopsavilkumiem un izstrādātāju rīkiem. Izlaists ar atvērtām svarbēm, tas var tikt izvietots vietējā infrastruktūrā vai caur galvenajiem mākoņ- un interpretācijas pakalpojumu sniedzējiem, nodrošinot komandām elastību attiecībā uz izmaksām, aizturi un datu apstrādi. Tās instrukciju pielāgota versija ir optimizēta precīzai komandu izpildei un noderīgu, sarunprātīgu atbildi ražošanu. Izstrādātāji bieži izmanto Llama 3.3 kā pamatu, lai precīzāk pielāgotu domēna specifiskas lietojumprogrammas, informācijas atgūšanas papildinātas ģenerācijas sistēmas un agentu darba plūsmas.

Kritēriju sadalījums

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability0
  • Daudzvalodu teksta ģenerēšana
  • Instrukciju pielāgota tērzēšanas versija
  • Garā konteksta atbalsts
  • Kodēšanas un loģiskās domāšanas iespējas
  • Atvērtas svarbju iespējas precīzam pielāgošanai
  • Saderīgs ar galvenajiem interpretācijas ietvaros
8Pronoia logo

Pronoia

Arābu valodas oriģinālais liels valodas modelis, kurš ir paredzēts savienojumam un ģenerēšanai ar dzimtās kvalitātes izpratni

4.7 (6)
Bezmaksas

Pronoia ir liela valodas modelis, kas specificēti fine-tunēts, lai precīzi pamostītos arābu valodu un sniegt precīzākas komprehijs, izveidošanas un pēdējo līdzekļu izvēles ietvaros, tādējādi pārspējojot vispārīgas, daudzvalodīgu modelī. Tā ir izaugsme arābu valodu orientēto LLM, ar optimizācijām dialektiem, klasiciskajiem formas formām un mūsdienu standartu arābu valodai. Šis models var tiek izmantots darbībām, kādām ir saturu rakstīšana, saistīšana, tulkošana, klientu atbalsts un dzirdēšana, kādas tiek izmantotas Arābijas valstu tirgos. Koncentrējoties uz trainings darbu uz Arābijas duļķiem modelis norķina svarīgi aspekti, kā arī gramatiskās formas un dialektu speciālās burtu zīmju noteikšanu, kā arī kultūras kontekstu, kas plašākajos modelos nav tik konsekventi nodrošināti.

Kritēriju sadalījums

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability0
  • Arābu valodas optimizēts valodas modelis
  • Teksta ģenerēšana un kopsavilkuma veidošana
  • Tulkošanas atbalsts
  • Konversāciju un čata robotu iespējas
  • Piemērots uzņēmumu arābu NLP
  • MSA un dialektu pārvaldība