Pretekla bitka · 2025-01-11 UTC
AI Agent Development Frameworks Obračun — 11. januar 2025
Iz kategorije AI Agent Development Frameworks. 38 oznake postavljenih med 10 borci. Mastra je osvojil krono.
Končna razvrstitev
Postava
Borci
Profili vsakega orodja, ki je tekmovalo v tej bitki, razvrščeni po končnem rezultatu.

Mastra
Odprtokodni TypeScript okvir za izdelavo umetnostnih agentov, delovnih tokov, RAG, spomina in MCP, z opcionalnim oblakovnim studiom in opazljivostjo.

Mastra je odprtokodni TypeScript okvir za izdelavo aplikacij in agentov, ki delujejo na umetni inteligenci. Zagotavlja nabor orodij, ki omogočajo razvijalcem, da preidejo od ideje do izvedbe, vključno z agenti, delovnimi tokovi, spominom, delovnimi prostori in opazljivostjo. Mastra se integrira z različnimi frontend in backend okvirji ter jo je mogoče namestiti kot samostojni strežnik. Omogoča razvijalcem, da izdelajo različne zmogljivosti, kot so notranji avtomatizacijski agenti, agenti, ki naslavljajo stranke, in več. Mastra vključuje funkcije, kot so vgrajena opazljivost, ponovljivi preveritvi in predpomnjene ponovljive pretоке. Je zasnovan za podporno hitro rastekle izstrele in velike globalne organizacije. Arhitektura Mastra je osredotočena na agente, ki jih je mogoče opredeliti z navodili, modeli, orodji in izvrševalnim obnašanjem. Agenti lahko komunicirajo z uporabniki, izvajajo naloge in prenašajo v tokove izdelkov. Okvir vsebuje tudi vgrajen sistem dogodb za dogodke, pa tudi sistem za objavljanje in naročanje na dogodke z Redis Streams in Google Cloud Pub/Sub. Mastra ima bogat ekosistem virov, vključno z knjigami, blogi in vodili. Ima veliko skupnost uporabnikov in je razširjen v različnih panogah.
Razdelitev kriterijev
- Agenti
- Delovni tokovi
- Spomin
- Delovna mesta
- Opazljivost
- Vgrajeni sistem dogodkov

AI Legion
Odprtokodna platforma za ustvarjanje avtonomnih AI agentov, ki sodelujejo pri doseganju nalog.

AI Legion je odprtokodna platforma za ustvarjanje avtonomnih AI agentov, ki sodelujejo pri doseganju nalog. Uporablja velike jezikovne modele, kot so GPT-3.5-turbo in GPT-4, da omogoči agentom sodelovanje in doseganje zapletenih ciljev. Platforma ponuja okvir za nastavljanje in upravljanje teh agentov, vključno z konfiguracijskimi datotekami, APIs in delovnimi tokovi. AI Legion je zasnovan tako, da je razširljiv in prilagodljiv, kar uporabnikom omogoča ustvarjanje in integracijo lastnih modelov, dejanj ter funkcionalnosti. Platforma je primerna za različne primere uporabe, vključno z raziskavami, razvojem in uvajanjem avtonomnih AI sistemov. Ustvarjanje okolja AI Legion vključuje namestitev potrebnih odvisnosti, vključno z Node.js in OpenAI API keys. Agentje se nato lahko zagonete in jih lahko upravljate prek konzole. Platforma vključuje tudi funkcije za upravljanje stanja agentov, vključno z možnostjo brisanja zapiskov dogodkov in ponovnega zagona agentov z lastnimi konfiguracijami. AI Legion je zmogljivo orodje za gradnjo in uvajanje avtonomnih AI sistemov, njegovo odprtokodno naravo pa omogoča širok dostop uporabnikom. Vendar pa zahteva obsežno tehnično znanje in napor pri konfiguraciji, da se učinkovito nastavi in uporablja. Ena ključna korist AI Legion je njegova sposobnost, da omogoči agentom, da se učijo in se prilagajajo skozi čas, z uporabo kombinacije strojnega učenja in tehnik grafov znanja. To agentom omogoča izboljšanje njihove zmogljivosti in sposobnosti odločanja, ko interagirajo z okoljem. Vendar pa AI Legion predstavlja tudi več izzivov in omejitev, vključno z zahtevo po obsežnih nastavitvah in upravljanju, tveganjem napak agentov in neskončnih zank ter potencialom visokih števila tokenov in stroškov uporabe API. Poleg tega lahko uporaba velikih jezikovnih modelov povzroči zaskrbljenost glede pristranskosti in natančnosti. Kar zadeva specifične funkcije, AI Legion vključuje podporo za spletno iskanje, lastne iskalne motore in API-je, pa tudi možnost upravljanja stanja agentov ter ponovnega zagona agentov z lastnimi nastavitvami. Platforma je prav tako zelo razširljiva, kar uporabnikom omogoča ustvarjanje in integracijo lastnih modelov, dejanj ter funkcij. Nekatere potencialne primere uporabe AI Legion vključujejo raziskovanje in razvoj avtonomnih AI sistemov, uvajanje delovnih tokov in procesov, opolnomočenih z AI, ter ustvarjanje prilagojenih orodij in aplikacij, opolnomočenih z AI. Na splošno je AI Legion močna in razširljiva platforma za gradnjo ter uvajanje avtonomnih AI sistemov, vendar zahteva znatno tehnično strokovnost in konfiguracijski trud za učinkovito uporabo.
Razdelitev kriterijev
- Iskanje na spletu
- Prilagojeni iskalni sistemi
- API in webhooks za integracijo
- Upravljanje stanja agentov
- Ustvarjanje prilagojenih modelov in akcij
- Mreža znanja in zmogljivosti strojnega učenja

AutoML-Agent
Odprtokodni večagentni LLM okvir, ki avtomatizira celovite tokove strojnega učenja

AutoML-Agent je odprtokodni okvir, ki uporablja usklajene agente velikih jezikovnih modelov za upravljanje celotnega življenjskega cikla strojnega učenja. Namesto, da bi se zanašali na en sam model ali skript, delegira naloge, kot so razumevanje podatkov, predobdelava, izbira modela, učenje in ocena, med specializiranimi agenti, ki sodelujejo za skupni cilj. Spletni okvir je namenjen raziskovalcem in razvijalcem, ki želijo avtomatizirati eksperimentiranje brez pisanja obsežnih pipeline kode. Z opisom nabora podatkov in cilja v naravnem jeziku lahko uporabniki agentom omogočijo predlaganje, gradnjo in iteriranje nad kandidatskimi rešitvami, medtem ko se po poti prikazujejo rezultati in razlaga. Ker je odprt vir, lahko AutoML-Agent razširite z lastnimi agenti, orodji ali model backends, kar ga naredi uporaben tako kot praktični AutoML sistem kot tudi kot raziskovalno testno okolje za delovne tokove več agentov.
Razdelitev kriterijev
- Orkestracija več agentov LLM
- Avtomatizirano predprocesiranje podatkov in upravljanje lastnosti
- Izbor modela in iskanje hiperpodatkov
- Generiranje tokov za učenje in vrednotenje
- Določanje nalog v naravnem jeziku
- Razširljiva arhitektura za po meri izdelane agente

Cerebrum: AIOS SDK
SDK za razvoj in implementacijo AI agentov na osnovi LLM v okviru AIOS.

Cerebrum je SDK za razvoj in uvajanje LLM-žnih AI agentov v okviru AIOS (AI Agent Operating System). AIOS obravnava izzive, kot so razporejanje, preklapljanje kontekstov, upravljanje pomnilnika in upravljanje orodij za LLM-je. SDK Cerebrum omogoča razvijalcem, da gradijo in izvajajo aplikacije agentov z interakcijo s kernelom AIOS. Podpira tako Web UI kot Terminal UI. SDK vključuje funkcije za izpis razpoložljivih LLM-jev, agentov in orodij, pa tudi za prenos, nalaganje in izvajanje agentov in orodij. Cerebrum je zasnovan za uporabnike in razvijalce agentov, jim omogoča ustvarjanje in uvajanje AI agent aplikacij.
Razdelitev kriterijev
- Razvoj in implementacija agentov
- Upravljanje AI agentov na osnovi LLM
- Podpora za Web UI in Terminal UI
- Upravljanje agentov in orodij
- Izpis razpoložljivih LLM, agentov in orodij
- Prenos in nalaganje agentov in orodij

Gemma 3
Odprtokodni AI model, optimiziran za delovanje na eni GPU, ki podpira multimodalne vhodne podatke in več kot 140 jezikov.

Gemma 3 je zbirka lahkih, vrhunskih odprtih modelov, zasnovanih za izvajanje na napravah, posebej optimiziranih za delovanje na eni GPU. Podpira multimodalne vhodne podatke in več kot 140 jezikov. Model je na voljo v različnih velikostih (1B, 4B, 12B in 27B), kar razvijalcem omogoča, da izberejo najbolj primeren glede na njihovo strojno opremo in potrebe po zmogljivosti. Gemma 3 ponuja napredne zmožnosti besedilnega in vizualnega sklepanja, kontekstno okno s 128 k tokeni ter klicanje funkcij za kompleksna opravila. Vključuje tudi kvantizirane različice za hitrejše delovanje in manjše računalniške zahteve. Model je del Googlove zavezanosti, da uporabno AI tehnologijo naredi dostopno, in temelji na istem raziskovalnem in tehnološkem osnovju, ki poganja njihove modele Gemini 2.0. Gemma 3 je zasnovana tako, da razvijalcem omogoča ustvarjanje AI aplikacij, ki lahko tečejo neposredno na napravah, kot so telefoni, prenosniki in delovne postaje. Gemma 3 zagotavlja vrhunsko zmogljivost glede na svojo velikost, pri čemer prekaša druge modele, kot so Llama3-405B, DeepSeek-V3 in o3-mini, v preliminarnih ocenah človeških preferenc. Omogoča globalne aplikacije z izklopno podporo za več kot 35 jezikov ter predtrenirano podporo za več kot 140 jezikov. Model omogoča ustvarjanje AI-podprtih delovnih tokov s pomočjo function calling in structured output. Razvoj Gemma 3 je vključeval stroge varnostne protokole, kot so obsežno upravljanje podatkov, usklajevanje z varnostnimi politikami preko fino nastavljanja ter robustne benchmark ocene. Družina odprtih modelov Gemma je doživela znatno sprejetost, z več kot 100 milijoni prenosov in živahno skupnostjo, ki je ustvarila več kot 60.000 različic Gemma. Zmožnosti Gemma 3 jo naredijo primerno za razvijalce, ki želijo ustvarjati privlačne uporabniške izkušnje, ki se lahko prilegajo na en sam GPU ali TPU host.
Razdelitev kriterijev
- podpora za multimodalni AI
- razvoj z osredotočenostjo na odgovornost
- obsežno fino nastavljanje
- podpora za 140 jezikov
- izboljšana zmogljivost

MiniMax‑M1
Odprtokodni velikozahodni model za sklepanje z 1 milijonom žetonov v kontekstu in hibridno arhitekturo Mixture‑of‑Experts.

MiniMax-M1 je odprtega utežja, velikih razsežnosti hibridni model za razmišljanje z mehanizmom pozornosti. Poganja ga hibridna arhitektura Mešanica strokovnjakov (Mixture-of-Experts, MoE) v kombinaciji z mehanizmom lightning attention, kar omogoča učinkovito skaliranje izračunov med testiranjem. Model naravno podpira dolžino konteksta do 1 milijon žetonov in je izurjen z obsežnim okrepitvenim učenjem (reinforcement learning, RL) na raznolikih problemih. Presega druge močne odprte modele pri zahtevnih nalogah iz programske inženirstva, uporabe orodij in nalogah z dolgim kontekstom. Poskusi na standardnih benchmarkih kažejo, da MiniMax‑M1 premaga druge modele pri nalogah v tej kategoriji, kot so matematika, programiranje, inženiring programske opreme, agentska uporaba orodij in razumevanje dolgih kontekstov. Model je še posebej primeren za zahtevne naloge, ki zahtevajo obdelavo dolgih vhodnih podatkov in obsežno razmišljanje. MiniMax-M1 služi kot močan temelj za agente jezikovnih modelov naslednje generacije, ki razmišljajo in se spopadajo z izzivi v resničnem svetu. Primerjava zmogljivosti na benchmarku vodilnih komercialnih in odprto-težkih modelov po različnih kategorijah nalog poudarja zmogljivost modela. Tehnično poročilo ponuja več informacij o arhitekturi modela, protokolu treniranja in rezultatih evalvacije.
Razdelitev kriterijev
- Hibridna arhitektura Mixture‑of‑Experts (MoE)
- Mehanizem Lightning attention
- Okvir za skaliranje s krepitvenim učenjem (RL)
- Dolžina konteksta 1 milijon žetonov
- Učinkovito skaliranje izračunov med testiranjem

ScreenAgent
Odprtokodna VLM agent za upravljanje računalniškega GUI-ja prek planiranja in izvajanja miške ter tipkovnice.

ScreenAgent je odprtokodni vizualni jezikovni model (VLM) agent, zasnovan za nadzor računalniških GUI preko miške in tipkovnice. Omogoča interakcijo z dejanskimi računalniškimi zasloni z opazovanjem posnetkov zaslona in izvajanjem dejanj. Projekt vključuje proces načrtovanja – izvajanja – refleksije, ki vodi agenta pri zaključevanju večkoraknih opravil. Bil je ustvarjen z namenom reševanja izziva učenja agentov, kako uporabljati računalnike, kar zahteva sposobnosti, kot so načrtovanje nalog, razumevanje slik in vizualno pozicioniranje. Podatkovni set ScreenAgent, ki zajema različne vsakodnevne računalniške naloge, je bil ročno označen, da podpre učenje agenta. Projekt se sestavlja iz klijenta za nadzor namizja, podatkovnega seta, delavcev modela za inferenco in izobraževalne kode. Podpira osnovne operacije miške in tipkovnice ter ga je mogoče uporabiti na različnih namiznih operacijskih sistemih in aplikacijah. Pristop ScreenAgent je univerzalni in ne temelji na specifičnih API-jih, kar ga naredi vsestranski.
Razdelitev kriterijev
- Izvedba operacij miške in tipkovnice
- Proces načrtovanja‑izvajanja‑refleksije za zaključek nalog
- Podpora za različne namizne operacijske sisteme in aplikacije
- Ročna anotacija podatkovnega seta ScreenAgent za raznoliko pokritost nalog
- VLM agent za interakcijo z GUI-jem

BabyBeeAGI
Napredna različica BabyAGI z izboljšanim upravljanjem nalog in funkcionalnostjo.

BabyAGI je eksperimentalni okvir za gradnjo samozgradnih avtonomnih agentov. Ustvarjen je kot evolucija izvirnega BabyAGI iz marca 2023, ki je uvedel načrtovanje nalog za avtonomne agente. Okvir je zasnovan okoli novega funkcijskega okvirja imenovanega "functionz", ki shranjuje, upravlja in izvaja funkcije iz baze podatkov. Ponuja grafično strukturo za sledenje uvozu, odvisnim funkcijam in skrivnostim za avtentikacijo, skupaj z samodejnim nalaganjem in celovito beleženje. Okvir vključuje tudi nadzorno ploščo za upravljanje funkcij, izvajanje posodobitev in ogled zapisov. Namenjen je enostavnosti in spodbuja razprave med razvijalci, ni namenjen produkcijski rabi. Osnovna ideja je graditi najpreprostejšo stvar, ki se lahko sama gradi, kar ga naredi zanimiv pristop za razvoj avtonomnih agentov.
Razdelitev kriterijev
- Registracija funkcij in upravljanje metapodatkov
- Sledenje odvisnostim in ključne odvisnosti
- Samodejno nalaganje in beleženje
- Nadzorna plošča za upravljanje funkcij in ogled zapisnika

MCP‑Use
Odprtokodna platforma, ki povezuje LLM-je z MCP strežniki in ustvarja prilagojene AI agente s dostopom do orodij.

mcp-use je odprtokodna platforma, ki olajša povezovanje velikih jezikovnih modelov (LLM) s MCP strežniki ter omogoča razvoj prilagojenih AI agentov, ki lahko komunicirajo s temi LLM-ji. Platforma zagotavlja celovit MCP okvir (mcp-use SDK) za gradnjo ChatGPT aplikacij, Claude konektorjev in MCP strežnikov. Z mcp-use lahko razvijalci izkoristijo enotno kodo za razmestitev svojih aplikacij na različnih platformah, kjer uporabniki in agenti že delajo, vključno s ChatGPT, Claude in Gemini. Platforma ponuja vrsto orodij in funkcij, kot so možnost ustvarjanja MCP aplikacij z enim ukazom, samodejna namestitev v Manufact Cloud ter vgrajena analitika in opazljivost. Razvijalci lahko uporabljajo mcp-use SDK za izdelavo in uvajanje strežnikov MCP ter aplikacij, ne da bi potrebovali dodatna orodja. Platforma prav tako nudi Visual Inspector in Sandbox testne zmogljivosti, ki razvijalcem omogočajo testiranje njihovih aplikacij brez potrebe po živem LLM. mcp-use si prizadeva poenostaviti razvoj in uvajanje aplikacij, ki temeljijo na MCP, zaradi česar je privlačna možnost za razvijalce, ki želijo ustvarjati in uvajati prilagojene AI agente ter aplikacije.
Razdelitev kriterijev
- Upravljanje MCP strežnikov
- Povezava in integracija LLM-jev
- Razvoj prilagojenih AI agentov
- Avtomatizirano uvajanje in razširljivost
- Vizualni inšpektor in testiranje v peskovniku
- Vgrajena analitika in opazljivost

Rasa
Odprtokoden okvir za gradnjo produkcijskega nivoja klepetalnih in glasovnih pomočnikov.

Rasa je platforma za pogovorno umetno inteligenco, ki razvijalcem omogoča ustvarjanje kontekstualnih klepetalnih in glasovnih asistentov s popolnim nadzorom nad podatki, modeli in uvajanjem. Njeno odprto izvorno jedro upravlja razumevanje naravnega jezika in upravljanje dialogov, medtem ko Rasa Pro dodaja funkcije za podjetja, kot so analitika, varnostni nadzor in razširljiva infrastruktura. Rasa Studio nudi low-code vmesnik, ki omogoča oblikovalcem in ekipam za konverzacije sodelovanje pri trening podatkih, tokih in testiranju brez pisanja kode. Skupaj orodja podpirajo hibridne ekipe, ki zagotavljajo asistente prek kanalov za sporočanje, IVR sistemov in prilagojenih aplikacij. Pogosto ga uporabljajo podjetja v bančništvu, telekomunikacijah, zdravstvu in vladnih organih, kjer je zahtevana namestitev na lastni infrastrukturi, skladnost in prilagajanje.
Razdelitev kriterijev
- Motor razumevanja naravnega jezika
- Upravljanje pogovora z lastnimi dejanji
- Nizkokodni vmesnik Rasa Studio
- Integracije z zvokom in večkanalnimi komunikacijami
- Analitika pogovorov in orodja za testiranje
- Vsebinska varnost in nadzor izpeljave za podjetja









