Bătălie trecută · 2025-01-11 UTC
AI Agent Development Frameworks Confruntare — 11 ianuarie 2025
Din categoria AI Agent Development Frameworks. 38 puncte plasate pe 10 luptători. Mastra a luat coroana.
Clasament final
Lotul
Luptătorii
Profilurile fiecărui instrument care a concurat în această bătălie, clasate după scorul lor final.

Mastra
Framework open-source TypeScript pentru construirea de agenți AI, fluxuri de lucru, RAG, memorie și MCP, cu studio cloud opțional și observabilitate.

Mastra este un framework open-source TypeScript pentru construirea de aplicatii și agenti puternite prin AI. Acesta oferă un set de instrumente pentru dezvoltatori pentru a trece de la idee la implementare, inclusiv agenți, fluxuri de lucru, memorie, spații lucrătoare și observabilitate. Mastra integrează cu diferite framework-uri frontend și backend și poate fi implementat ca un server independent. Acesta permite dezvoltatorilor să construiască o varietate de capacități, cum ar fi agenți de automatizare interne, agenți cu fața către clienți, și multe altele. Mastra include caracteristici ca observabilitate integrată, verificări repeatabile și fluxuri de date încărcabile și cacheabile. Se dorește să suporte începuturile de creștere rapidă și marile organizații globale. Arhitectura Mastra se bazează pe agenți, care pot fi definiti cu instrucțiuni, modele, instrumente și comportament al rulării. Agenții pot interacționa cu utilizatori, completează sarcini și transfere către fluxuri de produs. Framework-ul conține, de asemenea, un sistem de evenimente integrate pentru evenimente, precum și un sistem pentru publicarea și abonarea la evenimente cu Redis Streams și Google Cloud Pub/Sub. Mastra dispune de un ecosistem bogat de resurse, inclusiv cărți, bloguri și ghiduri. Are o comunitate largă de utilizatori și este larg adoptată în diverse industrii.
Diviziunea criteriilor
- Agenți
- Fluxuri de lucru
- Memorie
- Spații de lucru
- Observabilitate
- Sistem de evenimente încorporat

AI Legion
O platformă open-source pentru crearea de agenți AI autonomi care colaborează pentru a îndeplini sarcini.

AI Legion este o platformă open-source pentru crearea de agenți AI autonomi care se cooperează pentru a îndeplini sarcini. Folosește modele de limba mare, cum ar fi GPT-3.5-turbo și GPT-4, pentru a permite agenților să lucreze împreună și să atingă obiective complexe. Platforma oferă un cadru pentru configura și managementul acestor agenți, inclusiv fișiere de configurare, API-uri și fluxuri de lucru. AI Legion este proiectată pentru a fi extensibilă și personalizabilă, permiteând utilizatorilor să creeze și să integreze propriile modele, acțiuni și caracteristici. Platforma este potrivită pentru o gamă largă de utilizări, inclusiv cercetare, dezvoltare și implementare a sistemelor AI autonome. Construirea unui mediu AI Legion implică instalarea dependențelor necesare, inclusiv Node.js și cheile API OpenAI. Agentii pot fi apoi pornite și interacționate prin consolă. Platforma include, de asemenea, funcționalități pentru gestionarea stării agentului, inclusiv posibilitatea ștergerea jurnalului de evenimente și pornirea din nou a agenților cu configurații personalizate. AI Legion este o soluție puternică pentru construirea și desfășurarea de sisteme inteligente de inteligență artificială autonome și natura sa deschisă a face posibilă accesul la un spectru larg de utilizatori. În același timp, necesită o cantitate considerabilă de cunoștințe tehnice și efort de configurare pentru a fi instalat și utilizat eficient. Un beneficiu cheie al AI Legion îl reprezintă capacitatea de a-i permite agenților să învețe și să se adapteze pe măsură ce timp trece, folosind o combinație de tehnici de învățare automată și grafice de cunoștințe. Acest lucru permite agenților să îmbunătățească performanțele și capacitatea lor de a lua decizii în timp ce interacționează cu mediul. Cu toate acestea, AI Legion prezintă, de asemenea, mai multe provocări și limite, inclusiv nevoia unui efort extins de configurare și gestionare, riscul de erori ale agenților și bucle infinite, și potențialul unor numere mari de token și costuri de utilizare a API-ului. De asemenea, utilizarea modelelor de limbă mari poate ridica îndoieli în legătură cu bias-ul și precizia. În ceea ce privește caracteristicile specifice, AI Legion include sprijin pentru căutarea pe web, motoare de căutare personalizate și API, precum și posibilitatea de a gestiona starea agentului și de a relansa agenții cu configurații personalizate. Platforma este, de asemenea, extrem de extensibilă, permițând utilizatorilor să creeze și să integreze propriile lor modele, acțiuni și caracteristici. Unele dintre utilizările potențiale ale AI Legion sunt cercetarea și dezvoltarea de sisteme de inteligență artificială autonome, implementarea proceselor și fluxurilor de lucru în puterea inteligenței artificiale, și crearea de instrumente și aplicații personalizate cu inteligență artificială. În ansamblu, AI Legion este o platformă puternică și extensivă pentru crearea și implementarea de sisteme de inteligență artificială autonome, dar îi cere un efort de configurare și cunoștințe tehnice semnificative pentru a fi utilizată eficient.
Diviziunea criteriilor
- Căutare web
- Motoare de căutare personalizate
- API-uri și webhook-uri pentru integrare
- Gestionarea stării agenților
- Crearea de modele și acțiuni personalizate
- Capabilități de grafuri de cunoștințe și machine learning

AutoML-Agent
Cadru open-source cu multiple agenţi LLM care automatizează fluxurile complete de învățare automată.

AutoML-Agent este un cadru open-source care utilizează agenţi mari de limbaj coordonaţi pentru a gestiona întregul ciclu de viață al învățării automate. În loc să se bazeze pe un singur model sau script, delegă sarcini precum înţelegerea datelor, preprocesarea, selecţia modelului, antrenarea și evaluarea către agenţi specializaţi care colaborează pentru un scop comun. Cadrul este destinat cercetătorilor și dezvoltatorilor care doresc să automatizeze experimentarea fără a scrie cod extensiv pentru pipeline-uri. Prin descrierea unui set de date și a obiectivului în limbaj natural, utilizatorii pot permite agenţilor să propună, să construiască și să itereze soluţii candidate, prezentând rezultatele și raţionamentul pe parcurs. Fiind open source, AutoML-Agent poate fi extins cu agenţi, instrumente sau backend-uri de modele personalizate, fiind util atât ca sistem practic de AutoML, cât şi ca bancă de testare pentru fluxuri de lucru multi-agent.
Diviziunea criteriilor
- Orchestrare LLM cu multiple agenţi
- Preprocesare automată a datelor și gestionarea caracteristicilor
- Selecție de model și căutare a hiperparametrilor
- Generare de pipeline-uri pentru antrenare și evaluare
- Specificarea sarcinilor în limbaj natural
- Arhitectură extensibilă pentru agenţi personalizaţi

Cerebrum: AIOS SDK
Un SDK pentru dezvoltarea și implementarea agenților AI bazați pe LLM în cadrul AIOS.

Cerebrum este un SDK pentru dezvoltarea și implementarea agenților AI bazați pe LLM în cadrul AIOS (Sistemul de operare pentru agenți AI). AIOS abordează provocări precum programarea, comutarea contextului, gestionarea memoriei și gestionarea instrumentelor pentru agenții bazați pe LLM. SDK-ul Cerebrum permite dezvoltatorilor să creeze și să ruleze aplicații de agenți prin interacțiunea cu nucleul AIOS. Suportă atât interfața Web, cât și interfața Terminal. SDK-ul include funcții pentru listarea LLM-urilor, agenților și instrumentelor disponibile, precum și descărcarea, încărcarea și rularea agenților și instrumentelor. Cerebrum este conceput pentru utilizatorii de agenți și dezvoltatori, permițându-le să creeze și să implementeze aplicații de agenți AI.
Diviziunea criteriilor
- Dezvoltarea și implementarea agenților
- Gestionarea agenților AI bazați pe LLM
- Suport pentru interfața Web și interfața Terminal
- Gestionarea agenților și instrumentelor
- Listarea LLM-urilor, agenților și instrumentelor disponibile
- Descărcarea și încărcarea agenților și instrumentelor

Gemma 3
Un model AI open-source optimizat pentru performanța unui singur GPU, care suportă intrări multimodale și peste 140 de limbi.

Gemma 3 este o colecție de modele deschise, lighțiști și în starea de ultimă oră, proiectate să ruleze pe dispozitive, în special optimizate pentru performanță pe o singură unitate GPU. Suportă intrări multimodale și mai mult de 140 de limbi. Modelul vine în dimensiuni diverse (1B, 4B, 12B și 27B), permitând dezvoltatorilor a alege cel mai bun model în funcție de hardware și de nevoile de performanță ale lor. Gemma 3 oferă capacități de razonare avansate texte și vizuale, o fereastră de context de 128.000 de token-uri și apeluri de funcții pentru sarcini complexe. Mai mult, include versiuni cuantizate pentru o performanță și costuri computationale mai reduse. Modelul este parte a angajamentului lui Google de a face tehnologia AI utilă disponibilă și construiește pe aceeași cercetare și tehnologie care motivează modelele Gemini 2.0. Gemma 3 este proiectat pentru a permite dezvoltatorilor să creeze aplicații AI care pot Rulează direct pe dispozitive astfel de telefoane, laptop-uri și stații de lucru. Gemma 3 livrează performanțe de top pentru mărimea sa, depășind alte modeluri precum Llama3-405B, DeepSeek-V3 și o3-mini în evaluările preliminare ale preferinței umane. Oferește aplicații globale cu o sprijină automată în box pentru peste 35 de limbi și o sprijinire pre-calibrată pentru peste 140 de limbi. Modelul permite crearea fluxurilor de lucru înființate de AI prin apeluri de funcții și rezultate structurate. Deschiderea dezvoltării lui Gemma 3 a inclus proceduri de siguranță stricte, cum ar fi guvernarea datei extinse, alinierea politicilor de siguranță prin fine-tunare și evaluări de referință robuste. Familia de modele Gemma deschise și-au primit un adopție semnificativă, cu peste 100 de milioane de descărcări și o comunitate dinamică care și-a creat peste 60.000 de variante Gemma. Capacitățile GEMMA 3 îl fac potrivit pentru dezvoltatori care își doresc să creeze experiențe utile utilizatorilor, apte să funcționeze pe un anumit host GPU sau TPU.
Diviziunea criteriilor
- suport AI multimodal
- dezvoltare axată pe responsabilitate
- reglare fină extinsă
- suport pentru 140 de limbi
- performanță îmbunătățită

MiniMax‑M1
Model de raționare la scară largă, open-source, cu context de 1 milion de tokeni și arhitectură hibridă Mixture-of-Experts.

MiniMax-M1 este o modelă de raționament la scară largă, cu atenție hibridă, a cărui greutate este deschisă. Este alimentată de o arhitectură a experților de amestecătură (Mixture-of-Experts, MoE) hibridă, combnată cu un mecanism de atenție fulgerător, care îi permite escaladarea eficientă a calculatorului de timp de test. Modelul suportă în mod nativ o lungime de context de 1 milion de tokeni și este antrenat cu învățământul la scară largă prin învățare în modul de recompensă (RL) pe probleme diverse. A întrunit rezultate mai bune decât alți forți modeli deschiși de greutate la sarcini de inginerie software complexă, utilizarea instrumentelor și sarcini cu conștient de lungă durată. Experimentele desfășurate pe buncăderne standard arată că MiniMax-M1 depășește alte modele în domenii precum matematică, programe de calculator, inginerie software, utilizarea unor instrumente de automatizare și înțelegerea de context lung. Modelul este în special potrivit pentru sarcinile complexe care necesită prelucrarea de inputs lungi și gândire pe scară largă. MiniMax-M1 constituie o bază puternică pentru agenți de modele de limbă de a doua generație să înțeleagă și să se confrunte cu provocările din lumea reală. Comparaţia pe baza benchmark-ului a performanţelor modelelor comerciale şi a celor din domeniul liber, într-un spectru larg de sarcini de categoria diferită, evidenţiază performanţa modelului. Raportul tehnic oferă informații suplimentare despre arhitectura modelului, protocolul de antrenare și rezultatele evaluării.
Diviziunea criteriilor
- Arhitectură hibridă Mixture-of-Experts (MoE)
- Mecanism de atenție fulger
- Cadrul de scalare a învățării prin consolidare (RL)
- Lungime de context de 1 milion de tokeni
- Scalarea eficientă a calculelor la momentul testării

ScreenAgent
Agent VLM open-source pentru controlul interfețelor grafice de utilizator ale computerului prin planificarea și execuția operațiunilor cu mouse și tastatură.

ScreenAgent este un agent VLM (Visual Language Model) open-source conceput pentru a controla interfețele grafice de utilizator ale computerului prin operațiuni cu mouse și tastatură. Acesta permite interacțiunea cu ecranele reale ale computerului prin observarea capturilor de ecran și executarea acțiunilor. Proiectul include un proces de planificare-execuție-reflecție care ghidează agentul pentru a finaliza sarcini complexe. A fost creat pentru a aborda provocarea de a instrui agenții să utilizeze computerele, necesitând capacități precum planificarea sarcinilor, înțelegerea imaginii și poziționarea vizuală. Setul de date ScreenAgent, care acoperă diverse sarcini zilnice ale computerului, a fost annotat manual pentru a sprijini învățarea agentului. Proiectul este alcătuit dintr-un client pentru controlul desktopului, un set de date, muncitori de model pentru inferență și cod de instruire. Suportă operațiuni de bază cu mouse și tastatură și poate fi aplicat diferitelor sisteme de operare și aplicații desktop. Abordarea ScreenAgent este universală și nu se bazează pe API-uri specifice, făcându-l versatil.
Diviziunea criteriilor
- Execuția operațiunilor cu mouse și tastatură
- Proces de planificare-execuție-reflecție pentru finalizarea sarcinilor
- Suport pentru diverse sisteme de operare și aplicații desktop
- Annotarea manuală a setului de date ScreenAgent pentru acoperire diversă a sarcinilor
- Agent VLM pentru interacțiunea cu GUI

BabyBeeAGI
O versiune avansată a BabyAGI cu gestionare îmbunătățită a sarcinilor și funcționalități.

BabyAGI este un cadru experimental pentru construirea de agenți autonomi care se autoproduc. A fost creat ca o evoluție a BabyAGI original din martie 2023, care a introdus planificarea sarcinilor pentru agenții autonomi. Cadrul este construit în jurul unui nou cadru de funcții numit 'functionz' care stochează, gestionează și execută funcții dintr-o bază de date. Dispune de o structură bazată pe grafuri pentru urmărirea importurilor, funcțiilor dependente și a secretelor de autentificare, împreună cu capacități de încărcare automată și de jurnalizare completă. Cadrul include și un tablou de bord pentru gestionarea funcțiilor, rularea actualizărilor și vizualizarea jurnalelor. Este conceput pentru a fi simplu și pentru a stimula discuția în rândul dezvoltatorilor, nu pentru utilizarea în producție. Ideea de bază este de a construi cel mai simplu lucru care se poate autoproduce, făcându-l o abordare interesantă pentru dezvoltarea de agenți autonomi.
Diviziunea criteriilor
- Înregistrarea funcțiilor și gestionarea metadatelor
- Urmărirea dependențelor și a dependențelor cheie
- Încărcare automată și jurnalizare
- Tablou de bord pentru gestionarea funcțiilor și vizualizarea jurnalelor

MCP‑Use
Platforma deschisă pentru a conecta LLM-uri cu serviciile MCP și construi agenti AI personalizați având acces la instrumentele necesare.

mcp-use este o platformă open-source care facilitează conexiunea Modelurilor de Limbaj Mari (LLMs) cu serverele MCP și permite dezvoltarea de agenți AI personalizabili care pot interacționa cu aceste LLM-uri. Platforma oferă un cadru de dezvoltare full-stack MCP (mcp-use SDK) pentru a construi Aplicații pentru ChatGPT, Conectori Claude și Servere MCP. Cu mcp-use, dezvoltatorii pot exploata o bază de cod unică pentru a deploia aplicațiile lor pe mai multe suprafețe unde utilizatorii și agenții au deja locul lor de muncă, inclusiv ChatGPT, Claude și Gemini. Platforma oferă o gamă de instrumente și funcționalități, cum ar fi posibilitatea de a structura aplicațiile MCP într-o comandă, depunerea automată pe Manufact Cloud și analiza și observabilitate integrată. Desinzatorii pot folosi SDK-ul mcp-use pentru a construi și a instala serverele și aplicațiile MCP, fără să necesite alte utilități suplimentare. Platforma oferă, de asemenea, o Visual Inspector și capacități de testare în sandbox, ceea ce le permite dezvoltatorilor să testeze aplicațiile fără necesitatea unui LLM live. mcp-use se încearcă a simplifica dezvoltarea și implementarea aplicațiilor bazate pe MCP, făcându-l o opțiune atractivă pentru dezvoltatori care caută să construiască și să implementeze agenți și aplicații de AI customizate.
Diviziunea criteriilor
- Gestionare de servicii MCP
- Conexiune și integrare LLM-urilor
- Dezvoltare de agenți AI personalizați
- Implementare automată și scalabilitate
- Inspector vizual și testare în sandbox
- Analitici și observabilitate integrate

Rasa
Framework open-source pentru construirea de asistenți chat și voce de calitate pentru producție

Platforma de inteligență artificială conversațională Rasa ajută dezvoltorii să construiască asistenți de conversație și voce contextuală cu control complet asupra datelor, modelelor și implementării. Nucleul său open-source gestionează înțelegerea limbajului natural și managementul dialogului, în timp ce Rasa Pro adaugă funcții de enterprise, cum ar fi analiza datelor, controlul securității și infrastructura scalabilă. Rasa Studio oferă o interfață cu cod minim pentru designeri și echipaje de conversație să colaboreze la datele de îmbunătățire, fluxurile și testele fără cod de scriere. Împreună, instrumentele sprijină echipele hibride care livră asistenți pe canalele de mesagerie, sistemele IVR și aplicațiile personalizate. Este adesea folosită de companii din domeniul bancar, telecomunicații, sănătate și din administrația publică, unde se cer implementări on-premise, conformitate și personalizare.
Diviziunea criteriilor
- Motor de înțelegere a limbajului natural
- Gestionarea dialogului cu acțiuni personalizate
- Interfață low-code Rasa Studio
- Integrații voce și multi-canal
- Instrumente de analiză și testare a conversației
- Controale de securitate și implementare pentru întreprindere









