Tidligere kamp · 2025-01-11 UTC
AI Agent Development Frameworks Oppgjør — 11. januar 2025
Fra kategorien AI Agent Development Frameworks. 38 merker plassert på tvers av 10 kjempere. Mastra tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

Mastra
Open-source TypeScript-rammeverk for å bygge AI-agenter, arbeidsflyter, RAG, minne og MCP, med valgfritt skystudio og observabilitet.

Mastra er et open-source TypeScript‑rammeverk for å bygge AI‑drevne applikasjoner og agenter. Det tilbyr et sett med verktøy for utviklere, slik at de kan gå fra idé til implementering – inkludert agenter, arbeidsflyter, minne, arbeidsområder og observabilitet. Mastra integreres med ulike frontend- og backend‑rammeverk, og kan distribueres som en selvstendig server. Det muliggjør utvikling av en rekke funksjoner, som interne automatiseringsagenter, kundesentriske agenter og lignende. Mastra inneholder funksjoner som innebygd observabilitet, gjentagbare sjekker og cachebare, resumebare strømmer. Rammeverket er designet for å støtte hurtigskalerende oppstartsbedrifter og store globale organisasjoner. Mastras arkitektur er sentrert rundt agenter, som kan defineres med instruksjoner, modeller, verktøy og kjøretidsatferd. Agentene kan samhandle med brukere, fullføre oppgaver og overlevere til produktflyt. Rammen inkluderer også et innebygd hendelsessystem for hendelser, samt et system for publisering og abonnering på hendelser med Redis Streams og Google Cloud Pub/Sub. Mastra har et rikt økosystem av ressurser, inkludert bøker, blogger og guider. Den har et stort fellesskap av brukere og er bredt adoptert i ulike bransjer.
Kriteriumfordeling
- Agenter
- Arbeidsflyter
- Minne
- Arbeidsområder
- Observabilitet
- Innebygd hendelsessystem

AI Legion
En åpen kildekode-plattform for å lage autonome AI-agenter som samarbeider for å utføre oppgaver.

AI Legion er en åpen kildekode‑plattform for å lage autonome AI‑agenter som samarbeider for å utføre oppgaver. Den bruker store språkmodeller, som GPT‑3.5‑turbo og GPT‑4, for å gjøre det mulig for agenter å jobbe sammen og oppnå komplekse mål. Plattformen gir et rammeverk for oppsett og administrasjon av disse agentene, inkludert konfigurasjonsfiler, API‑er og arbeidsflyter. AI Legion er designet for å være utvidbar og tilpassbar, slik at brukere kan lage og integrere sine egne modeller, handlinger og funksjoner. Plattformen passer til en rekke bruksområder, blant annet forskning, utvikling og distribusjon av autonome AI‑systemer. Å sette opp et AI Legion‑miljø innebærer installering av nødvendige avhengigheter, inkludert Node.js og OpenAI API‑nøkler. Agentene kan deretter startes og samhandle med via konsollen. Plattformen inkluderer også funksjoner for å administrere agentens tilstand, inkludert muligheten til å slette hendelseslogger og starte agentene på nytt med tilpassede konfigurasjoner. AI Legion er et kraftig verktøy for å bygge og distribuere autonome AI-systemer, og dens åpenkilde‑natur gjør det tilgjengelig for en bred brukergruppe. Imidlertid krever det også betydelig teknisk kompetanse og konfigurasjonsarbeid for å sette opp og bruke det effektivt. En nøkkelfordel med AI Legion er dens evne til å gjøre det mulig for agenter å lære og tilpasse seg over tid, ved å bruke en kombinasjon av maskinlæring og kunnskapsgrafteknikker. Dette gjør at agentene kan forbedre sin ytelse og beslutningskapasitet når de samhandler med miljøet. Imidlertid presenterer AI Legion også flere utfordringer og begrensninger, inkludert behovet for omfattende konfigurasjon og styringsarbeid, risikoen for agentfeil og uendelige løkker, samt potensialet for høye token‑antall og API‑bruksavgifter. I tillegg kan bruken av store språkmodeller reise bekymringer rundt skjevhet og nøyaktighet. Når det gjelder spesifikke funksjoner, inkluderer AI Legion støtte for websøk, tilpassede søkemotorer og API‑er, samt muligheten til å administrere agentens tilstand og starte agentene på nytt med tilpassede konfigurasjoner. Plattformen er også svært utvidbar, og gir brukere mulighet til å lage og integrere sine egne modeller, handlinger og funksjoner. Noen potensielle bruksområder for AI Legion inkluderer forskning og utvikling av autonome AI‑systemer, utrulling av AI‑drevne arbeidsflyter og prosesser, samt opprettelse av skreddersydde AI‑drevne verktøy og applikasjoner. Alt i alt er AI Legion en kraftig og utvidbar plattform for å bygge og distribuere autonome AI-systemer, men det krever betydelig teknisk ekspertise og konfigurasjonsinnsats for å bruke effektivt.
Kriteriumfordeling
- Websøk
- Egendefinerte søkemotorer
- APIs og webhooks for integrasjon
- Agenttilstandsadministrasjon
- Oppretting av egendefinerte modeller og handlinger
- Kunnskapsgraf og maskinlæringsfunksjoner

AutoML-Agent
Åpen kildekode multi-agent LLM-rammeverk som automatiserer hele maskinlæringspipelinjen fra start til slutt.

AutoML-Agent er et åpenkilde‑rammeverk som bruker koordinerte store språkmodell‑agenter til å håndtere hele maskinlæringslivssyklusen. I stedet for å stole på en enkelt modell eller skript, delegerer den oppgaver som dataforståelse, forbehandling, modellvalg, trening og evaluering på tvers av spesialiserte agenter som samarbeider mot et felles mål. Rammeverket er rettet mot forskere og utviklere som ønsker å automatisere eksperimentering uten å skrive omfattende pipeline‑kode. Ved å beskrive et datasett og et mål i naturlig språk, kan brukerne få agenter til å foreslå, bygge og iterere over kandidatløsninger, og fremføre resultater og begrunnelser underveis. Siden det er open source, kan AutoML-Agent utvides med tilpassede agenter, verktøy eller modellbackends, noe som gjør det nyttig både som et praktisk AutoML-system og som en forskningstestbænk for multi-agent workflows.
Kriteriumfordeling
- Multi-agent LLM-orkestrering
- Automatisert dataforbehandling og funksjonshåndtering
- Modellvalg og hyperparameter-søk
- Generering av trenings- og evalueringspipeline
- Spesifikasjon av oppgaver i naturlig språk
- Utvidbar arkitektur for egendefinerte agenter

Cerebrum: AIOS SDK
Et SDK for utvikling og distribusjon av LLM-baserte AI‑agenter innenfor AIOS‑rammeverket.

Cerebrum er et SDK for utvikling og distribusjon av LLM-baserte AI-agenter innenfor AIOS (AI Agent Operating System)-rammeverket. AIOS adresserer utfordringer som tidsplanlegging, kontekstbytting, minnehåndtering og verktøymanagement for LLM-baserte agenter. Cerebrum SDK gjør det mulig for utviklere å bygge og kjøre agentapplikasjoner ved å interagere med AIOS-kjernen. Det støtter både Web UI og Terminal UI. SDK-en inkluderer funksjoner for å liste tilgjengelige LLM-er, agenter og verktøy, samt for å laste ned, laste opp og kjøre agenter og verktøy. Cerebrum er designet for agentbrukere og utviklere, og gjør det mulig for dem å lage og distribuere AI-agentapplikasjoner.
Kriteriumfordeling
- Agentutvikling og distribusjon
- LLM-basert AI-agenthåndtering
- Støtte for Web UI og Terminal UI
- Agent‑ og verktøgehåndtering
- Liste over tilgjengelige LLM‑er, agenter og verktøy
- Nedlasting og opplasting av agenter og verktøy

Gemma 3
En åpen kildekode AI-modell optimalisert for enkelt-GPU-ytelse, som støtter multimodale innganger og over 140 språk.

Gemma 3 er en samling av lette, toppmoderne åpne modeller designet for å kjøre på enheter, spesielt optimalisert for enkel‑GPU‑ytelse. Den støtter multimodale innspill og over 140 språk. Modellen finnes i flere størrelser (1B, 4B, 12B og 27B), slik at utviklere kan velge den som passer best til maskinvaren og ytelsesbehovene deres. Gemma 3 tilbyr avanserte tekst‑ og visuelle resonneringsevner, et 128 k‑token kontekstvindu, og function calling for komplekse oppgaver. Den inkluderer også kvantiserte versjoner for raskere ytelse og redusert beregningsbehov. Modellen er en del av Googles satsing på å gjøre nyttig AI‑teknologi tilgjengelig og bygger på den samme forskningen og teknologien som driver deres Gemini 2.0‑modeller. Gemma 3 er laget for å gjøre det mulig for utviklere å lage AI‑applikasjoner som kan kjøre direkte på enheter som telefoner, bærbare PC‑er og arbeidsstasjoner. Gemma 3 leverer state-of-the-art ytelse for sin størrelse, og overgår andre modeller som Llama3-405B, DeepSeek-V3 og o3-mini i foreløpige menneskelige preferansevurderinger. Den gjør globale applikasjoner mulige med umiddelbar støtte for over 35 språk og forhåndstrent støtte for over 140 språk. Modellen muliggjør opprettelse av AI-drevne arbeidsflyter ved bruk av function calling og structured output. Utviklingen av Gemma 3 inkluderte strenge sikkerhetsprotokoller, som omfattende data governance, justering i samsvar med sikkerhetspolicyer gjennom finjustering, og robuste benchmark-evalueringer. Gemma-familien av åpne modeller har fått betydelig adopsjon, med over 100 millioner nedlastinger og et livlig fellesskap som har laget mer enn 60 000 Gemma-varianter. Gemma 3s kapasiteter gjør den egnet for utviklere som ønsker å skape engasjerende brukeropplevelser som kan kjøre på en enkelt GPU- eller TPU-vert.
Kriteriumfordeling
- støtte for multimodal AI
- ansvarsorientert utvikling
- omfattende finjustering
- støtte for 140 språk
- forbedret ytelse

MiniMax‑M1
Open‑source stor skala resonansmodell med 1 million tokens kontekst og hybrid Mixture‑of‑Experts arkitektur.

MiniMax-M1 er en åpenvekt, stor skala hybrid‑opmerksomhetsresonnementmodell. Den drives av en hybrid Mixture-of-Experts (MoE)-arkitektur kombinert med en lynhastighets opmerksomhetmekanisme, som muliggjør effektiv skalering av beregning ved testtid. Modellen støtter naturlig en kontekstlengde på 1 million tokens og er trent med stor skala forsterkningslæring (RL) på ulike problemer. Den presterer bedre enn andre sterke åpenvekt-modeller på komplekse oppgaver innen programvareutvikling, verktøybruk og oppgaver med lang kontekst. Eksperimenter på standardbenchmarkene viser at MiniMax‑M1 overgår andre modeller i kategorier som matematikk, koding, programvareutvikling, agentisk verktøybruk og forståelse av lange kontekster. Modellen er særlig egnet for komplekse oppgaver som krever behandling av lange input og omfattende tenkning. MiniMax-M1 fungerer som et solidt grunnlag for neste generasjons språkmodellagenter til å resonnere og takle reelle utfordringer. Benchmark-sammenligningen av ytelse for ledende kommersielle og open-weight-modeller på tvers av ulike kategoritasker fremhever modellens ytelse. Den tekniske rapporten gir mer informasjon om modellens arkitektur, treningsprotokoll og evalueringsresultater.
Kriteriumfordeling
- Hybrid Mixture‑of‑Experts (MoE)-arkitektur
- Lightning oppmerksomhetsmekanisme
- Reinforcement learning (RL) skaleringsramme
- Kontekstlengde på 1 million tokens
- Effektiv skalerings av beregning under testing

ScreenAgent
Open‑source VLM-agent for å kontrollere datamaskinens GUI‑er via muse- og tastaturplanlegging og utførelse.

ScreenAgent er en open-source Visual Language Model (VLM) agent designet for å kontrollere datamaskinens GUI via mus‑ og tastaturoperasjoner. Den muliggjør interaksjon med ekte dataskjermer ved å observere skjermbilder og utføre handlinger. Prosjektet inkluderer en planleggings‑utførelse‑refleksjonsprosess som guider agenten til å fullføre flertrinnsoppgaver. Det ble utviklet for å løse utfordringen med å lære agenter å bruke datamaskiner, og krever evner som oppgaveplanlegging, bildeforståelse og visuell posisjonering. ScreenAgent‑datasetten, som dekker ulike daglige dataskjermoppgaver, ble manuelt merket for å støtte agentens læring. Prosjektet består av en klient for å kontrollere skrivebordet, et dataset, modellarbeidere for inferens og treningskode. Det støtter grunnleggende mus‑ og tastaturoperasjoner og kan brukes på ulike skrivebordssystemer og applikasjoner. ScreenAgent‑s tilnærming er universell og forutsetter ingen spesifikke API, noe som gjør den allsidig.
Kriteriumfordeling
- Utførelse av muse- og tastaturoperasjoner
- Planleggings‑utførelse‑refleksjonsprosessen for oppgavefullføring
- Støtte for ulike skrivebordssystemer og applikasjoner
- Manuell annotering av ScreenAgent‑datasettet for mangfoldig oppgaveomfang
- VLM-agent for GUI‑interaksjon

BabyBeeAGI
En avansert versjon av BabyAGI med forbedret oppgavehåndtering og funksjonalitet.

BabyAGI er en eksperimentell ramme for å bygge selvopprettende autonome agenter. Den ble skapt som en evolusjon av den originale BabyAGI fra mars 2023, som introduserte oppgaveplanlegging for autonome agenter. Rammeverket er bygget rundt en ny funksjonsramme kalt 'functionz' som lagrer, administrerer og kjører funksjoner fra en database. Det har en grafbasert struktur for å spore import, avhengige funksjoner og autentiseringshemmeligheter, i tillegg til automatisk lasting og omfattende loggmuligheter. Rammeverket inkluderer også et dashbord for å administrere funksjoner, kjøre oppdateringer og vise logger. Det er ment å være enkelt og vekke diskusjon blant utviklere, ikke for produksjonsbruk. Hovedideen er å bygge det enkleste som kan bygge seg selv, noe som gjør det til en interessant tilnærming for å utvikle autonome agenter.
Kriteriumfordeling
- Funksjonsregistrering og metadatahåndtering
- Avhengighetssporing og kritiske avhengigheter
- Automatisk lasting og logging
- Dashboard for funksjonsadministrasjon og loggvisning

MCP‑Use
Åpen kildekode‑plattform for å koble LLM-er med MCP‑servere og bygge tilpassede AI‑agenter med verktøytilgang.

mcp-use er en åpen kildekode plattform som muliggjør tilkobling av Large Language Models (LLMs) til MCP servers og muliggjør utvikling av tilpassede AI-agenter som kan interagere med disse LLM-ene. Plattformen tilbyr et full‑stack MCP‑framework (mcp-use SDK) for å bygge ChatGPT Apps, Claude Connectors og MCP Servers. Med mcp-use kan utviklere utnytte en enkelt kodebase for å distribuere applikasjonene sine på ulike plattformer der brukere og agenter allerede jobber, inkludert ChatGPT, Claude og Gemini. Plattformen tilbyr et bredt spekter av verktøy og funksjoner, blant annet muligheten til å scaffold MCP-applikasjoner med én kommando, automatisk distribusjon til Manufact Cloud, og innebygd analyse og observasjon. Utviklere kan bruke mcp-use SDK til å bygge og distribuere MCP-servere og applikasjoner uten å kreve ekstra verktøy. Plattformen tilbyr også en Visual Inspector og Sandbox‑testfunksjonalitet, slik at utviklere kan teste applikasjonene sine uten behov for en live LLM. MCP‑Use har som mål å forenkle utviklingen og distribusjonen av MCP‑baserte applikasjoner, noe som gjør det til et attraktivt alternativ for utviklere som ønsker å bygge og distribuere tilpassede AI‑agenter og applikasjoner.
Kriteriumfordeling
- MCP-serveradministrasjon
- LLM‑tilkobling og integrering
- Utvikling av tilpassede AI‑agenter
- Automatisk distribusjon og skalerbarhet
- Visuell inspiserings‑ og sandbox‑testing
- Innebygde analyser og observabilitet


Rasa er en konversasjons-AI-plattform som hjelper utviklere med å bygge kontekstuelle chat- og stemmeassistenter med full kontroll over data, modeller og distribusjon. Den åpne kjernen håndterer naturlig språkforståelse og dialoghåndtering, mens Rasa Pro legger til enterprise-funksjoner som analytics, sikkerhetskontroller og skalerbar infrastruktur. Rasa Studio tilbyr et lavkodegrensesnitt for designere og samtale‑team til å samarbeide om treningsdata, flyter og testing uten å skrive kode. Sammen støtter verktøyene hybride team som leverer assistenter over meldingskanaler, IVR‑systemer og tilpassede applikasjoner. Det brukes ofte av bedrifter i bank, telekommunikasjon, helsevesen og offentlig sektor der lokal installasjon, overholdelse og tilpasning er påkrevd.
Kriteriumfordeling
- Motor for naturlig språkforståelse
- Dialoghåndtering med tilpassede handlinger
- Rasa Studio low-code-grensesnitt
- Stemme- og flerkanalsintegrasjoner
- Analyse av samtaler og testverktøy
- Bedriftssikkerhet og distribusjonskontroller









