Tidligere kamp · 2026-01-03 UTC
AI Agent Development Frameworks Oppgjør — 3. januar 2026
Fra kategorien AI Agent Development Frameworks. 28 merker plassert på tvers av 10 kjempere. Cerebrum: AIOS SDK tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

Cerebrum: AIOS SDK
Et SDK for utvikling og distribusjon av LLM-baserte AI‑agenter innenfor AIOS‑rammeverket.

Cerebrum er et SDK for utvikling og distribusjon av LLM-baserte AI-agenter innenfor AIOS (AI Agent Operating System)-rammeverket. AIOS adresserer utfordringer som tidsplanlegging, kontekstbytting, minnehåndtering og verktøymanagement for LLM-baserte agenter. Cerebrum SDK gjør det mulig for utviklere å bygge og kjøre agentapplikasjoner ved å interagere med AIOS-kjernen. Det støtter både Web UI og Terminal UI. SDK-en inkluderer funksjoner for å liste tilgjengelige LLM-er, agenter og verktøy, samt for å laste ned, laste opp og kjøre agenter og verktøy. Cerebrum er designet for agentbrukere og utviklere, og gjør det mulig for dem å lage og distribuere AI-agentapplikasjoner.
Kriteriumfordeling
- Agentutvikling og distribusjon
- LLM-basert AI-agenthåndtering
- Støtte for Web UI og Terminal UI
- Agent‑ og verktøgehåndtering
- Liste over tilgjengelige LLM‑er, agenter og verktøy
- Nedlasting og opplasting av agenter og verktøy

Awesome MCP Servers
En kuratert katalog over Model Context Protocol‑servere for å utvide AI‑assistenter med verktøy og data.

Awesome MCP Servers er en community-maintained liste over Model Context Protocol (MCP)-servere som kobler AI-assistenter til eksterne systemer. Den katalogiserer implementeringer på tvers av kategorier som databaser, filsystemer, utviklerverktøy, produktivitetsapper og webtjenester, noe som gjør det enklere å oppdage integrasjoner som utvider hva modeller kan gjøre. Kilden er rettet mot utviklere og AI-byggere som ønsker å gi LLM-baserte agenter tilgang til virkelige data og handlinger uten å skrive hver connector fra bunnen av. Poster inneholder vanligvis lenker til source repositories, korte beskrivelser og tagger som hjelper brukere med å filtrere etter use case eller technology. Ettersom den følger det åpne kildekode‑formatet 'awesome list', kommer bidrag fra hele MCP‑økosystemet, og listen utvikler seg sammen med protokollen selv.
Kriteriumfordeling
- Kuratert liste over MCP-serverimplementeringer
- Kategorisert etter domene og bruksområde
- Lenker til kilde-repositorier og dokumentasjon
- Dekker offisielle og samfunnsbaserte servere
- Åpen for fellesskapsbidrag
- Referanse for utforskning av MCP‑økosystem

OpenAI Codex SDK
SDK for å integrere og kontrollere Codex‑agenter programmatisk via TypeScript, CLI eller GitHub Actions.

OpenAI Codex SDK er et utviklingssett for programvare som gir utviklere mulighet til å integrere og kontrollere Codex‑agenter programmatisk. Den støtter flere grensesnitt, inkludert TypeScript, CLI og GitHub Actions. SDK‑en er designet for å tilby en fleksibel måte å integrere Codex‑agenter i ulike applikasjoner og arbeidsflyter. Med OpenAI Codex SDK kan utviklere lage tilpassede agenter, definere agentadferd og administrere agentarbeidsflyter. SDK‑en tilbyr også verktøy for å evaluere og optimalisere agentytelsen. Den er ment for utviklere som ønsker å bygge applikasjoner som utnytter Codex‑agenter. SDK‑en gir et bredt spekter av funksjoner, inkludert støtte for flere modeller og leverandører, agent‑sandboxing og integrasjoner med ulike verktøy og tjenester.
Kriteriumfordeling
- Tekstgenerering
- Kodegenerering
- Bildegenerering
- Lyd- og talegenerering
- Strukturerte utdata
- Funksjonskall

BabyBeeAGI
En avansert versjon av BabyAGI med forbedret oppgavehåndtering og funksjonalitet.

BabyAGI er en eksperimentell ramme for å bygge selvopprettende autonome agenter. Den ble skapt som en evolusjon av den originale BabyAGI fra mars 2023, som introduserte oppgaveplanlegging for autonome agenter. Rammeverket er bygget rundt en ny funksjonsramme kalt 'functionz' som lagrer, administrerer og kjører funksjoner fra en database. Det har en grafbasert struktur for å spore import, avhengige funksjoner og autentiseringshemmeligheter, i tillegg til automatisk lasting og omfattende loggmuligheter. Rammeverket inkluderer også et dashbord for å administrere funksjoner, kjøre oppdateringer og vise logger. Det er ment å være enkelt og vekke diskusjon blant utviklere, ikke for produksjonsbruk. Hovedideen er å bygge det enkleste som kan bygge seg selv, noe som gjør det til en interessant tilnærming for å utvikle autonome agenter.
Kriteriumfordeling
- Funksjonsregistrering og metadatahåndtering
- Avhengighetssporing og kritiske avhengigheter
- Automatisk lasting og logging
- Dashboard for funksjonsadministrasjon og loggvisning

Gemma 3
En åpen kildekode AI-modell optimalisert for enkelt-GPU-ytelse, som støtter multimodale innganger og over 140 språk.

Gemma 3 er en samling av lette, toppmoderne åpne modeller designet for å kjøre på enheter, spesielt optimalisert for enkel‑GPU‑ytelse. Den støtter multimodale innspill og over 140 språk. Modellen finnes i flere størrelser (1B, 4B, 12B og 27B), slik at utviklere kan velge den som passer best til maskinvaren og ytelsesbehovene deres. Gemma 3 tilbyr avanserte tekst‑ og visuelle resonneringsevner, et 128 k‑token kontekstvindu, og function calling for komplekse oppgaver. Den inkluderer også kvantiserte versjoner for raskere ytelse og redusert beregningsbehov. Modellen er en del av Googles satsing på å gjøre nyttig AI‑teknologi tilgjengelig og bygger på den samme forskningen og teknologien som driver deres Gemini 2.0‑modeller. Gemma 3 er laget for å gjøre det mulig for utviklere å lage AI‑applikasjoner som kan kjøre direkte på enheter som telefoner, bærbare PC‑er og arbeidsstasjoner. Gemma 3 leverer state-of-the-art ytelse for sin størrelse, og overgår andre modeller som Llama3-405B, DeepSeek-V3 og o3-mini i foreløpige menneskelige preferansevurderinger. Den gjør globale applikasjoner mulige med umiddelbar støtte for over 35 språk og forhåndstrent støtte for over 140 språk. Modellen muliggjør opprettelse av AI-drevne arbeidsflyter ved bruk av function calling og structured output. Utviklingen av Gemma 3 inkluderte strenge sikkerhetsprotokoller, som omfattende data governance, justering i samsvar med sikkerhetspolicyer gjennom finjustering, og robuste benchmark-evalueringer. Gemma-familien av åpne modeller har fått betydelig adopsjon, med over 100 millioner nedlastinger og et livlig fellesskap som har laget mer enn 60 000 Gemma-varianter. Gemma 3s kapasiteter gjør den egnet for utviklere som ønsker å skape engasjerende brukeropplevelser som kan kjøre på en enkelt GPU- eller TPU-vert.
Kriteriumfordeling
- støtte for multimodal AI
- ansvarsorientert utvikling
- omfattende finjustering
- støtte for 140 språk
- forbedret ytelse

ScreenAgent
Open‑source VLM-agent for å kontrollere datamaskinens GUI‑er via muse- og tastaturplanlegging og utførelse.

ScreenAgent er en open-source Visual Language Model (VLM) agent designet for å kontrollere datamaskinens GUI via mus‑ og tastaturoperasjoner. Den muliggjør interaksjon med ekte dataskjermer ved å observere skjermbilder og utføre handlinger. Prosjektet inkluderer en planleggings‑utførelse‑refleksjonsprosess som guider agenten til å fullføre flertrinnsoppgaver. Det ble utviklet for å løse utfordringen med å lære agenter å bruke datamaskiner, og krever evner som oppgaveplanlegging, bildeforståelse og visuell posisjonering. ScreenAgent‑datasetten, som dekker ulike daglige dataskjermoppgaver, ble manuelt merket for å støtte agentens læring. Prosjektet består av en klient for å kontrollere skrivebordet, et dataset, modellarbeidere for inferens og treningskode. Det støtter grunnleggende mus‑ og tastaturoperasjoner og kan brukes på ulike skrivebordssystemer og applikasjoner. ScreenAgent‑s tilnærming er universell og forutsetter ingen spesifikke API, noe som gjør den allsidig.
Kriteriumfordeling
- Utførelse av muse- og tastaturoperasjoner
- Planleggings‑utførelse‑refleksjonsprosessen for oppgavefullføring
- Støtte for ulike skrivebordssystemer og applikasjoner
- Manuell annotering av ScreenAgent‑datasettet for mangfoldig oppgaveomfang
- VLM-agent for GUI‑interaksjon

AIWaves Agents
Åpen kildekode tilpasselig LLM-framework for å bygge, trene og deploy selvstederende språkagenter.

AIWaves Agents er et åpen kildekode adaptivt LLM (Large Language Model)-rammeverk for å bygge, trene og deployere selvstendige språkgjenger. Det ble oppdatert til Agents 2.0, som inkluderer støtte for agent læring og evaluering gjennom symbolisk læring, et systematisk ramme som er inspirert av Neural Network-utdanning. Dette rammeverket tillater for trening av språkgjenger ved å opprette en analogi mellom agent-pipeliner og Neural Network-datagrafer. Framveksten fungerer ved først å utføre en agent og å holde øye med dens spor, inkludert innputt, utputt, prompts og bruk av verktøy. Deretter vurderer den resultatet ved å bruke en språkbasert tap-funksjon, sende tapet tilbake til å beregne språkgradienter og oppdatere agentens symboliske komponenter i samsvar hermed. Dette prosessen tillater agenter å lære og tilpasse seg over tid. Agents 2.0 støtter også optimering av multi-agentsystemer ved å behandle noder som forskjellige agenter eller tilby å la flere agenter agere innenfor én nod. Frameworket er designet til å være fleksibelt og utvidbart, og støtter ulike applikasjoner og forskningstiltak. Prosjektet tilbyr en installationsveiledning, inkludert alternativer for å installere fra Git-repositoriet eller for lokal utvikling. Det inneholder også referanser til relasjonsforskningspapirer. Framsiden til dette systemet ligger i sin innovative tilnærming til agent-læring og sin potensiale for å fremme forskning innen selvstendige språkartferdigheter. Men dens kompleksitet og avhengighet av godt designede prompt-pipelines kan likevel være utfordringer for brukerne.
Kriteriumfordeling
- Selvstederende språkagenter støtte
- Språkagent trening
- Språkagent deployering
- Selv-evolverende agenter som muliggjør

Claude MCP Agents
AI-agenter bygget på Anthropic's MCP for sømløs verktøy- og dataintegrasjon.

Claude MCP Agents er AI-agenter som utnytter Anthropic’s Model Context Protocol (MCP) for å koble til et bredt spekter av eksterne datakilder, API-er og utviklerværktøy. Ved å standardisere hvordan kontekst flyter mellom Claude og eksterne systemer, kan disse agentene lese filer, hente data fra databaser, kalle tjenester og handle på sanntidsinformasjon uten tilpassede integrasjoner for hver kilde. Tilnærmingen er rettet mot utviklere og team som bygger automatisering, forskningsassistenter og arbeidsflyt‑agenter som trenger pålitelig tilgang til bedrifts- eller personlig data. MCPs åpne spesifikasjon gjør at den samme agenten kan plugge inn i nye verktøy når nye tilkoblinger dukker opp, og dermed redusere låsing og integrasjonskostnader.
Kriteriumfordeling
- Model Context Protocol-integrasjon
- Kobler til filer, API-er og databaser
- Utvidbar via egendefinerte MCP-servere
- Støtter agentiske, flertrinns arbeidsflyter
- Kompatibel med Claude-modelfamilien
- Åpen standard for interoperabilitet

BabyCatAGI
Litevektig, autonom AI-agent-rammeverk for strømlinjeformet oppgaveautomatisering

BabyCatAGI er en forenklet, modifisert versjon av BabyAGI, designet for å håndtere komplekse oppgaver gjennom autonome AI‑agenter. Den bryter ned høynivåmål til håndterbare deloppgaver, utfører dem sekvensielt og tilpasser planen basert på mellomresultater, noe som gjør den egnet for forskning, innholdsgenerering og problemløsning i flere trinn. Rammeverket prioriterer minimal kode og lesbarhet, noe som gjør det tilgjengelig for utviklere som ønsker å eksperimentere med agentisk AI uten overhead fra større orkestreringsbiblioteker. Det integreres med språkmodeller og verktøy for nettsøk for å samle kontekst, tenke gjennom problemer og produsere strukturerte resultater. Som et åpent eksperimentelt prosjekt er BabyCatAGI best egnet til å prototype agentarbeidsflyt, lære hvordan oppgave-drevne autonome systemer opererer, og tilpasse pipelines for spesifikke automatiseringsbehov.
Kriteriumfordeling
- Opprettelse og prioritering av oppgavelister
- Autonom utførelse av deloppgaver
- Integrasjon av nettsøk for kontekst
- Sekvensiell resonneringsflyt
- Litevektig Python-implementasjon
- Tilpassbare mål og prompt

BabyDeerAGI
Et strømlinjeformet AI-agentrammeverk som muliggjør parallell oppgaveutførelse for økt effektivitet.

BabyDeerAGI er et strømlinjeformet AI-agentrammeverk designet for å muliggjøre parallell oppgaveutførelse for økt effektivitet. Det er rettet mot utviklere og forskere som ønsker å optimalisere sine AI-arbeidsflyter. Ved å tillate flere oppgaver å kjøre samtidig, kan BabyDeerAGI betydelig redusere total behandlingstid. Rammeverket er bygget med fleksibilitet i tankene, og støtter integrasjon med ulike AI-modeller og verktøy. Spesifikke detaljer om dets muligheter og begrensninger er imidlertid ikke omfattende dokumentert i tilgjengelige kilder.
Kriteriumfordeling
- Parallell oppgaveutførelse
- Fleksibel integrasjon med AI-modeller
- Strømlinjeformet AI-agentrammeverk
- Støtte for samtidig prosessering









