Tidligere kamp · 2024-12-22 UTC
Agent Development Oppgjør — 22. desember 2024
Fra kategorien Agent Development. 15 merker plassert på tvers av 4 kjempere. Vocode tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

Vocode
Åpen-kjøringsramme for å bygge real-time stemme AI-agenter fra tale til tekst, LLM og tekst til tale-komponenter

Vocode er en åpen kilde-bibliotek for å bygge stemmegrunnede konversasjonelle AI-applikasjoner. Det leverer vannrene nødvendige for å forbindre talekjennskap, store språkmønster og talegjenkjenning i ett felles realtids-pipeline, slik at utviklerne kan lage agenter som kan lytte, årsake og tale over telefonopring, websockets eller lokal lyd. Rammeverket blir hovedsakelig distribuert som et Python SDK, med fokus på strømming av lyd så at konversasjonene føles responsiv i stedet for å være basert på tur-til-tur med lange ventetider. Den håndterer konsernene når det gjelder å dirigere slik som gjør stemmeagenter vanskelige å bygge fra grunnen av, såsom å administrere innbrytninger (opptak ved barge-in), buffring og strømming av transkripsjon, og å koordinere det tilbake-og-videre mellom transkriber, agents logikk og synthesizer. Vocode er utviklet for å være modulært og uavhengig av leverandør. Det integrerer med en rekke tredjeparts-tjenester for hver del av pipelinen – for eksempel transkripsjonsleverandører som Deepgram og AssemblyAI, språklæringsmodeller som de fra OpenAI, og tekst-til-tale Motorer inkludert ElevenLabs, Azure, og andre. Utviklere kan bytte komponenter i og ut avhengig av kostnad, latens og stemme- kvalitet Krav. En vanlig bruksområde er telefoni: Vocode understøtter å plassere og motta telefonsamtaler gjennom leverandører som Twilio, noe som gjer det til et selskap som er egnet til å bygge automatiserte ute og inn-telefonbespørsmål, stemmeassistenter og kundeserviceteoriler på telefon. Det også understøtter samtaler på nettleser og lokale mikrofoner for in-app-stemmeerfaringer. Fordi den er åpen kildekode og selv-håndterbar, tiltrer Vocode lag som ønsker kontroll over deres stack og mulighets til å tilpasse agents oppførsel, i steden for å avhenge seg av en komplett forvaltet lukket plattform. Ulempen er at å bygge produsjonsklasse stemmeagenter fortsatt krever kobling og betaling for eksisterende transkripsjon, LLM og TTS-tjenester, samt justering av latency og konversasjonal oppførsel. Den holder til i en voksende område for stemme-agent-verktøy sammen med styrt plattform og andre rammer; dens hovedforskjell fra andre er åpen kildekode og en komponerbar tilnærming som lar utviklere få direkte tilgang til strømmen av innhold i pipeline-en.
Kriteriumfordeling
- Real-time streaming stemmeagenter-pipeline
- Integreringer med flere STT, LLM og TTS-leverandører
- Telefonstøtte via Twilio og lignende telefoni-tjenester
- Handling av avbrudd (barge-in)
- Python-SDK for å bygge custom-agenter
- Støtte for konversasjoner i nettleser og lokale mikrofoner

MemGPT
Rammeverk som gir LLM-er langtidshukommelse og selvstyrt kontekst utover faste tokenbegrensninger

MemGPT er et åpenkilde‑rammeverk designet for å løse en av de grunnleggende begrensningene til store språkmodeller: deres faste kontekstvindu. Opprinnelig fra forskning ved UC Berkeley introduserte prosjektet ideen om å behandle en LLMs begrensede kontekst som et operativsystem håndterer begrenset fysisk minne, ved å bruke paging og hierarkiske memory tiers for å gi modellene et inntrykk av et mye større, vedvarende minne. Kjerne‑tilnærmingen tar direkte i bruk prinsippene fra operativsystemdesign. MemGPT skiller mellom in‑context‑minne (tokenene som er i modellens promptvindu for øyeblikket) og ekstern lagring som holdes utenfor konteksten. Selve LLM-en får tildelt funksjonskall‑verktøy som lar den bestemme når den skal flytte informasjon mellom disse lagrene — for eksempel lagre viktige fakta til langtidslagring, hente relevant tidligere informasjon eller redigere sitt eget kjerne‑minne. Denne selvredigeringsoppførselen gjør det mulig for agenter å opprettholde en sammenhengende, evolverende tilstand på tvers av lange samtaler eller dokumenter som langt overskrider et enkelt kontekstvindu. Rammeverket er rettet mot utviklere som bygger samtalende agenter som trenger vedvarende minne om brukere og tidligere interaksjoner, samt de som jobber med dokumentanalyse over korpus som er for store til å passe inn i konteksten. Ved å håndtere gjenopplivningsminne, arkivlagring og en arbeidende kontekst, gjør MemGPT agenter i stand til å referere til detaljer fra langt tidligere i en interaksjon uten at utvikleren manuelt må bygge henterprosesser for hver enkelt sak. MemGPT fungerer med både proprietære modeller, som de fra OpenAI, og lokalt hostede åpne modeller, og det integrerer med vektordatabaser og andre lagringsbackends for å opprettholde minne mellom økter. Prosjektet har senere utviklet seg og er tett knyttet til Letta, et selskap og en plattform som fortsetter utviklingen av de underliggende stateful-agent-konseptene, og tilbyr en server og verktøy rundt de opprinnelige ideene. Hovedstyrkene er konseptuell klarhet og et konkret, gjenbrukbart mønster for langtidsminne som går utover naive retrieval-augmented generation. Kompromissene er typiske for agentrammeverk: den selvredigerende minneløkken er sterkt avhengig av modellens funksjonskallingspålitelighet, som kan variere med mindre eller lokale modeller, og de ekstra minnehåndteringsstegene legger til latens og token-overhead. Som et stadig utviklende open-source-prosjekt har navngivning, APIer og det omkringliggende økosystemet skiftet over tid, noe som kan gjøre dokumentasjon og versjonering til et bevegelig mål.
Kriteriumfordeling
- Lagvis kontekst og ekstern minnehåndtering
- Selvredigerende kjerneminne via funksjonskall
- Arkiv- og gjenkallingsminneopbevaring
- Integrering med vektordatabaser for henting
- Støtte for flere LLM-backends
- Tilstandsholdende samtaleagenter

Letta AI
En åpen kildekodeplattform for å bygge tilstandsholdende AI-agenter med langtidshukommelse og avansert resonnement.

Letta AI er en åpen kilde-plattform designet for å lage tilstandsholdende AI-aktører. Disse aktørene er utstyrt med langtidshukommelse og avansert resonnement. Plattformen gjør det mulig for utviklere å bygge AI-aktører som kan opprettholde en hukommelse av tidligere interaksjoner, noe som muliggjør mer komplekse og kontekstbevisste beslutningsprosesser. Dette er særlig nyttig for applikasjoner som krever at aktørene lærer av erfaringer over tid og tilpasser sine svar deretter. Letta AI retter seg mot utviklere og forskere som ønsker å lage avanserte AI-aktører for ulike bruksområder, fra kundeservice til mer intrikate problemløsningsoppgaver. Ved å tilby langtidshukommelse og avansert resonnement muliggjør Letta AI utviklingen av AI-aktører som kan håndtere et bredt spekter av oppgaver med et høyere nivå av autonomi og intelligens.
Kriteriumfordeling
- Tilstandsholdende AI-agenter
- Langtidshukommelse
- Avansert resonnement


Mosaia er en plattform drevet av fellesskapet, utviklet for å bygge AI‑agenter og applikasjoner åpent. Den gir utviklere verktøy til å lage, tilpasse og distribuere AI‑løsninger samtidig som den fremmer samarbeid og transparens på tvers av prosjekter. Plattformen legger vekt på åpenhet, og lar brukere dele sitt arbeid, remikse andres agenter og bidra til et stadig voksende økosystem av AI-komponenter. Denne tilnærmingen har som mål å senke terskelen for AI-utvikling samtidig som den oppmuntrer til kunnskapsdeling blant utviklere. Enten du prototyper en enkelt agent eller bygger en mer kompleks AI-arbeidsflyt, tilbyr Mosaia infrastruktur og fellesskap for å støtte iterativ, åpen utvikling.
Kriteriumfordeling
- Verktøy for å bygge AI-agenter
- Åpen deling og samarbeid
- Fellesskapsdrevet marked
- Tilpassbare agentarbeidsflyter
- Utviklerfokusert plattform
- Distribusjonsinfrastruktur



