Tidigare batalj · 2024-12-22 UTC
Agent Development Uppgörelse — 22 december 2024
Från kategorin Agent Development. 15 markeringar placerade över 4 kämpar. Vocode tog kronan.
Slutställning
Uppställningen
Kämparna
Profiler av varje verktyg som tävlade i den här bataljen, rankade efter sin slutpoäng.

Vocode
Öppen-soursecramtvärk för byggande av real-tidsspråk AI-agenter från tal till text, LLM och text-till-språk-komponenter

Vocode är en öppen källkodsbibliotek för byggande av röstbaserade konverserande AI-applikationer. Den erbjuder ledningen som krävs för att ansluta taligenkänning, stora språkmodeller och talgenerering till en enda Pipeline i realtid, och låter utvecklare skapa agenter som kan lyssna, fatta beslut och tala via telefon, webbsoketter eller lokalt ljud. Ramverket fördelar främst som en Python SDK, med fokus på strömmande ljud så att konversationer känns responsiva snarare än turvis med långa fördröjningar. Det hanterar de orkestreringsproblem som gör att röstagenter är svåra att bygga från grunden, såsom hantering av förbud (inträde), buffering och strömmande transkription, och koordinering av den återkopplingen mellan transkriberare, logik för agent och sångröst. Vocode är utformat för att vara modulärt och oberoende av tillhandahållare. Den integrerar med ett brett utbud av tredjeparts-tjänster för varje steg i pipelines — till exempel transkriptionsleverantörer som Deepgram och AssemblyAI, språkmodeller som OpenAIs och text-till-tal-motorer som ElevenLabs, Azure och andra. Utvecklare kan byta ut komponenter efter behov kring kostnad, latens och röstkvalitetskrav. Ett vanligt användningsfall är telefoni: Vocode stödjer placering och mottagande av telefonanrop via leverantörer som Twilio vilket gör det lämpligt för att bygga automatiska utgående och inkommande telefonsäljare, röstassistenter och kundorienterade telefonbotar. Det stödjer också webbaserade och lokal-mikrofon-dialekt konversationer för in-app-stemmerfarenheter. Eftersom det är öppen källkod och självvärd, lockar Vocode teams som vill ha kontroll över sin teknikstapel och kunna anpassa agentbeteende, i stället för att bero på en fullständigt hanterad sluten plattform. Vad man får i stället är att bygga productionstandardiserade röstagenter fortfarande kräver sammansyntning och betalning för extern transkription, LLM och TTS-tjänster samt justering av latensi och konversationsbeteende. Den finns i ett växande utrymme för röstagent-hanteringsverktyg tillsammans med hanterade plattformar och andra ramverk; dess huvudsakliga differentieringsfaktor är det öppna, komponerbara tillvägagångssättet som ger utvecklare direkt tillgång till ledningspipelins interna delar.
Radbrytning av kriterier
- Real-tidsströmningsröstagentpipelinen
- Integreringar med flera STT, LLM och TTS-leverantörer
- Telefonbetalning via Twilio och liknande telefoni- tjänster
- Interrupthande (barge-ing) hantering
- Python SDK för byggande av anpassade agenter
- Stöd för webbläsargräns och lokalmikrofonkonversationer

MemGPT
Ramverk som ger LLMs långsiktig minne och självhanterad kontext bortom fasta tokengränser

MemGPT är en öppen källkodramverk som syftar till att hantera en av de grundläggande begränsningarna hos stora språkmodeller: deras fasta kontextfönster. Ursprungligen från forskning vid UC Berkeley, introducerade projektet idén att behandla en LLM:s begränsade kontext som ett operativsystem hanterar begränsad fysisk minne, med hjälp av sidindelning och hierarkiska minnestier för att ge modeller utseendet av ett mycket större, ihållande minne. Den grundläggande metoden är hämtad direkt från operativsystemdesign. MemGPT gör en distinktion mellan inkontextuell minne (tokens som för närvarande finns i modellens promptfönster) och extern lagring som hålls utanför kontexten. Själva LLM får verktyg för funktionsanrop som låter den besluta när information ska flyttas mellan dessa nivåer — till exempel att spara viktiga fakta till långsiktig lagring, hämta relevant tidigare information eller redigera sitt eget kärnminne. Detta självredigerande beteende är det som gör att agenter kan upprätthålla en sammanhängande, utvecklad status över långa konversationer eller dokument som vida överstiger ett enda kontextfönster. Ramverket är riktat mot utvecklare som bygger konversationsagenter som behöver ihågminne av användare och tidigare interaktioner, samt de som arbetar med dokumentanalys över korpusar som är för stora för att få plats i kontexten. Genom att hantera återvinningminne, arkivlagring och en arbetskontext, möjliggör MemGPT agenter som kan referera till detaljer från mycket tidigare i en interaktion utan att utvecklaren manuellt konstruerar hämtningspipelines för varje fall. MemGPT fungerar både med proprietära modeller som de från OpenAI och lokalt hostade öppna modeller, och den integrerar med vektor-databaser och andra lagrings-backend för att bevara minnet mellan sessioner. Projektet utvecklades senare och är nära associerat med Letta, ett företag och en plattform som fortsätter utveckla de underliggande koncepten för tillståndsbaserade agenter, och erbjuder en server och verktyg kring de ursprungliga idéerna. Dess huvudsakliga styrkor är konceptuell tydlighet och ett konkret, återanvändbart mönster för långsiktig minne som går utöver naiv återviningsökad generering. Kompromisserna är typiska för agentramverk: den självredigerande minnesloopen förlitar sig kraftigt på modellens funktionssamtalstillförlitlighet, som kan variera med mindre eller lokala modeller, och de ytterligare minneshanteringsstegen lägger till latens och tokenkostnad. Som ett utvecklingsprojekt med öppen källkod har dess namn, API:er och omgivande ekosystem förändrats över tiden, vilket kan göra dokumentation och versionering till ett rörligt mål.
Radbrytning av kriterier
- Hierarkisk kontext- och extern minneshantering
- Självredigerande kärnminne via funktionsanrop
- Arkiverings- och återvinningminneslagring
- Vektor databasintegration för hämtning
- Stöd för flera LLM-backends
- Tillsats konversationsagenter

Letta AI
En öppen källkodsplattform för att bygga AI-agenter med långsiktig minnesförmåga och avancerad resonemangsförmåga

Letta AI är en öppen källkodsplattform som är utformad för att skapa tillståndskänsliga AI-agenter. Dessa agenter är utrustade med långsiktig minnesförmåga och avancerade resonemangs förmågor. Plattformen gör det möjligt för utvecklare att bygga AI-agenter som kan behålla ett minne av tidigare interaktioner, vilket möjliggör mer komplexa och sammanhangsmedvetna beslutsprocesser. Detta är särskilt användbart för tillämpningar som kräver att agenter lär sig av erfarenheter över tid och anpassar sina svar därefter. Letta AI riktar sig till utvecklare och forskare som är intresserade av att skapa avancerade AI-agenter för olika tillämpningar, från kundtjänst till mer invecklade problemlösningsuppgifter. Genom att tillhandahålla långsiktig minnesförmåga och avancerat resonemang möjliggör Letta AI utvecklingen av AI-agenter som kan hantera ett brett spektrum av uppgifter med en högre grad av autonomi och intelligens.
Radbrytning av kriterier
- Tillståndskänsliga AI-agenter
- Långsiktig minnesförmåga
- Avancerad resonemangsförmåga


Mosaia är en plattform drivande av community som är utformad för att bygga AI-agenter och appar i öppet. Plattformen erbjuder utvecklare verktyg att skapa, anpassa och distribuera AI-lösningar medan den främjar samarbete och transparens över projekt. Plattformen betonar öppenhet, genom vilket användare kan dela sina resultat, remixa andra användares agents och bidra till ett växande ekosystem av AI-komponenter. Denna strategi syftar till att sänka tröskeln för inträde till AI-utveckling samtidigt som den uppmuntrar erfarenhetsutbyte bland byggare. Om du utvecklar en enda AI-agент eller samlar in en mer komplex AI-arbetsflöde erbjuder Mosaia infrastruktur och en community som stödjer itativt och öppen utveckling.
Radbrytning av kriterier
- Verktyg för byggande av AI-agenter
- Öppet delande och samarbete
- Community-drivna marknadsplatser
- Anpassningsbara agent-strömmar
- Utvecklare-fokuserad plattform
- Distributionsinfrastruktur



