Eerdere strijd · 2024-12-22 UTC
Agent Development Duel — 22 december 2024
Uit de categorie Agent Development. 15 markeringen geplaatst over 4 strijders. Vocode pakte de kroon.
Eindstand
De line-up
De strijders
Profielen van elke tool die in deze strijd meedeed, gerangschikt op eindscore.

Vocode
Open-sourceframework voor het bouwen van real-time voice AI-agents vanuit spraak-naar-tekst, LLM en tekst-naar-spraakcomponenten

Vocode is een open-source bibliotheek voor het bouwen van spraakgebaseerde conversationele AI-toepassingen. Het biedt de noodzakelijke componenten om spraakherkenning, large language models en spraaksynthese samen te voegen in één realtime pijplijn, waardoor ontwikkelaars agents kunnen maken die kunnen luisteren, redeneren en spreken via telefoonoproepen, web sockets of lokale audio. Het framework wordt voornamelijk gedistribueerd als een Python SDK, met een focus op het streamen van audio zodat gesprekken responsief aanvoelen in plaats van beurtgewijs met lange vertragingen. Het behandelt de orkestratieproblemen die het moeilijk maken om voice-agents helemaal opnieuw te bouwen, zoals het beheer van onderbrekingen (barge-in), het bufferen en streamen van transcriptie, en het coördineren van de heen- en weerbewegingen tussen transcriber, agentlogica en synthesizer. Vocode is ontworpen om modulair en provider-onafhankelijk te zijn. Het integreert met een reeks diensten van derden voor elke fase van de pipeline — bijvoorbeeld transcriptieproviders zoals Deepgram en AssemblyAI, taalmodellen zoals die van OpenAI, en tekst-naar-spraak-engines zoals ElevenLabs, Azure en anderen. Ontwikkelaars kunnen componenten in- en uitwisselen afhankelijk van de kosten, latentie en spraakkwaliteitseisen. Een veel voorkomend gebruiksscenario is telefonie: Vocode ondersteunt het plaatsen en ontvangen van telefoongesprekken via providers zoals Twilio, waardoor het geschikt is voor het bouwen van geautomatiseerde uitgaande en binnenkomende callagents, spraakassistenten en klantgerichte telefoonbots. Het ondersteunt ook browsergebaseerde en lokale microfoongesprekken voor spraakervaringen in apps. Omdat het open source en zelf-hostbaar is, is Vocode aantrekkelijk voor teams die controle willen over hun stack en de mogelijkheid om agentgedrag aan te passen, in plaats van te vertrouwen op een volledig beheerd gesloten platform. De afweging is dat het bouwen van productie-ready spraakagenten nog steeds vereist dat je externe transcriptie-, LLM- en TTS-services samen configureert en daarvoor betaalt, en dat je latency en conversationeel gedrag afstemt. Het bevindt zich in een groeiende ruimte van voice-agent tooling, naast beheerde platforms en andere frameworks; het belangrijkste onderscheidende kenmerk is de open-source, composeerbare aanpak die ontwikkelaars directe toegang geeft tot de interne werking van de pipeline.
Kritériumverdeling
- Real-time streaming voice agent pijplijn
- Integraties met meerdere STT, LLM en TTS providers
- Telefoongesprek ondersteuning via Twilio en vergelijkbare telefoondiensten
- Afbreek (barge-in) handling
- Python SDK voor het bouwen van aangepaste agents
- Ondersteuning voor browser- en lokale-microfoon gesprekken

MemGPT
Framework dat LLMs langetermijngeheugen en zelfbeheerd context biedt, buiten vaste tokenlimieten om

MemGPT is een open-sourceframework dat is ontworpen om een van de fundamentele beperkingen van grote taalmodellen aan te pakken: hun vaste contextvenster. Het project, dat zijn oorsprong vindt in onderzoek aan de UC Berkeley, introduceerde het idee om de beperkte context van een LLM te behandelen zoals een besturingssysteem beperkte fysieke geheugen behandelt, door gebruik te maken van paging en hiërarchische geheugentiers om modellen de indruk te geven van een veel groter, persistent geheugen. De kernbenadering is rechtstreeks ontleend aan besturingssysteemontwerp. MemGPT maakt onderscheid tussen in-contextgeheugen (de tokens die momenteel in het promptvenster van het model staan) en externe opslag die buiten de context wordt gehouden. Het LLM zelf krijgt functie-aanroeptools die het laten beslissen wanneer informatie tussen deze tiers moet worden verplaatst — bijvoorbeeld, het opslaan van belangrijke feiten in langetermijngeheugen, het ophalen van relevante informatie uit het verleden, of het bewerken van zijn eigen kerngeheugen. Dit zelfbewerkende gedrag stelt agents in staat om coherente, evoluerende toestand te behouden over lange gesprekken of documenten die ver buiten een enkel contextvenster reiken. Het framework is gericht op ontwikkelaars die conversatie-agents bouwen die een persistent geheugen nodig hebben van gebruikers en eerdere interacties, evenals die welke werken aan documentanalyse over corpora die te groot zijn om in context te passen. Door het beheer van herinneringsgeheugen, archiefopslag en werkkontekst, stelt MemGPT agents in staat om details uit veel eerder in een interactie te refereren zonder dat de ontwikkelaar handmatig retrievalpijplijnen voor elk geval hoeft te ontwerpen. MemGPT werkt met zowel propriëtaire modellen zoals die van OpenAI als met lokaal gehoste open modellen, en het integreert met vector-databases en andere opslagbackends om geheugen tussen sessies te behouden. Het project is later geëvolueerd en nauw verbonden met Letta, een bedrijf en platform dat de ontwikkeling van de onderliggende stateful-agentconcepten voortzet, en biedt een server en tooling rond de originele ideeën. De belangrijkste sterke punten zijn conceptuele duidelijkheid en een concreet, herbruikbaar patroon voor langetermijngeheugen dat verder gaat dan naïeve retrieval-augmented generatie. De afwegingen zijn typisch voor agentframeworks: de zelfbewerkende geheugenlus vertrouwt sterk op de betrouwbaarheid van de functie-aanroep van het model, die kan variëren met kleinere of lokale modellen, en de extra geheugenbeheerstappen voegen latentie en tokenoverhead toe. Als een evoluerend open-sourceproject hebben de naamgeving, APIs en omliggende ecosysteem in de loop der tijd verschoven, wat kan maken dat documentatie en versiebeheer een bewegend doel zijn.
Kritériumverdeling
- Gelaagd context- en extern geheugenbeheer
- Zelfbewerkend kerngeheugen via functie-aanroepen
- Archief- en herinneringsgeheugenopslag
- Vectordatabase-integratie voor ophalen
- Ondersteuning voor meerdere LLM-backends
- Stateful conversatie-agents

Letta AI
Een open-sourceplatform voor het bouwen van stateful AI-agenten met langetermijngeheugen en geavanceerd redeneren.

Letta AI is een open-sourceplatform dat is ontworpen voor het maken van stateful AI-agenten. Deze agenten zijn uitgerust met langetermijngeheugen en geavanceerde redeneermogelijkheden. Het platform stelt ontwikkelaars in staat om AI-agenten te bouwen die een geheugen kunnen behouden van eerdere interacties, waardoor complexere en contextbewuste besluitvormingsprocessen mogelijk worden. Dit is vooral handig voor toepassingen die vereisen dat agenten leren van ervaringen in de loop van de tijd en hun antwoorden dienovereenkomstig aanpassen. Letta AI richt zich op ontwikkelaars en onderzoekers die geïnteresseerd zijn in het creëren van geavanceerde AI-agenten voor verschillende toepassingen, van klantenservice tot complexere probleemoplossende taken. Door het bieden van langetermijngeheugen en geavanceerd redeneren, stelt Letta AI de ontwikkeling van AI-agenten mogelijk die een breed scala aan taken kunnen uitvoeren met een hogere mate van autonomie en intelligentie.
Kritériumverdeling
- Stateful AI-agenten
- Langetermijngeheugen
- Geavanceerd redeneren


Mosaia is een community-gedreven platform dat is ontworpen voor het bouwen van AI-agenten en -toepassingen in het openbaar. Het biedt ontwikkelaars tools om AI-oplossingen te maken, aan te passen en te implementeren, terwijl het samenwerking en transparantie tussen projecten bevordert. Het platform benadrukt openheid, waardoor gebruikers hun werk kunnen delen, de agents van anderen kunnen remixen en kunnen bijdragen aan een groeiend ecosysteem van AI-componenten. Deze aanpak heeft tot doel de drempel voor AI-ontwikkeling te verlagen en kennisdeling onder bouwers te stimuleren. Of je nu een enkel agentprototype maakt of een complexere AI-workflow assembleert, biedt Mosaia de infrastructuur en community om iteratieve, open ontwikkeling te ondersteunen.
Kritériumverdeling
- AI-agent bouwwerkzeugen
- Open delen en samenwerking
- Door de community gedreven marktplaats
- Aanpasbare agent workflows
- Ontwikkelaar-gerichte platform
- Implementatie-infrastructuur



