Vergangene Schlacht · 2024-12-22 UTC
Agent Development Duell — 22. Dezember 2024
Aus der Kategorie Agent Development. 15 Marken verteilt auf 4 Kämpfer. Vocode holte sich die Krone.
Endstand
Die Aufstellung
Die Kämpfer
Profile aller Tools, die in dieser Schlacht angetreten sind, nach Endpunktzahl sortiert.

Vocode
Offene-Quellencode-Framework zur Erstellung von Echtzeit-Voice-AI-Agenten aus Sprach-zu-Text, LLM und Text-zu-Sprache-Komponenten

Vocode ist eine Open-Source-Bibliothek für den Aufbau von sprachbasierten konversationellen KI-Anwendungen. Sie bietet die notwendigen Komponenten, um Sprach認識, große Sprachmodelle (LLM) und Sprachsynthese in einer einzigen Echtzeit-Pipeline zu verbinden, sodass Entwickler Agenten erstellen können, die zuhören, denken und über Telefonanrufe, Websockets oder lokales Audio sprechen können. Das Framework wird hauptsächlich als Python-SDK vertrieben, mit einem Fokus auf das Streamen von Audio, damit Gespräche responsiv wirken und nicht turn-based mit langen Verzögerungen. Es übernimmt die Orchestrierungsaufgaben, die die Entwicklung von Sprachagenten von Grund auf schwierig machen, wie z.B. das Verwalten von Unterbrechungen (Barge-in), das Puffern und Streamen von Transkriptionen sowie die Koordination des Hin- und Hers zwischen Transcriber, Agent-Logik und Synthesizer. Vocode ist modular und anbieterunabhängig konzipiert. Es integriert sich in eine Reihe von Drittanbieter-Diensten für jede Stufe der Pipeline ein – zum Beispiel Transkriptionsanbieter wie Deepgram und AssemblyAI, Sprachmodelle wie die von OpenAI und Text-to-Speech-Engines wie ElevenLabs, Azure und andere. Entwickler können Komponenten je nach Kosten-, Latenz- und Sprachqualitätsanforderungen austauschen. Ein häufiger Anwendungsfall ist die Telefonie: Vocode unterstützt das Platzieren und Empfangen von Telefonanrufen über Anbieter wie Twilio, was es für den Aufbau von automatisierten ausgehenden und eingehenden Anrufagenten, Sprachassistenten und kundenorientierten Telefonbots geeignet macht. Es unterstützt auch browserbasierte und lokale Mikrofonkonversationen für In-App-Sprach体験. Da Vocode Open Source und selbst hostbar ist, spricht es Teams an, die die Kontrolle über ihren Stack und die Möglichkeit zur Anpassung des Agentenverhaltens wollen, anstatt sich auf eine vollständig verwaltete, geschlossene Plattform zu verlassen. Der Kompromiss besteht jedoch darin, dass der Aufbau von produktionsreifen Sprachagenten immer noch die Verbindung und Bezahlung externer Transkriptions-, LLM- und TTS-Dienste sowie die Feinabstimmung von Latenz und Konversationsverhalten erfordert. Es befindet sich in einem wachsenden Bereich von Voice-Agent-Tools neben verwalteten Plattformen und anderen Frameworks; sein Hauptdifferenzierungsmerkmal ist der quelloffene, komponierbare Ansatz, der Entwicklern direkten Zugriff auf die internen Prozesse der Pipeline bietet.
Kriterienaufschlüsselung
- Echtzeit-Streaming-Voice-Agenten-Pipeline
- Integrations mit mehreren STT, LLM und TTS-Anbietern
- Telefonanruf-Unterstützung über Twilio und ähnliche Telefondienstleister
- Unterbrechung (Barge-in)-Handling
- Python-SDK zur Erstellung von zufälligen Agenten
- Unterstützung für Browser und lokale-Mikrofon-Konsultationen

MemGPT
Framework, das LLMs langfristiges Gedächtnis und selbstverwalteten Kontext über feste Token‑Limits hinaus bietet

MemGPT ist ein Open‑Source‑Framework, das eine der grundlegendsten Einschränkungen großer Sprachmodelle adressiert: ihr festes Kontextfenster. Aus der Forschung an der UC Berkeley entstanden, stellte das Projekt die Idee vor, das begrenzte Kontextfenster eines LLMs analog zu einem Betriebssystem zu behandeln, das beschränktes physisches Speicher mithilfe von Paging und hierarchischen Speicher‑Stufen verwaltet, um dem Modell den Anschein einer viel größeren, persistenten Speicher‑Kapazität zu geben. Der Kernansatz entlehnt sich direkt vom Design von Betriebssystemen. MemGPT unterscheidet zwischen in‑Kontext‑Speicher (die Tokens, die sich aktuell im Prompt‑Fenster des Modells befinden) und externem Speicher, der außerhalb des Kontexts abgelegt ist. Das LLM selbst erhält funktionsbasierte Tooling, mit dem es entscheiden kann, wann Informationen zwischen diesen Ebenen verschoben werden – etwa wichtige Fakten in einen Langzeit‑Speicher zu schreiben, relevante vergangene Informationen abzurufen oder sein eigenes Kern‑Gedächtnis zu bearbeiten. Dieses selbstbearbeitende Verhalten ermöglicht es Agenten, einen kohärenten, sich entwickelnden Zustand über lange Gespräche oder Dokumente hinweg aufrechtzuerhalten, die weit über ein einzelnes Kontextfenster hinausgehen. Das Framework richtet sich an Entwickler, die konversationelle Agenten bauen, die ein persistentes Gedächtnis über Benutzer und vorherige Interaktionen benötigen, sowie an jene, die Dokumentenanalysen über Corpora durchführen, die zu groß für ein Kontextfenster sind. Durch die Verwaltung von Abruf‑Gedächtnis, Archiv‑Speicher und einem Arbeitsspeicher ermöglicht MemGPT Agenten, auf Details aus weit früheren Phasen einer Interaktion zu verweisen, ohne dass der Entwickler für jeden Fall manuell Abruf‑Pipelines entwerfen muss. MemGPT funktioniert mit proprietären Modellen wie denen von OpenAI sowie mit lokal gehosteten Open‑Source‑Modellen und integriert sich mit Vektordatenbanken und anderen Speicher‑Backends, um das Gedächtnis zwischen Sitzungen zu persistieren. Das Projekt hat sich später weiterentwickelt und steht in enger Verbindung zu Letta, einem Unternehmen und einer Plattform, die die Weiterentwicklung der zugrunde liegenden stateful‑Agenten‑Konzepte fortsetzt und einen Server sowie Tooling rund um die ursprünglichen Ideen anbietet. Seine Hauptstärken liegen in der konzeptionellen Klarheit und einem konkreten, wiederverwendbaren Muster für Langzeit‑Gedächtnis, das über die einfache retrieval‑augmented‑generation hinausgeht. Die Kompromisse sind typisch für Agenten‑Frameworks: der selbstbearbeitende Gedächtnisschleife ist stark auf die Zuverlässigkeit der Funktions‑Aufrufe des Modells angewiesen, die bei kleineren oder lokalen Modellen variieren kann, und die zusätzlichen Speicher‑Management‑Schritte bringen Latenz und Token‑Overhead mit sich. Als sich weiterentwickelndes Open‑Source‑Projekt haben sich Name, APIs und das Umfeld im Laufe der Zeit verschoben, was die Dokumentation und Versionierung zu einer beweglichen Zielsetzung machen kann.
Kriterienaufschlüsselung
- Gestaffeltes Kontext- und externes Speicher‑Management
- Selbstbearbeitung des Kern‑Speichers über Funktionsaufrufe
- Archiv‑ und Abruf‑Speicher
- Integration von Vektordatenbanken für die Abruffunktion
- Unterstützung mehrerer LLM‑Backends
- Zustandsbehaftete Konversationsagenten

Letta AI
Eine Open-Source-Plattform zum Erstellen zustandsbasierter AI-Agenten mit Langzeitgedächtnis und fortgeschrittener Logik.

Letta AI ist eine Open-Source-Plattform, die für die Erstellung zustandsbasierter AI-Agenten entwickelt wurde. Diese Agenten verfügen über ein Langzeitgedächtnis und fortgeschrittene Logikfähigkeiten. Die Plattform ermöglicht es Entwicklern, AI-Agenten zu bauen, die sich an vergangene Interaktionen erinnern können, was komplexere und kontextsensitivere Entscheidungsprozesse ermöglicht. Das ist besonders nützlich für Anwendungen, die verlangen, dass Agenten aus Erfahrungen lernen und ihre Antworten entsprechend anpassen. Letta AI richtet sich an Entwickler und Forscher, die fortschrittliche AI-Agenten für verschiedene Anwendungsbereiche schaffen wollen – von Kundenservice bis hin zu komplexeren Problemlösungsaufgaben. Durch die Bereitstellung von Langzeitgedächtnis und fortgeschrittener Logik ermöglicht Letta AI die Entwicklung von AI-Agenten, die eine breite Palette von Aufgaben mit höherer Autonomie und Intelligenz bewältigen können.
Kriterienaufschlüsselung
- Zustandsbasierte AI-Agenten
- Langzeitgedächtnis
- Fortgeschrittene Logik

mosaia
Offene Plattform zum gemeinschaftlichen Erstellen, Teilen und Bereitstellen von KI-Agenten

Mosaia ist eine von der Community getriebene Plattform, die darauf ausgelegt ist, KI-Agenten und Anwendungen offen zu entwickeln. Sie bietet Entwicklern Werkzeuge zum Erstellen, Anpassen und Bereitstellen von KI-Lösungen und fördert dabei Zusammenarbeit und Transparenz in Projekten. Die Plattform legt Wert auf Offenheit, sodass Nutzer ihre Arbeiten teilen, Agenten anderer remixieren und zu einem wachsenden Ökosystem von KI-Komponenten beitragen können. Dieser Ansatz soll die Einstiegshürden in die KI-Entwicklung senken und Wissensaustausch unter Bauern fördern. Egal, ob Sie einen einzelnen Agenten prototypisieren oder einen komplexeren KI-Workflow zusammenstellen, Mosaia bietet die Infrastruktur und Community, um iterative, offene Entwicklung zu unterstützen.
Kriterienaufschlüsselung
- Tools zum Erstellen von KI-Agenten
- Offenes Teilen und Zusammenarbeit
- Community-gesteuertes Marktplatz
- Anpassbare Agenten-Workflows
- Entwicklerorientierte Plattform
- Bereitstellungsinfrastruktur



