Bataille passée · 2024-12-22 UTC
Agent Development Duel — 22 décembre 2024
De la catégorie Agent Development. 15 marques placées sur 4 combattants. Vocode a décroché la couronne.
Classement final
Le casting
Les combattants
Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.


Vocode est une bibliothèque open-source pour la création d'applications conversationnelles basées sur la voix utilisant l'intelligence artificielle. Elle fournit les éléments nécessaires pour connecter la reconnaissance vocale, les grands modèles de langage (LLM) et la synthèse vocale en un seul pipeline en temps réel, permettant aux développeurs de créer des agents capables d'écouter, de raisonner et de parler lors d'appels téléphoniques, de connexions web ou d'audio local. Le framework est principalement distribué sous forme d'un SDK Python, avec un focus sur le streaming audio afin que les conversations soient fluides et ne donnent pas l'impression d'être basées sur des tours avec de longs délais. Il gère les aspects d'orchestration qui rendent les agents vocaux difficiles à construire à partir de zéro, tels que la gestion des interruptions (barge-in), la mise en tampon et le streaming de la transcription, ainsi que la coordination des échanges entre le transcripteur, la logique de l'agent et le synthétiseur. Vocode est conçu pour être modulaire et agnostique en termes de fournisseur. Il s'intègre à une gamme de services tiers pour chaque étape de la chaîne de traitement — par exemple, des fournisseurs de transcription tels que Deepgram et AssemblyAI, des modèles de langage tels que ceux d'OpenAI, et des moteurs de synthèse vocale tels que ElevenLabs, Azure, et d'autres. Les développeurs peuvent remplacer les composants en fonction des exigences de coût, de latence et de qualité vocale. Un cas d'utilisation courant est la téléphonie : Vocode prend en charge l'établissement et la réception d'appels téléphoniques via des fournisseurs tels que Twilio, ce qui le rend adapté à la construction d'agents d'appel sortants et entrants automatisés, d'assistants vocaux et de robots téléphoniques orientés client. Il prend également en charge les conversations basées sur le navigateur et le microphone local pour les expériences vocales intégrées à l'application. Parce qu'il est open source et auto-hébergeable, Vocode séduit les équipes qui veulent contrôler leur pile technologique et personnaliser le comportement des agents, plutôt que de s'appuyer sur une plateforme fermée entièrement gérée. Le compromis est que la construction d'agents vocaux de qualité production nécessite toujours de connecter et de payer pour des services de transcription, LLM et TTS externes, ainsi que d'ajuster la latence et le comportement conversationnel. Il s'inscrit dans un espace en croissance d'outils d'agents vocaux aux côtés de plates-formes gérées et d'autres frameworks ; son principal différentiateur est l'approche open-source et composable qui donne aux développeurs un accès direct aux internes de la pipeline.
Répartition des critères
- Pipeline d'agent vocal en streaming en temps réel
- Intégrations avec plusieurs fournisseurs de STT, LLM et TTS
- Support des appels téléphoniques via Twilio et des services de téléphonie similaires
- Gestion des interruptions (barge-in)
- SDK Python pour créer des agents personnalisés
- Support pour les conversations via navigateur et microphone local

MemGPT
Framework donnant aux LLM une mémoire à long terme et un contexte auto-géré au-delà des limites de jetons fixes

MemGPT est un cadre open-source conçu pour répondre à l'une des contraintes fondamentales des grands modèles de langage : leur fenêtre de contexte fixe. Issu de recherches à l'UC Berkeley, le projet a introduit l'idée de traiter le contexte limité d'un LLM comme un système d'exploitation gère une mémoire physique limitée, en utilisant des pages et des niveaux de mémoire hiérarchiques pour donner aux modèles l'apparence d'une mémoire beaucoup plus grande et persistante. L'approche de base est directement inspirée de la conception des systèmes d'exploitation. MemGPT fait la distinction entre la mémoire dans le contexte (les jetons actuellement dans la fenêtre de prompt du modèle) et le stockage externe maintenu en dehors du contexte. Le LLM lui-même se voit doté d'outils d'appel de fonctions qui lui permettent de décider quand déplacer des informations entre ces niveaux, par exemple en enregistrant des faits importants dans un stockage à long terme, en récupérant des informations pertinentes antérieures, ou en modifiant sa propre mémoire principale. C'est ce comportement d'auto-édition qui permet aux agents de maintenir un état cohérent et évolutif sur de longues conversations ou des documents qui dépassent largement une seule fenêtre de contexte. Le cadre est destiné aux développeurs qui créent des agents conversationnels nécessitant une mémoire persistante des utilisateurs et des interactions précédentes, ainsi qu'à ceux qui travaillent sur l'analyse de documents sur des corpus trop volumineux pour être pris en compte dans le contexte. En gérant la mémoire de rappel, le stockage d'archives et un contexte de travail, MemGPT permet aux agents de référencer des détails beaucoup plus anciens dans une interaction sans que le développeur n'ait à concevoir manuellement des pipelines de récupération pour chaque cas. MemGPT fonctionne à la fois avec des modèles propriétaires tels que ceux d'OpenAI et des modèles ouverts hébergés localement, et il s'intègre à des bases de données vectorielles et d'autres backends de stockage pour persister la mémoire entre les sessions. Le projet a ensuite évolué et est étroitement associé à Letta, une entreprise et une plateforme qui poursuit le développement des concepts d'agents étatiques sous-jacents, en proposant un serveur et des outils autour des idées originales. Ses principales forces sont la clarté conceptuelle et un modèle concret et réutilisable pour une mémoire à long terme qui va au-delà de la génération naïve augmentée par la récupération. Les compromis sont typiques des cadres d'agents : la boucle de mémoire auto-éditrice repose fortement sur la fiabilité de l'appel de fonctions du modèle, qui peut varier avec des modèles plus petits ou locaux, et les étapes supplémentaires de gestion de la mémoire ajoutent une latence et un surcoût de jeton. En tant que projet open-source en évolution, sa dénomination, ses API et son écosystème environnant ont changé au fil du temps, ce qui peut rendre la documentation et la gestion des versions une cible mouvante.
Répartition des critères
- Gestion de contexte hiérarchique et de mémoire externe
- Mémoire centrale auto-éditée via des appels de fonction
- Stockage de mémoire d'archivage et de rappel
- Intégration de bases de données vectorielles pour la récupération
- Prise en charge de plusieurs backends LLM
- Agents conversationnels étatiques

Letta AI
Une plateforme open-source pour créer des agents d'IA à état avec une mémoire à long terme et un raisonnement avancé.

Letta AI est une plateforme open-source conçue pour créer des agents d'IA à état. Ces agents sont équipés d'une mémoire à long terme et de capacités de raisonnement avancé. La plateforme permet aux développeurs de créer des agents d'IA qui peuvent maintenir une mémoire des interactions passées, permettant des processus de prise de décision plus complexes et-aware du contexte. Cela est particulièrement utile pour les applications nécessitant des agents pour apprendre des expériences avec le temps et adapter leurs réponses en conséquence. Letta AI s'adresse aux développeurs et chercheurs intéressés par la création d'agents d'IA sophistiqués pour diverses applications, allant du service client à des tâches de résolution de problèmes plus complexes. En fournissant une mémoire à long terme et un raisonnement avancé, Letta AI permet le développement d'agents d'IA qui peuvent gérer une large gamme de tâches avec un degré d'autonomie et d'intelligence plus élevé.
Répartition des critères
- Agents d'IA à état
- Mémoire à long terme
- Raisonnement avancé

mosaia
Plateforme ouverte pour créer, partager et déployer des agents IA en collaboration

Mosaia est une plateforme communautaire conçue pour construire des agents IA et des applications de façon ouverte. Elle fournit aux développeurs des outils pour créer, personnaliser et déployer des solutions IA tout en favorisant la collaboration et la transparence à travers les projets. La plateforme met l'accent sur l'ouverture, permettant aux utilisateurs de partager leur travail, de remixé les agents d’autres, et de contribuer à un écosystème croissant de composants IA. Cette approche vise à réduire la barrière à l'entrée pour le développement IA tout en encourageant le partage de connaissances entre les bâtisseurs. Que vous prototypiez un agent unique ou assembliez un flux de travail IA plus complexe, Mosaia offre l'infrastructure et la communauté pour soutenir un développement itératif et ouvert.
Répartition des critères
- Outils de création d'agents IA
- Partage et collaboration ouverts
- Marché propulsé par la communauté
- Flux de travail d'agents personnalisables
- Plateforme axée sur les développeurs
- Infrastructure de déploiement



