Battaglia passata · 2024-12-22 UTC
Agent Development Sfida — 22 dicembre 2024
Dalla categoria Agent Development. 15 segni piazzate tra 4 sfidanti. Vocode ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.

Vocode
Framework open-source per la creazione di agenti di intelligenza artificiale in tempo reale per la voce usando componenti speech-to-text, LLM e text-to-speech

Vocode è una libreria open-source per la creazione di applicazioni AI conversazionali basate sulla voce. Fornisce le funzionalità necessarie per collegare il riconoscimento della voce, i modelli linguistici di grandi dimensioni (LLM) e la sintesi vocale in un'unica pipeline in tempo reale, consentendo agli sviluppatori di creare agenti in grado di ascoltare, ragionare e parlare tramite chiamate telefoniche, socket web o audio locale. Il framework viene distribuito principalmente come Python SDK, con un focus sull'audio in streaming così che le conversazioni sembrino reattive piuttosto che basate su turni con lunghi ritardi. Gestisce le preoccupazioni dell'orchestrazione che rendono difficile la creazione di agenti vocali da zero, come la gestione delle interruzioni (barge-in), la memorizzazione tampone e lo streaming della trascrizione, e la coordinazione del flusso e riflusso tra trascrizione, logica dell'agente e sintetizzatore. Vocode è progettato per essere modulare e indipendente dal fornitore. Si integra con una serie di servizi di terze parti per ogni fase della pipeline, ad esempio fornitori di trascrizione come Deepgram e AssemblyAI, modelli linguistici come quelli di OpenAI e motori di text-to-speech come ElevenLabs, Azure e altri. Gli sviluppatori possono sostituire i componenti in base alle esigenze di costo, latenza e qualità della voce. Un caso d'uso comune è la telefonia: supporta la gestione di chiamate telefoniche in entrata e in uscita tramite provider come Twilio, il che lo rende adatto a costruire agenti di chiamata automatizzati in entrata e in uscita, assistenti vocali e bot telefonici per i clienti. Supporta inoltre conversazioni basate su browser e microfono locale per esperienze vocali all'interno delle app. Poiché è open source e autopubblicabile, Vocode è interessante per i team che vogliono avere il controllo sullo stack e la possibilità di personalizzare il comportamento degli agenti, piuttosto che affidarsi a una piattaforma chiusa completamente gestita. Lo svantaggio è che la creazione di agenti vocali di produzione di alta qualità richiede ancora la combinazione e il pagamento di servizi di trascrizione, LLM e TTS esterni, nonché la regolazione della latenza e del comportamento conversazionale. Si trova in uno spazio in crescita di strumenti per agenti vocali, insieme a piattaforme gestite e altri framework; il suo principale differenziatore è l'approccio open-source e componibile che offre agli sviluppatori l'accesso diretto agli internals della pipeline.
Suddivisione dei criteri
- Flusso di agenti per la voce in tempo reale
- Integrazioni con più provider di STT, LLM e TTS
- Supporto per le chiamate telefoniche tramite Twilio e simili servizi telefônici
- Gestione delle interruzioni (barge-in)
- SDK Python per la creazione di agenti personalizzati
- Supporto per conversazioni browser e local-microfono

MemGPT
Marco logico che concede agli LLM la memoria di lungo termine e un contesto auto-gestito al di là dei limiti dei token

MemGPT è un framework open-source progettato per affrontare uno dei vincoli fondamentali dei grandi modelli linguistici: la loro finestra di contesto fissa. Originato dalla ricerca presso l'UC Berkeley, il progetto ha introdotto l'idea di trattare il contesto limitato di un LLM come un sistema operativo gestisce la memoria fisica limitata, utilizzando la paginazione e livelli di memoria gerarchici per dare ai modelli l'apparenza di una memoria molto più grande e persistente. L'approccio fondamentale prende in prestito direttamente dalla progettazione dei sistemi operativi. MemGPT distingue tra memoria in contesto (i token attualmente nella finestra dei prompt del modello) e archiviazione esterna mantenuta all'esterno del contesto. L'LLM stesso viene fornito con strumenti per la chiamata di funzioni che gli consentono di decidere quando spostare le informazioni tra questi livelli, ad esempio, salvare fatti importanti nell'archiviazione a lungo termine, recuperare informazioni rilevanti dal passato o modificare la propria memoria centrale. Questo comportamento di auto-modifica è ciò che consente agli agenti di mantenere uno stato coerente ed evolutivo in conversazioni lunghe o documenti che superano di gran lunga una singola finestra di contesto. Il framework è rivolto agli sviluppatori che creano agenti conversazionali che richiedono una memoria persistente degli utenti e delle interazioni precedenti, nonché a coloro che lavorano sull'analisi di documenti su corpora troppo grandi per essere contenuti nel contesto. Gestendo la memoria di richiamo, l'archiviazione e un contesto di lavoro, MemGPT abilita agenti che possono fare riferimento a dettagli molto precedenti in un'interazione senza che lo sviluppatore debba ingegnerizzare manualmente pipeline di recupero per ogni caso. MemGPT funziona sia con modelli proprietari come quelli di OpenAI sia con modelli open ospitati localmente, e si integra con database vettoriali e altri back-end di archiviazione per persistere la memoria tra le sessioni. Il progetto è successivamente evoluto ed è strettamente associato a Letta, una società e piattaforma che continua a sviluppare i concetti di agente con stato sottostanti, offrendo un server e strumenti intorno alle idee originali. Le sue principali forze sono la chiarezza concettuale e un modello concreto e riutilizzabile per la memoria a lungo termine che va oltre la semplice generazione aumentata dal recupero. I compromessi sono tipici dei framework degli agenti: il ciclo di memoria auto-modificabile si basa fortemente sull'affidabilità della chiamata di funzione del modello, che può variare con modelli più piccoli o locali, e i passaggi aggiuntivi di gestione della memoria aggiungono latenza e sovraccarico di token. Come progetto open-source in evoluzione, la sua denominazione, le API e l'ecosistema circostante sono cambiati nel tempo, il che può rendere la documentazione e la gestione delle versioni un bersaglio in movimento.
Suddivisione dei criteri
- Gestione del contesto a livelli e memoria esterna
- Modifica auto-gestita della memoria di base tramite chiamate di funzione
- Memoria archiviata e di recall
- Integrazione con banche di dati vettoriali per la ricerca
- Supporto per più backend LLM
- Agenti conversazionali statali

Letta AI
Una piattaforma open-source per costruire agenzie AI a stato e con memoria e ragionamento a lungo termine.

Letta AI è una piattaforma open-source progettata per la creazione di agenzie AI a stato. Queste agenzie sono dotate di memoria a lungo termine e capacità di ragionamento avanzate. La piattaforma consente ai sviluppatori di costruire agenzie AI che possano mantenere una memoria delle interazioni passate, facilitando processi di presa di decisione più complessi e a senso di contesto. Ciò è particolarmente utile per le applicazioni che richiedono che le agenzie apprendano dalle esperienze nel tempo e adattino le loro risposte di conseguenza. Letta AI si rivolge a sviluppatori e ricercatori che vogliono creare agenzie AI sofisticate per varie applicazioni, dalla assistenza clienti all'analisi di problemi complessi. Offrendo memoria a lungo termine e ragionamento avanzato, Letta AI consente la creazione di agenzie AI capaci di gestire un ampio ventaglio di compiti con un più alto grado di autonomia e intelligenza.
Suddivisione dei criteri
- Agenti AI a stato
- Memoria a lungo termine
- Ragionamento avanzato

mosaia
Piattaforma aperta per la costruzione, condivisione e distribuzione di agenti di intelligenza artificiale in modo collaborativo

Mosaia è una piattaforma guidata dalla community, progettata per la creazione di agenti e applicazioni AI in modo aperto. Offre agli sviluppatori strumenti per creare, personalizzare e distribuire soluzioni AI, favorendo al contempo la collaborazione e la trasparenza tra i progetti. La piattaforma sottolinea l'apertura, consentendo agli utenti di condividere il proprio lavoro, remixare gli agenti di altri e contribuire a un ecosistema in crescita di componenti AI. Questo approccio mira ad abbassare la barriera all'ingresso per lo sviluppo dell'AI, incoraggiando al contempo la condivisione di conoscenze tra gli sviluppatori. Sia che tu stia prototipando un singolo agente o assemblando un workflow AI più complesso, Mosaia offre l'infrastruttura e la comunità per supportare uno sviluppo iterativo e aperto.
Suddivisione dei criteri
- Strumenti per la creazione di agenti di intelligenza artificiale
- Condivisione e collaborazione aperte
- Mercato di comunità gestito dagli utenti
- Flussi di agenti personalizzabili
- Piattaforma focalizzata sugli sviluppatori
- Infrastruttura di distribuzione



