Battaglia passata · 2024-11-03 UTC
Speech Recognition Sfida — 3 novembre 2024
Dalla categoria Speech Recognition. 27 segni piazzate tra 6 sfidanti. WithAudio ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.


WithAudio è un'applicazione desktop di text-to-speech per Mac e Windows che converte il contenuto scritto in audio parlato. Gli utenti possono incollare il testo, caricare documenti o importare articoli e farli leggere ad alta voce utilizzando una selezione di voci generate dall'intelligenza artificiale, rendendolo utile per la correzione di bozze, l'accessibilità e la lettura senza l'uso delle mani. A differenza della maggior parte degli strumenti TTS che si basano su abbonamenti mensili, WithAudio è offerto come acquisto una tantum, il che piace a lettori e scrittori che desiderano costi prevedibili. L'app si concentra su un'esperienza di ascolto semplice piuttosto che su una produzione audio complessa, con controlli di riproduzione e la possibilità di esportare l'audio generato per un uso successivo.
Suddivisione dei criteri
- Conversazione a testo a voce con voci AI
- Supporto cross-platform per macOS e Windows
- Esportazione di audio per ascolto offline
- Opzioni di input documentale e testuale
- Controlli di riproduzione regolabili
- Attivazione della licenza a prezzo unico

CallFluent
Piattaforma di analisi delle chiamate con AI che trascrive, analizza e automatizza le conversazioni commerciali su telefono.

CallFluent è una piattaforma di analisi dei sistemi di chiamata guidata dall'intelligenza artificiale progettata per aiutare le aziende a trarre maggior valore dalle loro interazioni telefoniche. Esegue la trascrizione di testo in tempo reale, fornisce inteligence di conversazione e automatizza i flussi di lavoro per mettere in luce delle informazioni dalle chiamate di vendita, dai biglietti di servizio e dalle query dei clienti. La piattaforma analizza tono, intento e argomenti chiave nelle chiamate, fornendo alle squadre una visibilità sul sentimento dei clienti, sulle prestazioni degli agenti e sulle obiezioni più comuni. I responsabili possono riesaminare le tendenze attraverso volumi elevati di conversazioni senza dover ascoltare manualmente ogni registro. Con caratteristiche di automazione come riassunti delle chiamate, registrazione del CRM e trigger di follow-up, CallFluent si propone di ridurre il lavoro ripetitivo dopo ogni chiamata e aiutare le squadre a reagire più velocemente alle cose che effettivamente dicono i clienti.
Suddivisione dei criteri
- Trascrizione del discorso mediante testo parlato con AI
- Analisi dell'umore e della volontà
- Sommarizzazione delle chiamate automatizzate
- Dashboard di insight della conversazione
- Integrazioni con CRM e workflow
- Gestori di trigger automatici post-chiamata

Inworld AI
Crea personaggi AI interattivi per videogiochi e esperienze virtuali immersive.

Inworld AI è un motore per la gestione dei personaggi progettato per i developer delle app di gioco, dei mondi virtuali e dei media interattivi. Lascia ai creatori il compito di progettare gli NPC e le personalità digitali con personalità, ricordi, voci e motivazioni distinti, mettendole poi in vita attraverso conversazioni in tempo reale e comportamenti contestuali. La piattaforma combina i modelli linguistici con oggetti di obiettivo, basi di conoscenza e stati emozionali, affinché i personaggi possano rispondere in modo dinamico agli utenti anziché seguire righe sceneggiate. Le integrazioni con motori come Unreal e Unity,oltre agli SDK e API, rendono possibile il dispiego dei personaggi in progetti di giochi, esperienze di chat, simulazioni di training e app di intrattenimento.
Suddivisione dei criteri
- Personalità AI dei personaggi personalizzabili
- Memoria a lungo termine e basi di conoscenza
- Sintesi vocale e espressione emotiva
- SDK e API per Unreal Engine e Unity
- Controlli delle azioni, dei trigger e del comportamento
- Interazioni multiplayer e multi-personaggi

Molly Personal Assistant
Assistente AI per l'automazione dei workflow e la sincronizzazione della collaborazione di squadra.

Molly è un assistente personale AI progettato per automatizzare i workflow e sincronizzare la collaborazione di squadra. Ha l'obiettivo di fornire un'esperienza fortemente personalizzata attraverso la sua caratteristica di 'memoria infinita', che consente di ricordare le preferenze degli utenti e di adattare le interazioni di conseguenza. Gli utenti possono delegare compiti a Molly, i quali esegue in modo che si allinei allo stile dell'utente. L'assistente offre anche suggerimenti proattivi per tenere gli utenti in testa anticipando le loro futura necessità. Molly è attualmente in una versione privata limitata in beta e gli utenti interessati possono iscriversi alla lista d'attesa per sperimentarne le sue funzionalità.
Suddivisione dei criteri
- Automazione dei workflow
- Tracciamento delle attività e dei progetti
- Strumenti di collaborazione di squadra
- Assistente AI focalizzato sulla produttività
- Scheduling intelligente e avvisi
- Integrazioni di tool cross-funzione

Deepgram
API per il riconoscimento vocale e la conversione testo-vocale per la creazione di applicazioni di voce in tempo reale.

Deepgram è una piattaforma di intelligenza artificiale per la voce che consente ai developer di utilizzare API per trascrivere audio e generare discorsi natural-sounding. I suoi modelli sono progettati per una prestazione a bassa latenza e alta accuratezza su una vasta gamma di lingue, accentuazioni e condizioni audio, rendendolo adatto per le didascalie in tempo reale, l'analisi delle chiamate, gli assistenti vocali e i agenti di conversazione. Al di là della trascrizione di base, Deepgram offre caratteristiche come la diarizzazione dei parlanti, la detezione di sentimenti e argomenti, l'allenamento di modelli personalizzati e supporto in streaming. La piattaforma è focalizzata su team di ingegneria che richiedono di integrare capacità vocali nelle proprie applicazioni senza dover costruire l'infrastruttura del discorso da zero.
Suddivisione dei criteri
- Transrizione vocale in streaming in tempo reale
- Voci testo-vocale neurali
- Diarizzazione dei speaker e timestamp a livello di parola
- Addestramento personalizzato di modelli
- Intelligenza audio (sentimento, argomenti, sommario)
- API e SDK multilingue con API REST e WebSocket
Kokoro TTS
TTS multilingue di origine aperto che trasforma il testo scritto in voci naturali-suonanti.

Kokoro TTS è un sistema di parola a testo realtà per convertire l'input scritto in parole in chiaro ed in modo naturale accross una varietà di lingue e stili di voce. L'obiettivo di questo sistema è rendere la sintesi vocale di alta qualità accessibile a sviluppatori, creatori di contenuti ed appassionati che hanno bisogno di un'uscita di audio realistica per progetti come i video, gli audiobooks, gli strumenti per l'accessibilità e gli assistenti vocali. Il modello si concentra nella produzione di una prosodia fluida e di caratteristiche del parlante riconoscibili, mantenendo una bassa complessità tale da poter operare in una varietà di ambienti. Gli utenti possono generare audio parlato a partire da snippet di testo, scegliere tra diverse voci e integrare il loro output negli flussi di lavoro o nelle applicazioni propri.
Suddivisione dei criteri
- Sintesi vocale multilingue di testi
- Voci selezionabili a più voci
- intonazione naturale e ritmo
- uscita dell'audio esportabile
- adatta per app, video, e narrativa
- in integrazione amichevole per sviluppatori




