Bătălie trecută · 2024-11-03 UTC
Speech Recognition Confruntare — 3 noiembrie 2024
Din categoria Speech Recognition. 27 puncte plasate pe 6 luptători. WithAudio a luat coroana.
Clasament final
Lotul
Luptătorii
Profilurile fiecărui instrument care a concurat în această bătălie, clasate după scorul lor final.

WithAudio
Cititor text-to-speech pentru Mac și Windows cu voci AI naturale, achiziție unică.

WithAudio este o aplicație desktop text-to-speech pentru Mac și Windows care transformă conținutul scris în audio vorbit. Utilizatorii pot lipi text, încărca documente sau importa articole și le pot avea citite cu voce tare folosind o selecție de voci generate de AI, făcându-l util pentru corectură, accesibilitate și citire fără utilizarea mâinilor. Spre deosebire de majoritatea instrumentelor TTS care se bazează pe abonamente lunare, WithAudio este oferit ca o achiziție unică, ceea ce atrage cititorii și scriitorii care doresc costuri previzibile. Aplicația se concentrează pe o experiență de ascultare simplă, mai degrabă decât pe producția audio complexă, cu comenzi de redare și posibilitatea de a exporta audio generat pentru utilizare ulterioară.
Diviziunea criteriilor
- Conversie text-to-speech cu voci AI
- Suport multi-platformă pentru macOS și Windows
- Export audio pentru ascultare offline
- Opțiuni de intrare pentru documente și text
- Comenzi de redare reglabile
- Activare licență unică


CallFluent este o platformă de analiza a apelurilor AI, proiectată să ajute companiile să obțină mai multă valoare din interacțiunile lor telefonice. O combină cu transcrierea în text real-time a vorbei, inteligența conversației și automatizarea fluxului de lucru pentru a dezvălui informațiile din apeluri de vânzări, bilețele de suport și întrebările clienților. Platforma analizează tonul, intentia, și temele cheie din cadrul apelurilor, oferind echipelor vizibilitate asupra sentimentului clientului, performanța agentului și obiecțiile obișnuite. Managerii pot examina tendințele pe tot volumul conversațiilor fără a trebui să asculte manual fiecare înregistrare. Cu setări automate cum ar fi sinteze de apel, înregistrări în CRM și declanșatori de următoare apeluri, CallFluent se străduie să reducă munca repetitivă post-apel și să ajute echipele să acționeze mai rapid pe ceea ce clienții spun efectiv.
Diviziunea criteriilor
- Transcrierea audio-în-text prin inteligență artificială
- Analiza simțământului și a intenției
- Resumarea automată a apelurilor
- Ferestre de împărtășire a conversației
- Integrări cu CRM și flux de lucru
- Activații automate de post-apel

Inworld AI
Construiți caractere AI interacțive pentru jocuri și experiențe virtuale immersive.

Inworld AI este un motor de personaje proiectat pentru dezvoltatori care construiesc jocuri, lumile virtuale și media interactive. Le permite creatorilor să proiecteze NPC-urile și personajele digitale cu personalități distincte, amintiri, voci și motivații, apoi să le ducă la viață prin conversații în timp real și comportamente contextuale. Platforma combină modele de limbaj cu obiective, baze de cunoștințe și stări emoționale, astfel încât personajele să poată răspunde dinamic jucătorilor și nu numai prin linii scrise. Integrațiile cu motoarele Unreal și Unity, plus SDK-uri și API-uri, permit implementarea personajelor în proiecte de jocuri, experiențe de discuție, simulații de instruire și aplicații de divertisment.
Diviziunea criteriilor
- Personalități ai caracter customizable
- Memorie pe termen lung și baze de cunoștințe
- Sinteza vocilor și exprimarea emoțională
- Pachete de dezvoltare pentru Unity și Unreal Engine
- Controluri pentru scopuri, declanșatoare și comportamente
- Interacțiuni multiplayer și multi-charactere

Molly Personal Assistant
Asistent AI pentru automatizarea fluxurilor de lucru și eficientizarea colaborării în echipă.

Molly este un asistent personal AI conceput pentru a automatiza fluxurile de lucru și a eficientiza colaborarea în echipă. Acesta își propune să ofere o experiență profund personalizată prin funcția sa de 'memorie infinită', care îi permite să își amintească preferințele utilizatorilor și să adapteze interacțiunile în consecință. Utilizatorii pot delega sarcini lui Molly, pe care acesta le execută într-o manieră care se aliniază cu stilul utilizatorului. Asistentul oferă, de asemenea, sugestii proactive pentru a-i ajuta pe utilizatori să fie înaintea necesităților lor viitoare. Molly este în prezent într-o versiune beta privată limitată, iar utilizatorii interesați se pot înscrie pe lista de așteptare pentru a experimenta capacitățile sale.
Diviziunea criteriilor
- Automatizarea fluxurilor de lucru
- Urmărirea sarcinilor și proiectelor
- Instrumente de colaborare în echipă
- Asistent AI axat pe productivitate
- Programare inteligentă și mementouri
- Integrări între instrumente

Deepgram
APIs de speech-to-text și text-to-speech pentru construirea de aplicații vocale în timp real.

Deepgram este o platformă AI de voce care oferă dezvoltatorilor API-uri pentru transcrierea audio și generarea cuvântări naturale. Modelele sale sunt proiectate pentru o performanță de înaltă acuratețe și scurt timp de răspuns pentru o largă varietate de limbi, accente și condiții audio, ceea ce o face potrivită pentru citire în timp real, analiza apelurilor de voce, asistențile vocale și agenții de conversație. În afara de transcrierea de bază, Deepgram oferă caractere cum ar fi diarizarea vorbitorilor, detectarea sentimentului și a subiectului, trainingul de modele personalizate, și susținerea fluxurilor. Platforma este destinată echipelor de inginerie care au nevoie să includă capacitatea de voce în produse fără a construi o infrastructură de vorbire de la zero.
Diviziunea criteriilor
- Transcriere vocală în timp real
- Voci de text-to-speech neuronale
- Diarizare vorbitor și marcaje de timp la nivel de cuvânt
- Antrenare personalizată a modelelor
- Inteligență audio (sentiment, subiecte, rezumare)
- APIs REST și WebSocket cu SDK-uri multi-lingvistice
Kokoro TTS
Generator-executor de voce open-source și multilingv care convertește text în voce în vreo doar alături de fiecare punct.

Kokoro TTS este un sistem text-to-speech conceput pentru a converti intrările scrise în vorbire clară și naturală, pe o gamă largă de limbi și stiluri de voce. Acesta își propune să facă sinteza vocală de înaltă calitate accesibilă dezvoltatorilor, creatorilor de conținut și hobbyiștilor care necesită ieșiri audio realiste pentru proiecte precum videouri, cărți audio, unelte de accesibilitate și asistenți vocali. Modelul se axează pe producerea unei prozodii fluente și a unor caracteristici ale vorbitorului recunoscute, rămânând suficient de ușor pentru a rula în diverse medii. Utilizatorii pot genera sunet vocal din fragmente de text, pot alege între diferite voci și pot integra ieșirea în fluxurile de lucru proprii sau în aplicații.
Diviziunea criteriilor
- Generarea de vorbire multilingvă pe baza textului
- Profile de voce selectabile multiple
- Intonație și ritm natural
- Ieșire audio exportabilă
- Potrivit pentru aplicații, videoclipuri și narare
- Integrare prietenoasă pentru dezvoltatori




