Minulý súboj · 2024-11-03 UTC
Speech Recognition Súboj — 3. novembra 2024
Z kategórie Speech Recognition. 27 body udelených medzi 6 bojovníkov. WithAudio získal korunu.
Konečné poradie
Zostava
Bojovníci
Profily každého nástroja, ktorý súťažil v tomto súboji, zoradené podľa ich konečného skóre.

WithAudio
Jednorázový nákup prečítavača textu pomocou umelého hlasu pre Mac a Windows s prirodzenými AI hlasmi.

WithAudio je desktopová aplikácia na prevod textu do reči pre Mac a Windows, ktorá premieňa písaný obsah na hovorený zvuk. Používatelia môžu vložiť text, načitať dokumenty alebo importovať články a nechať ich prečítať nahlas pomocou výberu hlasov vygenerovaných umelou inteligenciou, čo je užitočné pre kontrolu pravopisu, dostupnosť a čítanie bez použitia rúk. Na rozdiel od väčšiny TTS nástrojov, ktoré sa spoliehajú na mesačné predplatné, je WithAudio ponúkaný ako jednorázový nákup, čo oslovuje čitateľov a spisovateľov, ktorí chcú predvídateľné náklady. Aplikácia sa sústredí na jednoduchý počúvací zážitok namiesto komplexnej zvukovej produkcie, s ovládaním prehrávania a možnosťou exportu vygenerovaného zvuku pre neskoršie použitie.
Rozdelenie kritérií
- Prepočet textu do reči pomocou AI hlasov
- Cross-platform podporu pre macOS a Windows
- Export audio pre offline počúvanie
- Možnosti vstupu dokumentov a textu
- Regulovateľné ovládanie prehrávania
- Aktivácia jednorázovej licencie

CallFluent
AI platforma na analýzu hovorov, ktorá prevádza, analyzuje a automatizuje obchodné telefonické konverzácie.

CallFluent je platforma pre analýzu hovorov poháňaná umelou inteligenciou, ktorá je navrhnutá tak, aby pomohla podnikom získať väčšiu hodnotu z ich telefonických interakcií. Kombinuje prepisovanie reči na text, konverzačnú inteligenciu a automatizáciu pracovných postupov, aby získala informácie z predajných hovorov, podporných tiketov a dopytov zákazníkov. Platforma analyzuje tón, zámer a kľúčové témy počas hovorov a poskytuje tímom prehľad o sentimente zákazníkov, výkone agentov a bežných námietkach. Manažéri môžu prezerať trendy naprieč veľkým počtom rozhovorov bez toho, aby museli manuálne počúvať každú nahrávku. Vďaka funkciám automatizácie, ako sú súhrny hovorov, protokolovanie CRM a spúšťače následných akcií, sa CallFluent snaží znížiť opakujúcu sa prácu po hovore a pomôcť tímom rýchlejšie reagovať na to, čo skutočne hovoria zákazníci.
Rozdelenie kritérií
- AI spracovanie reči na text
- Analýza sentimentu a úmyslu
- Automatizované zhrnutia hovorov
- Dashboard s poznatkami z konverzácií
- Integračné možnosti s CRM a workflow
- Spúšťače automatizácie po hovoroch

Inworld AI
Vytvárajte interaktívne postavy poháňané AI pre hry a pohlcujúce virtuálne zážitky.

Inworld AI je charakterový engine navrhnutý pre vývojárov vytvárajúcich hry, virtuálne svety a interaktívne médiá. Umožňuje tvorcom navrhovať NPC a digitálne postavy s výraznými osobnosťami, pamäťou, hlasom a motiváciami a následne ich oživovať prostredníctvom konverzácie v reálnom čase a kontextového správania. Platforma kombinuje jazykové modely s cieľmi, znalostnými bázami a emočnými stavmi, aby postavy mohli dynamicky reagovať na hráčov namiesto toho, aby nasledovali scenár. Integrácie s enginmi ako Unreal a Unity, plus SDK a API, umožňujú nasadiť postavy do herných projektov, chatových skúseností, tréningových simulácií a zábavných aplikácií.
Rozdelenie kritérií
- Prispôsobiteľné osobnosti postáv poháňaných AI
- Dlhodobá pamäť a databázy znalostí
- Synteza hlasu a emocionálne vyjadrenie
- Unity a Unreal Engine SDKs
- Ciele, spúšťače a ovládanie správania
- Interakcie pre viacerých hráčov a viacerých postáv

Molly Personal Assistant
AI asistent pre automatizáciu pracovných tokov a zjednodušenie tímovej spolupráce.

Molly je osobný AI asistent navrhnutý na automatizáciu pracovných tokov a zjednodušenie tímovej spolupráce. Snaží sa poskytovať hlboko personalizovaný zážitok prostredníctvom funkcie "nekonečná pamäť", ktorá mu umožňuje zapamätať si preferencie používateľov a prispôsobiť interakcie podľa nich. Používatelia môžu delegovať úlohy Molly, ktorá ich vykonáva spôsobom, ktorý zodpovedá štýlu používateľa. Asistent ponúka tiež proaktívne návrhy, aby používateľov udržoval v popredí predvídajúc ich budúce potreby. Molly je momentálne v obmedzenej súkromnej beta verzii a zvedaví používatelia sa môžu pripojiť k zoznamu čakajúcich na skúsenosť s jeho schopnosťami.
Rozdelenie kritérií
- Automatizácia pracovných tokov
- Sledovanie úloh a projektov
- Nástroje na tímovú spoluprácu
- Produktívne zameraný AI asistent
- Inteligentné plánovanie a pripomienky
- Integrácie medzi nástrojmi


Deepgram je hlasová AI platforma, ktorá poskytuje vývojárom rozhrania API na prepisovanie zvuku a generovanie prirodzene znejúcej reči. Jeho modely sú navrhnuté pre vysoký výkon s nízkou latenciou a vysokou presnosťou naprieč širokou škálou jazykov, prízvukov a audio podmienok, čo ho robí vhodným pre živé titulkovanie, analýzu hovorov, hlasové asistenty a konverzačné agenti. Okrem základného prepisu Deepgram ponúka funkcie ako rozlíšenie hovoriacich, detekcia sentimentu a tém, tréning vlastných modelov a podporu streamovania. Platforma sa zameriava na tímy vývojárov, ktoré potrebujú integrovať hlasové možnosti do produktov bez toho, aby museli od začiatku budovať rečovú infraštruktúru.
Rozdelenie kritérií
- Real-time speech-to-text
- Neural text-to-speech voices
- Speaker diarization
- Multi-language transcription
- Fine-tuning for custom models
- Bias correction
Kokoro TTS
Open-source viacjazyčný text-to-speech, ktorý premení písaný text na hlasne prirodzený hlas.

Kokoro TTS je systém prevodu textu na reč navrhnutý na konverziu písaného vstupu na čistú, prirodzene znejúcu reč v širokej škále jazykov a hlasových štýlov. Jeho cieľom je sprístupniť vysokokvalitnú syntézu hlasu vývojárom, tvorcom obsahu a amatéroch, ktorí potrebujú realistný zvukový výstup pre projekty ako videá, audioknihy, nástroje pre dostupnosť a hlasoví asistenti. Model sa zameriava na vytváranie plynulej prozódie a rozpoznateľných charakteristík hovorca, pričom zostáva dostatočne ľahký na spustenie v rôznych prostrediach. Používatelia môžu vygenerovať rečový zvuk z textových úryvkov, zvoliť si medzi rôznymi hlasmi a integrovať výstup do vlastných pracovných postupov alebo aplikácií.
Rozdelenie kritérií
- Viacjazyčná generácia text-to-speech
- Viacnásobné vyberateľné profily hlasu
- Prirodzená intonácia a rytmus
- Výstup vo forme exportovateľného audia
- Vhodné pre aplikácie, videá a narácia
- Príjemná integrácia pre vývojárov




