Praeita kova · 2024-11-03 UTC
Speech Recognition Susirėmimas — 2024 m. lapkričio 3 d.
Iš Speech Recognition kategorijos. 27 įvertinimai pateikti tarp 6 kovotojų. WithAudio laimėjo vainiką.
Galutiniai rezultatai
Dalyviai
Kovotojai
Kiekvieno šioje kovoje dalyvavusio įrankio profiliai, surikiuoti pagal galutinį rezultatą.

WithAudio
Vienkartinė nuomos laipsnio grafinio tekstui kalbanti skaitytojas už Mac ir Windows.

WithAudio yra tai, kuris pavercia raidiniu turini i kalbima desktop tekstos įgarsinimo programėlė, skirta Mac ir Windows, kurį konvertuoja į garsinį audio. Vartotojai gali įrašyti tekstą, įkelti dokumentų, ar importuoti straipsnių ir naudodami AI-išgeneruotos balsinio pasirinkties jų skaityti pasakojimą akustiškai, tarsi tai naudojama redaguojant, prieinamumo ir be rankų skaitymui. Skirtingai nuo daugumos TTS tiesioginių įrankių, kurie nepriklauso mėnesių prenumeratėms, WithAudio siūlomas kaip vieną kartą nupirktas, kas labiau tikią tokius klausytojus ir rašytojus, kurie nori prasmingų kostų. Žurnalas siekia tiesioginio klausymo patirties, o ne komplikatau audio produktijų sukūrimo, su klausimo valčių ir galimybe eksportuoti generuojamą audio vėliau naudojimui.
Kriterijų išskirstymas
- Teksto į garsą perėjimo funkcija naudojanti AI balsus
- Kruopis platforma už Mac ir Windows
- Garsų kintamųjų įrašų galimybė už offline prieigą
- Dokumentų ir tekstų įvesties varžybų galimybos
- Klausos kontrolės privalumai
- Vienkartinė licencijos aktyvavimo galimybė

CallFluent
Įvairių valioklių analizės platforma, transkribuojanti, analizuoja ir kuo automatizuoja verslo telefono pokalbius.

CallFluent yra AI sėkmingai vadovaujamas skaitymo analizės platforma, kurioji padeda verslui pasiekti daugiau vertės iš savo telefono sąsajos. Jis apjungia kalba į raštą, pokalbio intelektualumą bei procesų automatizavimą, kad išskleistų aiškius žrįstą iš prekių pokalbių, palaikymo bilietų bei klientų prašymų. Platforma analizuoja toną, intenciją ir svarbiausias temas per kalbas, suteikdama komandąi matybės į vartotojo nuožiūrą, agentų performanciją ir balsavimo rezistenciją. Vadovai gali peržiūrėti tendencijas per aukštos konversacijų kiekiu be šių laiko manualiai klausytis kiekvienos įrašos. Su kviestių apžvalgoms, CRM logavimu ir sekantųjų priešgaidų triggeriais, CallFluent siekia sumažinti kartojamųjų po kviečių darbų ir padėti komandoms greičiau veikti įvairiausiomis klausimais besinorių klientų priemonėmis.
Kriterijų išskirstymas
- AI kalbos vertimas į tekstą
- Sentiment ir nusižengimo analizė
- Automatizuota pokalbės santrauka
- Pokalbių žrėslų įrangos ekranas
- CRM ir workflow integravimai
- Požymio pokalbio automatizavimo priežastys

Inworld AI
Sukurkite interaktyvius AI-technologiją naudojančius personažus žaidimams ir įsimonintiems virtualiems patirtimams.

Šieji Inworld AI yra personažų variklis, sukurtas programininksams, kuriems kūrė nukrypimąsi žaidimus, virtualių pasaulų, bei užimtinių medių. Jis leidžia kūrėjams suprojektuoti NPC bei digitalių asmenybių su išskirtinomis savybėmis, prisiminimais, balsais bei motyvacijomis, paskui parodinti juos gyvybegį per realų laiko konversaciją bei kontekstualų elgseną. Platforma sujungia kalbos modelius su tikslais, žinynais bei emociniais būsenų sąvokomis, kad balsavojučiai personažai gali reakcijas suteikti dynaminiams žaidimo įvykims, o ne tvarkomais juokais. Integravimo galimybės su varomojo kode šaltiniu kaip Unreal ir Unity, kartu su SDK bei API, leidžia įdiegti personažus žaidimams, pokalbių patirtimams, treniravimo simuliavimoams bei pramoginėms aplikacijoms.
Kriterijų išskirstymas
- Sukomponuojamieji AI personažų asmenybės
- ILGALAISI PRIŠMINIMAI ir žinų bazės
- Balsų sintezės ir emocinesių expressijų vyksmui
- Unity ir Unreal Engine SDK
- Tikslai, paskirtys ir elgesio sąrankos
- Daugelio vartotojų ir daugelio personažų interakcijos

Molly Personal Assistant
Maitinimo savaitės asistentas workflows automatyvusis ir ekipos bendradarbiavimo sutramdytojas.

Molį yra aiť personalinis sekretorius, kuris yra suprojektuotas automatišti workflows ir ekipos bendradarbiavimo sąrašus ir suteikti individualią patirtį dėl savų 'nebaigiamos atsiminimo' funkcijos sąnašų savęs preferencijas prisimenant ir interakcijas prieš tai pritaikytos. Naudojotojai gali deleguoti užduočių Molį, kuri ji vykdo maniera sujungiama prie naudojoto stiliaus. Šeimininkas taip pat siūlo proaktinį pasiūlymą išlaikyti naudojoto pristatymą prognozėmis norimąsias poreikius. Molį dabar ekspliciti privatai beta, įsivaizdujamos naudojotojai gali prisijungti prie laiko sąrašų išbandyti jos galimybes.
Kriterijų išskirstymas
- Fluoroasistentas automatyvumas
- Užduočių ir projektų trackinimas
- Ekipos bendradarbiavimo patramdymui
- Žemėlapis aiť asistuonas
- Intelektualūs planavimo ir prisiminimai
- Skirtingų patramdymų integracijos

Deepgram
Kalbų pereinamųjų ir kalbų į kalbą perduodančių API priemonės, skirtos realizuojanti realiu laiku balsų taikomojimus.

Deepgram yra balsiniai AI platforma, teikiusi kūrėjams API, kuriais gali paversti audio į kalbą ir suduoti natūraliai girdima kalbą. Jos modeliai projektuoti yra užtikrinkę mažą laikybį, aukštą tikslumą per plačią žemesių kalbų, tikslių tavių ir audio sąlygų, tai padeda būti tinkamu gyvoje įkalbinė, skambučio analizei, balsinis asistentas ir pokalbio agentams projektavimui. Deepgram gali siūlėti funkcijas, kaip vėlių atskirtinė, emocijų ir sriečiamųjų temaų pažinimą, individualų modelio treniravimą, bei pakuočių priegladžio užpildymą. Plataforma siūlo inžineriškų komandų, kurie reikia intuksičiai balsų galimybes į savo produktus, be tolesnės garsinės infrastruktūros sukūrimo.
Kriterijų išskirstymas
- Real-time streaming speech-to-text
- Sintetiniai kalbų į kalbą garso ženklai
- Sukauptų asmenų diarizacija ir žodžio lygio atliksmai
- Kustomizuota modelio pataisykla
- Audiotechninės žinias, sentimentas, temas, apžvalgą
- REST ir WebSocket API priemonės su daugialypių SDK
Kokoro TTS
Atvirųjų katalogo tekstų įgarsinimo sistema, kuri konvertuoja rašytą tekstą į tựišą prigimtinus balsus.

Kokoro TTS yra tekstų į garsą sistemos, skirtos konvertuoti parašytus įraiškius į aiškiai, natūraliai girdėjamą kalbą daugeliu kalbų ir balsų stilių. Ši sistema tikslas prieinamumas aukštos kokybės garsų sintezės kūrėjams, turiningo kūrėjams, ir entuziastams, kurie reikalauja tikslaus audio žingsnių į projekto kaip video filmai, audioknygos, priemonių prieinamumui, bei intuicinio pagalbos programėlės, ir kitus progresas. Modelis skirtas sugebėti gaminti aiškiai ir ryškesnių prasmininkų požymius turinčią garsinę raidą, taip pat jis yra pakankamai lėtasis, kad būtų galima jį atliepti įvairiuose aplinkose. Naudotojams leidžiama sukurti garsinę raidą iš tekstinių dalių, pasirinkti įvairias balsas bei integruoti gautus duomenis savuose veiksmėjimuose arba primontažuose.
Kriterijų išskirstymas
- Tikslūs keliolienių tekstų įgarsinimo funkcijos
- Daugybės pasirinkiamo balsų profilių galimybė
- Natūrali intonacija ir tempas
- Eksportuojama garso išvedimo galimybė
- Prieinama app, vaizdo įrašų ir narracijoje
- Programuotojų palankusji integracija




