Pretekla bitka · 2024-11-03 UTC
Speech Recognition Obračun — 3. november 2024
Iz kategorije Speech Recognition. 27 oznake postavljenih med 6 borci. WithAudio je osvojil krono.
Končna razvrstitev
Postava
Borci
Profili vsakega orodja, ki je tekmovalo v tej bitki, razvrščeni po končnem rezultatu.

WithAudio
Enkratni nakup bralca za pretvorbo besedila v govor z naravnimi AI glasovi za Mac in Windows

WithAudio je namizna aplikacija za pretvorbo besedila v govor za Mac in Windows, ki pisano vsebino pretvori v govorni zvočni zapis. Uporabniki lahko prilepi besedilo, naložijo dokumente ali uvozijo članke in jih preberejo z izbiro glasov, ustvarjenih z AI, kar je uporabno za preverjanje črkovanja, dostopnost in brezročno branje. V nasprotju z večino orodij TTS, ki se zanašajo na mesečne naročnine, se WithAudio ponuja kot enkratni nakup, kar privlači bralce in pisatelje, ki želijo predvidljive stroške. Aplikacija se osredotoča na preprost poslušni doživetje namesto na kompleksno zvočno produkcijo, z nadzornimi gumbi predvajanja in možnostjo izvoza ustvarjenega zvoka za kasnejšo uporabo.
Razdelitev kriterijev
- Pretvorba besedila v govor z AI glasovi
- Podpora za macOS in Windows
- Zvočni izvoz za offline poslušanje
- Vnos dokumentov in besedila
- Nastavljivi kontrole predvajanja
- Enkratna aktivacija licence

CallFluent
AI platforma za analitiko klicev, ki prepisuje, analizira in avtomatizira poslovne telefonske konverzacije.

CallFluent je platforma za analitiko klicev, poganjana z umetno inteligenco, zasnovana za pomoč podjetjem pri pridobivanju več vrednosti iz njihovih telefonskih interakcij. Združuje transkripcijo govora v besedilo, konverzacijsko inteligenco in avtomatizacijo delovnih tokov, da izpostavi vpoglede iz prodajnih klicev, podpornih zahtevkov in poizvedb strank. Platforma analizira ton, namen in ključne teme po klicih, kar ekipam omogoča vpogled v sentiment strank, uspešnost agentov in pogoste upnike. Menedžerji lahko preučijo trende po velikem številu pogovorov brez ročnega poslušanja vsakega posnetka. S funkcijami avtomatizacije, kot so povzetki klicev, beleženje v CRM in sprožilci za nadaljnje korake, si CallFluent prizadeva zmanjšati ponavljajoče se delo po klicu ter ekipam omogočiti hitrejše ukrepanje glede na to, kar dejansko povedo kupci.
Razdelitev kriterijev
- AI prevod govora v besedilo
- Analiza sentimenta in namena
- Avtomatizirane povzetke klicev
- Nadzorna plošča vpogledov v pogovor
- Integracije z CRM in delovnimi tokovi
- Sprožilci po-klicne avtomatizacije

Inworld AI
Zgradite interaktivne like, ki jih poganja AI, za igre in potopljene virtualne izkušnje.

Inworld AI je motor za ustvarjanje likov, namenjen razvijalcem, ki izdelujejo igre, virtualne svetove in interaktivne medije. Omogoča ustvarjalcem, da oblikujejo NPC-je in digitalne osebe z edinstvenimi osebnostmi, spomini, glasovi in motivacijami, nato pa jih oživijo z realnočasovnimi pogovori in kontekstualnim vedenjem. Platforma združuje jezikovne modele z cilji, bazami znanja in čustvenimi stanjami, tako da liki dinamično reagirajo na igralce namesto da sledijo napisanim dialogom. Integracije z gonilniki, kot so Unreal in Unity, skupaj z SDK-ji in API-ji omogočajo razširjanje likov po igralnih projektih, klepetalnih izkušnjah, izobraževalnih simulacijah in zabavnih aplikacijah.
Razdelitev kriterijev
- Prilagodljive osebnosti AI likov
- Dolgočasni spomin in baze znanja
- Sinteza glasu in čustveno izražanje
- Unity in Unreal Engine SDK-ji
- Cilji, sprožilci in nadzor vedenja
- Večigralske in večlikovne interakcije

Molly Personal Assistant
AI asistent za avtomatizacijo delovnih tokov in poenostavitev sodelovanja v timu.

Molly je AI osebni asistent, zasnovan za avtomatizacijo delovnih tokov in poenostavitev timskega sodelovanja. Cilj mu je ponuditi globoko personalizirano izkušnjo prek funkcije 'neskončnega spomina', ki mu omogoča, da si zapomni uporabniške preference in ustrezno prilagodi interakcije. Uporabniki lahko Mollyju dodelijo naloge, ki jih izvede na način, ki se sklada z uporabnikovim stilom. Asistent prav tako ponuja proaktivne predloge, ki uporabnikom pomagajo ostati korak pred prihodnjimi potrebami. Molly je trenutno v omejeni zasebni beta različici, zainteresirani uporabniki pa se lahko pridružijo čakalni listi, da izkusijo njegove zmogljivosti.
Razdelitev kriterijev
- Avtomatizacija delovnih tokov
- Spremljanje nalog in projektov
- Orodja za timsko sodelovanje
- AI asistent, usmerjen v produktivnost
- Pametno razporejanje in opomniki
- Integracije med orodji

Deepgram
API-ji za prepis govora v besedilo in pretvorbo besedila v govor za izdelavo aplikacij z glasom v realnem času.

Deepgram je platforma za glasovni AI, ki razvijalcem ponuja API-je za prepisovanje zvoka in ustvarjanje naravno zvenečega govora. Njegovi modeli so zasnovani za nizko zakasnitev in visoko natančnost pri širokem spektru jezikov, naglasov in zvočnih pogojev, kar ga naredi primernega za živo podnapisovanje, analizo klicev, glasovne asistente in konverzacijske agente. Poleg osnovne transkripcije Deepgram ponuja funkcije, kot so diarizacija govornikov, zaznavanje sentimenta in tem, prilagojeno treniranje modelov ter podpora za pretakanje. Platforma je namenjena inženirskim ekipam, ki potrebujejo vdelati glasovne funkcionalnosti v izdelke, ne da bi morale zgraditi govorno infrastrukturo od začetka.
Razdelitev kriterijev
- Prepis govora v besedilo v realnem času s pretakanjem
- Nevronski glasovi za pretvorbo besedila v govor
- Diarizacija govornikov in časovni žigi na ravni besed
- Fino nastavljanje prilagojenega modela
- Zvočna inteligenca (čustva, teme, povzetki)
- REST in WebSocket API-ji z večjezičnimi SDK-ji
Kokoro TTS
Open-source večjezični sistem za pretvorbo besedila v govor, ki pretvori pisani tekst v naravno zvenljive glasove.

Kokoro TTS je sistem za pretvorbo besedila v govor, zasnovan za pretvorbo pisnega vnosa v jasen, naraven govor v različnih jezikih in z različnimi glasovnimi slogi. Cilj je omogočiti razvijalcem, ustvarjalcem vsebin in hobistom dostop do visokokakovostne sinteze govora, ki potrebujejo realističen zvočni izhod za projekte kot so videi, audio knjige, orodja za dostopnost in glasovni pomočniki. Model se osredotoča na ustvarjanje tekoče prosodi in prepoznavnih lastnosti govorca, hkrati pa ostaja dovolj lahka, da deluje v različnih okoljih. Uporabniki lahko iz besedilnih fragmentov ustvarijo govorjeno zvočno posnetke, izbirajo med različnimi glasovi in vgrajujejo izhod v svoje delovne tokove ali aplikacije.
Razdelitev kriterijev
- Večjezična generacija govora iz besedila
- Več izbirnih glasovnih profilov
- Naravna intonacija in tempo
- Izvozljivi izhodni audio
- Primerno za aplikacije, videe in pripovedovanje
- Razvijalec-užinka integracija




