Minulá bitva · 2024-11-03 UTC
Speech Recognition Souboj — 3. listopadu 2024
Z kategorie Speech Recognition. 27 hlasů umístěno napříč 6 bojovníky. WithAudio získal korunu.
Konečné pořadí
Sestava
Bojovníci
Profily každého nástroje, který soutěžil v této bitvě, seřazené podle jejich konečného skóre.

WithAudio
Jednorázová koupě text-to-speech čtecí aplikace pro Mac a Windows s přirozenými AI hlasy.

WithAudio je desktopová aplikace pro převod textu na řeč pro Mac a Windows, která mění písemný obsah v mluvený zvuk. Uživatelé mohou vkládat text, načítat dokumenty nebo importovat články a nechat je přečíst nahlas pomocí výběru hlasů vygenerovaných umělou inteligencí, což je užitečné pro kontrolu pravopisu, přístupnost a čtení bez použití rukou. Na rozdíl od většiny nástrojů TTS, které se spoléhají na měsíční předplatné, je WithAudio nabízen jako jednorázový nákup, což oslovuje čtenáře a spisovatele, kteří chtějí předvídatelné náklady. Aplikace se zaměřuje na přímočarý poslechový zážitek spíše než na komplexní zvukovou produkci, s ovládáním přehrávání a možností exportu vygenerovaného zvuku pro pozdější použití.
Розбивка критеріїв
- Tvorba textu k hlasu AI hlasy
- Křížová platforma Mac OS X a Windows
- Vystavení audio pro offline poslech
- Vstupní dokumentu a text
- Srozumitelná ovládací prvky přehrávání
- Aktivace jednorázové licence

CallFluent
platforma pro analýzu hovorů založená na AI, která přepisuje, analyzuje a automatizuje obchodní telefonní konverzace

CallFluent je platforma pro analýzu hovorů poháněná umělou inteligencí, která je navržena tak, aby pomohla podnikům získat více hodnoty z jejich telefonních interakcí. Kombinuje přepis řeči na text, konversační inteligenci a automatizaci pracovních postupů, aby získala informace z prodejních hovorů, podpůrných tiketů a dotazů zákazníků. Platforma analyzuje tón, záměr a klíčová témata napříč hovory a poskytuje týmům přehled o sentimentu zákazníků, výkonu agentů a běžných námitkách. Manažeři mohou analyzovat trendy napříč velkým objemem konverzací bez nutnosti ručně poslouchat každý záznam. S funkcemi automatizace, jako jsou souhrny hovorů, protokolování CRM a spouštěče následných kroků, se CallFluent snaží snížit opakující se práci po hovoru a pomoci týmům rychleji jednat podle toho, co zákazníci skutečně říkají.
Розбивка критеріїв
- AI přepisování textu v reálném čase
- Analýza sentimentu a úmyslu
- Automatizované shrnutí hovorů
- Panel přehledů konverzací
- Integrace s CRM a workflow
- Triggery automatizace post-hovorové činnosti

Inworld AI
Vytvořte interaktivní postavy ovládané umělou inteligencí pro hry a immersive virtuální zkušenosti.

Inworld AI je charakterový engine navržený pro vývojáře vytvářející hry, virtuální světy a interaktivní média. Umožňuje tvůrcům navrhovat NPC a digitální postavy s výraznými osobnostmi, pamětí, hlasem a motivacemi a následně je oživit prostřednictvím konverzace v reálném čase a kontextového chování. Platforma kombinuje jazykové modely s cíli, znalostními bázemi a emočními stavy, aby postavy mohly dynamicky reagovat na hráče, místo aby se řídily scénářovými řádky. Integrace s enginy jako Unreal a Unity, plus SDK a API, umožňují nasazení postav napříč herními projekty, chatovými zkušenostmi, tréninkovými simulacemi a zábavními aplikacemi.
Розбивка критеріїв
- Přizpůsobitelné osobnosti AI postav
- Dlouhodobá paměť a znalostní báze
- Syntéza hlasu a emoční výraz
- SDK pro Unity a Unreal Engine
- Cíle, spouštěče a ovládání chování
- Mnohočetné interakce a interakce více postav

Molly Personal Assistant
Asistent AI pro automatizaci pracovních postupů a zjednodušení týmové spolupráce.

Molly je asistent AI navržený pro automatizaci pracovních postupů a zjednodušení týmové spolupráce. Cílem je poskytnout hluboce personalizovaný zážitek prostřednictvím funkce "nekonečné paměti", která umožňuje asistentovi pamatovat si uživatelské preference a přizpůsobovat interakce dle toho. Uživatelé mohou delegovat úkoly na Molly, které pak wykonává způsobem, který odpovídá uživatelskému stylu. Asistent také nabízí proaktivní návrhy, aby uživatelé zůstali předem, a to tím, že předpovídá jejich budoucí potřeby. Molly je目前 v omezené soukromé betě a zájemci o něj se mohou přidat k čekací listině, aby mohli využívat jeho schopnosti.
Розбивка критеріїв
- Automatizace pracovních postupů
- Sledování úkolů a projektů
- Nástroje pro týmovou spolupráci
- Asistent AI zaměřený na produktivitu
- Chytré plánování a připomínání
- Integrace napříč nástroji

Deepgram
Speech-to-text a text-to-speech API pro stavbu reálně času hlasových aplikací.

Deepgram je hlasová AI platforma, která poskytuje vývojářům rozhraní API pro přepisování zvuku a generování přirozeně znějící řeči. Jeho modely jsou navrženy pro nízkou latenci a vysokou přesnost napříč širokou škálou jazyků, akcentů a zvukových podmínek, takže je vhodný pro živé titulkování, analýzu hovorů, hlasové asistenty a konverzační agenty. Kromě základní transkripce nabízí Deepgram funkce, jako je rozpoznání mluvčího, detekce sentimentu a témat, vlastní trénování modelu a podpora streamování. Platforma se zaměřuje na technické týmy, které potřebují do svých produktů integrovat hlasové funkce, aniž by musely od začátku budovat infrastrukturu pro řeč.
Розбивка критеріїв
- Real-time streaming speech-to-text
- Neuralní text-to-speech hlas
- Diarizace řečníků a časování na úrovni slov
- Šitý model fine - tuning
- Inteligence audio (sentiment, témata, shrnutí)
- REST a WebSocketu API s SDK na více jazyků
Kokoro TTS
Klíčové otevřený multilingualní text-ke-speech, který přeměňuje psaný text na přirozeně znějící vokály.

Kokoro TTS je systém převodu textu na řeč navržený pro přeměnu písemného vstupu na jasnou, přirozeně znějící řeč v různých jazycích a hlasových stylech. Cílem je zpřístupnit vysoce kvalitní syntézu hlasu vývojářům, tvůrcům obsahu a nadšencům, kteří potřebují realistní zvukový výstup pro projekty, jako jsou videa, audio knihy, nástroje pro přístupnost a hlasoví asistenti. Model se zaměřuje na produkci plynulé prozodie a rozpoznatelných charakteristik řečníka, přičemž zůstává dostatečně lehký, aby mohl běžet v různých prostředích. Uživatelé mohou generovat mluvený zvuk z textových úryvků, vybírat mezi různými hlasy a integrovat výstup do vlastních pracovních postupů nebo aplikací.
Розбивка критеріїв
- Generace text-ke-speech v mnoha jazycích
- Vybratelné profily hlasu
- Přírodní intonace a tempo
- Vystupňovatelné audiovýstupy
- Uplatnění v aplikacích, videích a narracích
- Integrace pro vývojáře




