Minulá bitva · 2024-09-16 UTC
Speech Recognition Souboj — 16. září 2024
Z kategorie Speech Recognition. 9 hlasů umístěno napříč 5 bojovníky. MeetingNotes získal korunu.
Konečné pořadí
Sestava
Bojovníci
Profily každého nástroje, který soutěžil v této bitvě, seřazené podle jejich konečného skóre.

MeetingNotes
Asistent na setkání s umělou inteligencí, který automaticky zaznamenává, transkribuje a shrnuje konverzace.

MeetingNotes je AI-ová asistenta pro setkání, která automatizuje dokumentaci zasedání. Záznamy v reálném čase a detailní popisy jsou dosaženy díky pokročilým technikám rozpoznávání řeči s umělou inteligencí. Asistent podporuje 25+ jazyků a nabízí plurilinké transcription a překlad. Nabízí přesné shrnutí, automaticky přiřazuje úlohy k vykonání a udržuje jejich sledování. MeetingNotes se odlišuje i díky bezpečnostním funkcím pro podniky, včetně šifrovaného úložiště v cloudu a plné shodnosti GDPR. Je navržen tak, aby zvýšil produktivitu, ušetřil čas a pomohl se soustředěním na rozhodování. Integrací s Google Meet, Outlook, a Zoom a podporou hladkých sdílení a spolupráce s týmy. MeetingNotes je spolehlivou volbou pro 5 000+ týmů po celém světě a úspěšně transkribuje miliony hodin zvuku – 95 % uživatelů upřednostňuje AI-zpracované shrnutí před ručními poznámkami.
Розбивка критеріїв
- Reálné transkripce
- Generování shrnutí umělou inteligencí
- Výběr úloh a rozhodnutí
- Sdílitelné poznámky a export
- Searchbare historie setkání
- Integrace s kalendářem a nástroji pro videohovory

IBM Watson Speech to Text
Zajišťování správného rozpoznání řeči s vysokou kvalitou od IBM Watson.

IBM Watson Speech to Text je cloudová služba, která přepisuje mluvený jazyk do písemného textu ve více jazycích a dialektech. Je navržena pro podniky, které potřebují spolehlivé a škálovatelné přepisy pro použití, jako je analýza call center, hlasoví asistenti, poznámky ze schůzí a nástroje pro přístupnost. Služba podporuje zpracování zvuku v reálném čase a dávkové zpracování zvukových souborů a nabízí možnosti přizpůsobení pro zlepšení přesnosti specifického průmyslového slovníku, zkratek a akcentů. Lze ji nasadit prostřednictvím IBM Cloud nebo lokálně pomocí IBM Cloud Pak for Data, což poskytuje organizacím flexibilitu kolem rezidence dat a souladu s předpisy.
Розбивка критеріїв
- Transkripcí v režimu on-line v reálném čase
- Zpracování souborů zvuku v balíčku
- Vlastní slovník a modelování tréninku
- Rozlišování řečníků a časování slov
- Podpora několika jazyků a dialektů
- Nesdílené nasazení nebo nasazení ve cloudu


OpenAI Advanced Voice je režim hlasové interakce zabudovaný do ChatGPT, který umožňuje uživatelům komunikovat s AI přirozeným a plynulým způsobem. Podporuje nízkou latenci výměn, přerušení a expresivní odpovědi, díky čemuž konverzace působí dojmem, že mluvíte s člověkem, spíše než že byste dávali pokyny asistentovi. Tato funkce je navržena pro použití bez použití rukou na mobilních a desktopových zařízeních a podporuje úkoly, jako je brainstorming, jazyková praxe, doučování a neformální rozhovor. Může přizpůsobit tón, rozpoznávat emoce ve řeči a reagovat v různých hlasových a jazykových variantách, to vše je poháněno základními multimodálními modely OpenAI.
Розбивка критеріїв
- Reálné mluvené dialogy
- Vyhodnocení a výběr víc různých hlasů AI
- Rychle reakce na přerušení i převzetí řečiště
- Emocionální i tónová vnímavost
- Podpora konverzací v různých jazycích
- Integrované do aplikace ChatGPT

Amazon Transcribe
Plně spravovaný služba automatické rozpoznávání mluveného slova od AWS, která konvertuje audio a video na přesné, odkazované texty.

Amazon Transcribe je plně spravovaná služba automatického rozpoznávání řeči (ASR) od AWS, která převádí mluvený zvuk na písemný text. Podporuje dávkové přepisy uložených mediálních souborů a přepisy v reálném čase, výstup zahrnuje časové razítka, označení řečníků a skóre spolehlivosti. Služba je navržena pro případy použití, jako je analýza call center, titulkování schůzí a médií, aplikace s hlasovým ovládáním a záznam pro potřeby compliance. Specializované varianty, jako je Transcribe Medical a Transcribe Call Analytics, přidávají doménově laděnou slovní zásobu a vestavěné funkce, jako je detekce sentimentu a problémů. Vývojáři jej mohou integrovat pomocí AWS SDK, rozhraní CLI nebo konzole a kombinovat s dalšími službami AWS, jako jsou S3, Lambda, Comprehend a Translate, aby vytvořili end-to-end zvukové zpracovatelské pipelines.
Розбивка критеріїв
- Hromadná a reálná transkripce přenosu
- Identifikace mluvčí a oddělení kanálu
- Specifické slovníky a jazykové modely
- Automatické zapsání bodových znaků a časů na úrovni slov
- Podpora více jazyků s automatickou identifikací jazyka
- Integrace s S3, Lambda a jinými službami od AWS

Scriptivox je nástroj s umělou inteligencí pro rychlou a přesnou přepis mluveného slova do psaného textu.利用uje umělou inteligenci ke konverzi mluvených slov do psaného textu, jehož cílem je ušetřit čas a úsilí při ruční přepis. Tento nástroj je vhodný pro verschiedene uživatele, včetně podcastů, rozhovorů a tvůrců obsahu. AI engine Scriptivox umožňuje rychlou zpracování audio souborů, poskytující přepisy s vysokým stupněm přesnosti. Přesné podrobnosti o jeho pracovním postupu a integracích jsou omezené, ale Scriptivox pravděpodobně podporuje běžné formáty audio souborů a může nabízet funkce pro upravování a dokončování přepisů. Ve srovnání s ručním přepisem nebo jinými automatizovanými nástroji Scriptivox slibuje rovnováhu mezi rychlostí a přesností, i když jeho výkon ve srovnání s alternativami se může lišit v závislosti na kvalitě a složitosti audio souboru.
Розбивка критеріїв
- Vědomý rozpoznávací strojový jazyk
- Podpora běžných formátů zvuku
- Rychlé zpracování nahrávek
- Textový výstup upravovatelný
- Doporučováno pro dlouhé a krátké nahrávky zvuku




