Pretekla bitka · 2024-09-16 UTC
Speech Recognition Obračun — 16. september 2024
Iz kategorije Speech Recognition. 9 oznake postavljenih med 5 borci. MeetingNotes je osvojil krono.
Končna razvrstitev
Postava
Borci
Profili vsakega orodja, ki je tekmovalo v tej bitki, razvrščeni po končnem rezultatu.

MeetingNotes
AI asistent za sestanke, ki samodejno zajame, prepiše in povzame pogovore.

MeetingNotes je AI asistent za sestanke, ki avtomatizira dokumentacijo sestankov. Zajema, transkribira in povzame pogovore v realnem času z naprednim AI‑podprtim prepoznavanjem govora. Orodje podpira več kot 25 jezikov in ponuja večjezično transkripcijo ter prevajanje. Zagotavlja natančne AI povzetke, samodejno dodeljuje akcijske točke in omogoča sledenje. MeetingNotes ponuja tudi varnostne funkcije na nivoju podjetij, vključno s šifriranim shranjevanjem v oblaku in popolno skladnostjo z GDPR. Orodje je zasnovano za povečanje produktivnosti, prihranek časa in osredotočenost na sprejemanje odločitev. Integrira se z Google Meet, Outlook in Zoom ter omogoča brezhibno deljenje in sodelovanje v ekipah. MeetingNotes uporablja več kot 5.000+ ekip po vsem svetu in je uspešno transkribiralo več kot 3.200.000+ ur zvoka, pri čemer 95 % uporabnikov preferira AI povzetke namesto ročnih zapiskov.
Razdelitev kriterijev
- Transkripcija v realnem času
- Samodejno ustvarjeni povzetki sestankov
- Izločanje nalog in odločitev
- Deljivi zapiski in izvozi
- Iskane zgodovine sestankov
- Integracija s koledarjem in video orodji

IBM Watson Speech to Text
Napredno prepoznavanje govora na ravni podjetja iz IBM Watson za pretvorbo zvoka v natančen tekst.

IBM Watson Speech to Text je oblačna storitev, ki prepisuje govorjen jezik v pisni tekst v več jezikov in dialektov. Je zasnovan za podjetja, ki potrebujejo zanesljivo, razširljivo prepisovanje za primere uporabe, kot so analiza call centr, glasovni asistenti, zapiski sestankov in orodja za dostopnost. Storitev podpira pretočno snemanje v realnem času ter obdelavo skupinskih zvočnih datotek in ponuja možnosti prilagajanja za izboljšanje natančnosti pri industrijsko specifičnem besedilu, okrajšavah in akcentih. Lahko se implementira prek IBM Cloud ali na lokaciji preko IBM Cloud Pak for Data, kar organizacijam omogoča fleksibilnost glede prebivanja podatkov in skladnosti.
Razdelitev kriterijev
- Transkripcija v realnem času z pretakanjem
- Obdelava skupinskih zvočnih datotek
- Prilagojeni vokabular in treniranje modela
- Razvrščanje govorcev in časovni žigovi besed
- Podpora za več jezikov in narečij
- Implementacija v oblaku ali na lokalnem strežniku


OpenAI Advanced Voice je način glasovne interakcije, vgrajen v ChatGPT, ki uporabnikom omogoča, da govorijo z AI na naraven, tekoč način. Podpira izmenjave z low‑latency, prekinjanja in izrazite odzive, kar pogovore naredi bolj podobne pogovoru z osebo kot pošiljanju ukazov asistentu. Funkcija je zasnovana za uporabo brez rok na mobilnih in namiznih napravah ter podpira naloge, kot so ustvarjanje idej, jezikovna praksa, poučevanje in neformalni klepet. Lahko prilagodi ton, prepozna čustvene signale v govoru in odgovarja v več glasih ter jezikih, vse pa poganja osnovni multimodalni modeli OpenAI.
Razdelitev kriterijev
- Govorni dialog v realnem času
- Več izbirnih AI glasov
- Upravljanje prekinitev in izmenjave besed
- Zaznavanje čustev in tona
- Podpora večjezičnim pogovorom
- Integrirano v aplikaciji ChatGPT

Amazon Transcribe
AWS storitev samodejnega prepoznavanja govora, ki pretvori avdio in video v natančen, časovno označen tekst.

Amazon Transcribe je popolnoma upravljana storitev samodejnega prepoznavanja govora (ASR) iz AWS, ki iz govornega zvoka pretvori v pisni tekst. Podpira skupinsko transkripcijo shranjenih medijskih datotek in transkripcijo v realnem času, pri čemer izhod vsebuje časovne žige, oznake govornikov in ocene zaupanja. Storitev je zasnovana za primeri uporabe, kot so analiza klicnih centrov, podnapisi sestankov in medijev, aplikacije z aktivacijo z glasom ter beleženje v skladu z zakonskimi zahtevami. Posebne različice, kot sta Transcribe Medical in Transcribe Call Analytics, dodajata domeno prilagojeno besedišče in vgrajene vpoglede, kot so zaznavanje sentimenta in odkrivanje težav. Razvijalci ga lahko vgradijo prek AWS SDK-jev, CLI ali konzole ter ga združijo z drugimi storitvami AWS, kot so S3, Lambda, Comprehend in Translate, da zgradijo celovit tok obdelave zvoka od začetka do konca.
Razdelitev kriterijev
- Transkripcija v skupnih in realnem času
- Identifikacija govornikov in ločevanje kanalov
- Prilagojeno besedniko in modele jezika
- Samodejno interpunkcija in časovne oznake na ravni besede
- Podpora za večjezičnost z avtomatsko prepoznavo jezika
- Integracija z S3, Lambda in drugimi AWS storitvami

Scriptivox je orodje z umetno inteligenco, namenjeno hitri in natančni transkripciji audio-vsebin v besedilo. Uporablja umetno inteligenco za pretvorbo govora v pisano besedilo, s ciljem prihraniti čas in trud pri ročni transkripciji. Orodje je primerno za različne uporabnike, vključno s podcasterji, intervjuvalci in ustvarjalci vsebin. AI motor Scriptivoxa omogoča hitro obdelavo audio datotek ter nudi transkripcije z visoko stopnjo natančnosti. Čeprav so podrobnosti o delovnem toku in integracijah omejene, Scriptivox verjetno podpira običajne formate audio datotek in lahko ponuja funkcije za urejanje in izboljševanje transkriptov. V primerjavi z ročno transkripcijo ali drugimi avtomatiziranimi orodji, Scriptivox obljublja ravnotežje med hitrostjo in natančnostjo, čeprav se lahko njegova zmogljivost glede na alternative razlikuje glede na kakovost in zapletenost zvoka.
Razdelitev kriterijev
- AI poganjeni pogonski sistem za prepis govora v besedilo
- Podpora za pogoste zvokne formate
- Hiter obdelovalni čas posnetkov
- Izdelava urejenega besedila
- Primerno za dolge in kratke zvokne posnetke




