Miniona bitwa · 2024-09-16 UTC
Speech Recognition Pojedynek — 16 września 2024
Z kategorii Speech Recognition. 9 ocen oddanych na 5 zawodników. MeetingNotes zdobył koronę.
Klasyfikacja końcowa
Zestawienie
Zawodnicy
Profile każdego narzędzia, które rywalizowało w tej bitwie, uszeregowane według ich wyniku końcowego.

MeetingNotes
Asystent spotkań AI, który automatycznie rejestruje, transkrybuje i streszcza rozmowy.

MeetingNotes to asystent spotkań AI, który automatyzuje dokumentację spotkań. Rejestruje, transkrybuje i streszcza rozmowy w czasie rzeczywistym przy użyciu zaawansowanego rozpoznawania mowy opartego na AI. Narzędzie obsługuje ponad 25 języków i oferuje wielojęzyczną transkrypcję i tłumaczenie. Zapewnia precyzyjne streszczenia AI, automatycznie przypisuje zadania i prowadzi śledzenie. MeetingNotes oferuje również funkcje bezpieczeństwa na poziomie przedsiębiorstwa, w tym zaszyfrowane przechowywanie w chmurze i pełną zgodność z RODO. Narzędzie zostało zaprojektowane tak, aby zwiększyć produktywność, zaoszczędzić czas i utrzymać fokus na podejmowaniu decyzji. Integruje się z Google Meet, Outlook i Zoom, i obsługuje bezproblemowe udostępnianie i współpracę z zespołami. MeetingNotes jest zaufany przez ponad 5000 zespołów na całym świecie i skutecznie transkrybował ponad 3 200 000 godzin audio, przy czym 95% użytkowników preferuje streszczenia AI zamiast ręcznych notatek.
Podział kryteriów
- Transkrypcja w czasie rzeczywistym
- Streszczenia spotkań wygenerowane przez AI
- Ekstrakcja zadań i decyzji
- Udostępnialne notatki i eksport
- Przeszukiwalny historia spotkań
- Integracja z kalendarzem i narzędziami wideo

IBM Watson Speech to Text
Rozpoznawanie mowy na poziomie przedsiębiorstwa od IBM Watson do zamiany dźwięku na dokładny tekst.

IBM Watson Speech to Text to jest usługą opartą w chmurze, która transkrybuje język mówiony do tekstu pisemnego dla wielu języków i dialektów. Jest zaprojektowana dla przedsiębiorstw, które potrzebują niezawodnych, skalowalnych transkrypcji do przypadków użycia takich jak analiza centrów obsługi klienta, asystentów głosowych, notatki ze spotkań oraz narzędzi dostępności. Usługa obsługuje realizację w czasie rzeczywistym oraz przetwarzanie w trybie zadań roboczych plików audio, oraz zapewnia opcje konfiguracyjne do poprawy dokładności dla wiedzy specjalistycznej, skrótów i akcentów branżowych. Może być wdrożona za pośrednictwem platformy IBM Cloud lub na miejscu, poprzez platformę IBM Cloud Pak for Data, co zapewnia organizacjom elastyczność jeśli chodzi o rezydencję danych i przypisanie do przestrzeni.
Podział kryteriów
- Transkrypcja strumieniowa w czasie rzeczywistym
- Przetwarzanie plików audio wsadowo
- Słownictwo niestandardowe i szkolenie modelu
- Rozróżnianie mówców i znaczniki czasowe słów
- Wsparcie dla wielu języków i dialektów
- Wdrożenie w chmurze lub lokalnie


OpenAI Advanced Voice to tryb interakcji głosowej wbudowany w ChatGPT, który pozwala użytkownikom rozmawiać z AI w naturalny, płynny sposób. Obsługuje wymiany o niskim opóźnieniu, przerwy i wyraziste odręczenia, dzięki czemu rozmowy wydają się bardziej zbliżone rozmowie z osobą niż wydawanie polecenia asystentowi. Tymczasem ten feature został zaprojektowany z myślą o ręcznym korzystaniu w mobile i na pulpicie, wspierając takie zadań jak brainstorming, praktyka językowa, nauczanie oraz swobodna rozmowa. Może dostosować ton, rozpoznawać wskazówki emocjonalne w mowie i odpowiadać wieloma głosami i językami, wszystko zasilane multimodalnymi modelami firmy OpenAI.
Podział kryteriów
- Rozmowa głosowa w czasie rzeczywistym
- Wiele wybieralnych głosów AI
- Obsługa przerywania i zmiany kolejności
- Świadomość emocjonalna i tonu
- Wsparcie rozmów wielojęzycznych
- Zintegrowany w aplikacji ChatGPT

Amazon Transcribe
Usługa automatycznego rozpoznawania mowy AWS, która konwertuje audio i wideo na dokładny, oznaczony czasowo tekst.

Amazon Transcribe to w pełni zarządzana usługa automatycznego rozpoznawania mowy (ASR) od AWS, która zamienia mówione audio w tekst pisany. Obsługuje transkrypcję wsadową plików multimedialnych oraz transkrypcję strumieniową w czasie rzeczywistym, z wynikami zawierającymi znaczniki czasu, etykiety mówców oraz wskaźniki pewności. Usługa przeznaczona jest do zastosowań takich jak analiza call center, subtitling spotkań i mediów, aplikacje z obsługą głosu oraz nagrywanie zgodności. Specjalne warianty, takie jak Transcribe Medical i Transcribe Call Analytics, dodają dostosowany słownik domenowy oraz wbudowane funkcje, takie jak analiza sentymentu i wykrywanie problemów. Programiści mogą integrować ją za pomocą AWS SDK, CLI lub konsoli oraz łączyć z innymi usługami AWS, takimi jak S3, Lambda, Comprehend i Translate, tworząc kompletne potoki przetwarzania dźwięku.
Podział kryteriów
- Transkrypcja wsadowa i strumieniowa w czasie rzeczywistym
- Identyfikacja mówców i separacja kanałów
- Dostosowywalny słownik i własne modele językowe
- Automatyczne interpunkcja i znaczniki czasu na poziomie słów
- Wsparcie wielu języków z automatyczną identyfikacją języka
- Integracja z S3, Lambda i innymi usługami AWS

Scriptivox to narzędzie zasilane AI, które oferuje szybką i dokładną transkrypcję audio na tekst. Wykorzystuje sztuczną inteligencję do konwersji wypowiedzianych słów w tekst pisany, mając na celu oszczędność czasu i wysiłku w ręcznej transkrypcji. Narzędzie jest odpowiednie dla różnych użytkowników, w tym podcasterów, przeprowadzających wywiady oraz twórców treści. Silnik AI Scriptivox umożliwia szybkie przetwarzanie plików audio, dostarczając transkrypcje o wysokim stopniu dokładności. Chociaż szczegółowe informacje o przepływie pracy i integracjach są ograniczone, Scriptivox prawdopodobnie obsługuje popularne formaty plików audio i może oferować funkcje edycji i dopracowywania transkrypcji. W porównaniu do ręcznej transkrypcji lub innych narzędzi automatycznych, Scriptivox obiecuje równowagę pomiędzy szybkością a dokładnością, chociaż jego wydajność w porównaniu do alternatyw może się różnić w zależności od jakości i złożoności audio.
Podział kryteriów
- Silnik konwersji mowy na tekst oparty na AI
- Obsługa popularnych formatów audio
- Szybkie przetwarzanie nagrań
- Edytowalny wynik tekstowy
- Przydatny dla długich i krótkich nagrań audio




