Минула битва · 2024-09-16 UTC
Speech Recognition Протистояння — 16 вересня 2024 р.
З категорії Speech Recognition. 9 позначок поставлено серед 5 бійців. MeetingNotes здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

MeetingNotes
ШІ-засіб для зустрічей, який автоматично записує, розшифровує та підсумовує розмови.

MeetingNotes - це ШІ-засіб для зустрічей, який автоматизує документування зустрічей. Він записує, розшифровує та підсумовує розмови в реальному часі за допомогою передового розпізнавання мови на основі ШІ. Інструмент підтримує понад 25 мов і пропонує багатомовне розшифрування та переклад. Він надає точні підсуми на основі ШІ, автоматично призначає дії та здійснює відстеження. MeetingNotes також пропонує функції безпеки корпоративного рівня, включаючи шифроване хмарне сховище та повну відповідність GDPR. Інструмент розроблений для підвищення продуктивності, економії часу та збереження фокусу на прийнятті рішень. Він інтегрується з Google Meet, Outlook та Zoom, а також підтримує безперешкодне обмін та співпрацю з командами. MeetingNotes користується довірою понад 5000 команд по всьому світу та успішно розшифрував понад 3 200 000 годин аудіо, причому 95% користувачів віддають перевагу підсумам на основі ШІ перед ручними нотками.
Розподіл критеріїв
- Розшифрування в реальному часі
- Підсуми зустрічей, згенеровані ШІ
- Вилучення дій та рішень
- Нотатки та експорти, які можна ділитися
- Пошукова історія зустрічей
- Інтеграція з календарем та відеоінструментами

IBM Watson Speech to Text
Підвищена якість роз Pozнавання мови від IBM Watson для перетворення аудіо на точні тексти.

IBM Watson Speech to Text – це облачний сервіс, який здійснює транслювання мовленого мови на письмовий текст у різних мовах та діалектах. Він призначений для підприємств, які потребують надійної та масштабованої транскрипції для випадків використання, таких як аналіз центр прийому викликів, голосові асистенти, записи засідань та інструменти доступності. Служба підтримує реалізтайм-стримінг та обробку за пакетами аудіо-даних, а також пропонує можливості індивідуалізації для підвищення точності в обробці галузевих термінів, скорочень та акцентів. Вона може бути розгорнута за допомогою IBM Cloud чи на основі локального сервера через IBM Cloud Pak для даних, що надає організаційам можливість вибору місця розташування даних та відповідності вимогам.
Розподіл критеріїв
- Транскрифікація у реальному часі
- Переробляє в пакетах файли аудіо
- Творення індивідуальної лексичної бази та тренування моделі
- Розрізняє співвикладацький рух та вказує окремі слова
- Підтримка декількох мов та діалектів
- Присутність у хмарі чи наявність на місці завдяки IBM Cloud Pak for Data


OpenAI Advanced Voice - режим голосової взаємодії, інтегрований у чат-бота ChatGPT, який дозволяє користувачам спілкуватися зі штучним інтелектом у вільній, натуральній манері. Він підтримує низьковолоконне обмін, переривання та експресивні відгуки, що робить розмови трохи подібними до спілкування зі справжньою людиною, ніж видача наказів інструкціям асистенту. Цей функціонал призначений для безручного використання на мобільних та настільних пристроях, підтримуючи виконанні завдань, таких як проведення мозкових штурмів, вивчення мови, супровід вчителів, та прості розмови. Він здатний адаптувати тон, розпізнавати емоційні сигнали мовлення та відповідати багатьма голосами та мовами, усі ці можливості здійснюються за допомогою багатомодальних моделей OpenAI.
Розподіл критеріїв
- Говоріння у реальному часі
- Кілька вибраних голосів AI
- Обробка перерв і черговості розмов
- Розпізнавання емоцій та тональності
- Підтримка багатомовних розмов
- Інтегровано у застосунок ChatGPT

Amazon Transcribe
Шляхова автоматична послуга з розпізнавання мови із сервісу AWS, яка перетворює аудіо та відео на вірно і часом позначені тексти.

Amazon Transcribe - повністю керований автоматичний сервіс розпізнавання говоріння (ASR) від AWS, який перетворює мовлене аудіо на текст. Його підтримує масова транскрипція збережених відеофайлів та реалізмчасовий стрімінг транскрипції, із виходом, що включає часознімки, ярлики мовців та рівні впевненості. Сервіс розроблений для використання у випадках, наприклад, аналітики центрів обробки зв'язку, субтитрування засідань і відеозаписів, програм із розпізнаванням мови, та запису для дотримання законодавчих вимог. Спеціалізовані варіанти, такі як Transcribe Medical та Transcribe Call Analytics, надають спеціалізовану лексику та вбудовані дані з аналітикою, такі як визначення налаштування настрою та виявлення проблем. Розробники можуть інтегрувати її за допомогою SDK Amazon AWS, CLI чи інтерфейсу управління, а також поєднати її з іншими послугами Amazon AWS, таких як Amazon S3, Lambda, Comprehend, та Translate для створення повних pipeline обробки аудіо.
Розподіл критеріїв
- Масова і реальна часова стрімінг транскрипції
- Ідентифікація співрозмовців та розмежування каналів
- Власний словник та власний мовний модел
- Автоматична прописка та інтервали часу в рівні слів
- Підтримка кількох мов зі автоматичною ідентифікацією мови
- Інтеграція зі S3, Lambda та іншими послугами AWS

Scriptivox – інструмент, що працює за допомогою ШІ, для швидкої та точної транскрипції аудіо у текст. Він використовує штучний інтелект для перетворення усованих слів у писемний формат, що дозволяє заощадити час і зусилля, порівняно з ручною транскрипцією. Інструмент підходить для різних користувачів: подкастерів, інтерв'юерів, творців контенту. AI‑двигун Scriptivox забезпечує швидку обробку аудіофайлів, надаючи транскрипції з високим рівнем точності. Деталі щодо робочого процесу та інтеграцій обмежені, але, ймовірно, підтримуються загальні аудіоформати та можливості редагування і вдосконалення транскрипцій. Порівняно з ручною транскрипцією або іншими автоматизованими інструментами Scriptivox обіцяє баланс швидкості й точності, хоча його продуктивність щодо альтернатив може змінюватися в залежності від якості та складності аудіо.
Розподіл критеріїв
- Машинний рушій розпізнавання мови у текст на основі ШІ
- Підтримка загальних аудіоформатів
- Швидка обробка записів
- Редаговані текстові вихідні дані
- Підходить для тривалих та коротких аудіо




