Минула битва · 2024-11-03 UTC
Speech Recognition Протистояння — 3 листопада 2024 р.
З категорії Speech Recognition. 27 позначок поставлено серед 6 бійців. WithAudio здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

WithAudio
Текстовий читач із синтезом голосу за один раз – для Mac і Windows з природними голосами AI

WithAudio – настільна програма для синтезу мови на Mac та Windows, яка перетворює написаний контент у аудіо. Користувачі можуть вставляти текст, завантажувати документи або імпортувати статті, і програма прочитає їх за допомогою природних голосів AI. Це корисно для перевірки, забезпечення доступності та читання без рук. На відміну від більшості інструментів TTS, які базуються на місячних підписках, WithAudio пропонує купівлю один раз, що приваблює читачів і письменників, які цінують передбачувані витрати. Додаток орієнтований на простий досвід прослуховування: контроль відтворення, можливість експорту аудіо для подальшого використання і без зайвих функцій аудіопродукції.
Розподіл критеріїв
- Конвертація тексту у голос із використанням голосів AI
- Крос-платформена підтримка macOS та Windows
- Експорт аудіо для офлайн прослуховування
- Вхід даних з документів та тексту
- Налаштовувані контролі відтворення
- Один раз активувати ліцензію

CallFluent
Платформа аналітики телефонних розмов, що використовує мистецтво штучного інтелекту для транскрибування, аналізу та автоматизації бізнес-проведень телефонних розмов.

CallFluent — це платформа аналітичних зв'язків, керованої ІА, призначена для допомоги підприємствам максимізувати результати їхніх телефонних взаємодій. Вона поєднує мовну розпізнавання на початку, інтелект розмови та автоматизацію процесів для виділення нових даних із комерційних переговорів, питань клієнтів тощо. Платформа analyzeає тон, наміри та важливі теми під час дзвінків, забезпечуючи командам visibility у клієнтській ставіні, роботі агентів та частотних об'єкцитах. Менеджери можуть оглянути тренди під час великої кількості діалогів, не слухаючи кожен запис окремо. За допомогою функцій автоматизації, такими як короткі підсумки зворотних викликів, реєстрація в CRM та тригери слідування, CallFluent спрямоване на скорочення повторюваних робіт після виклику та допомогу командам діяти швидше на ту чи іншу інформацію, яку клієнти фактично кажуть.
Розподіл критеріїв
- Транскрибація мови за допомогою мистецтва штучного інтелекту
- Аналіз настрою та намірів
- Автоматичні підсумки телефонних розмов
- Інтерфейс інструментів розмови
- Інтеграція з CRM та потоком робочої програми
- Тригери роботи після телефонної розмови

Inworld AI
Створіть інтерактивні АІ-драйвені персонажів для ігор та міметичних віртуальних досвідів

Inworld AI - це двигун створення персонажів, розроблений для розробників ігор, віртуальних світів та інтерактивного медіа. Це дозволяє творцям створювати НПС та цифрових персоналіїв з особливими особистостями, пам'яттю, голосом та мотивами, потім збудувати їхній життєвий шлях шляхом реальних часу розмов і контекстуальної поведінки. Платформа поєднує мовні моделі із цілевимілюваннями, базами знань та станими емоціями, щоб ігрові персонажі могли реагувати динамічно на гравців, а не дотримуватися попередньо написаних рядків. Інтегрування зі встановами, як Unreal та Unity, а також ліцензійні засоби програмування (SDKs) та програмні інтерфейси (APIs) дозволяють розгортати персонажів над багатьма проєктами ігор, чат-оглядами, навчальними симуляціями та аплікаціями для розваг.
Розподіл критеріїв
- Персоналізація АІ-персонажів
- Медленка пам'ять та бази знань
- Синтез голосу та емоційна виявлення
- СХД для Unity та Unreal Engine
- Мета, активатори та контролювання поведінки
- Багатогравецька та багата персонажистичеська взаємодія

Molly Personal Assistant
AI-ассистент для автоматизації робочих процесів та оптимізації командної співпраці

Molly - це AI-особистий помічник, розроблений для автоматизації робочих процесів та спрощення командної співпраці. Він прагне забезпечити глибоко персоналізований досвід завдяки функції 'нескінченної пам'яті', яка дозволяє йому запам'ятовувати переваги користувача та адаптувати свої взаємодії відповідно. Користувачі можуть делегувати завдання Molly, яке він виконує відповідно до стилю користувача. Помічник також пропонує проактивні пропозиції, щоб користувачі були попереду, передбачаючи їхні майбутні потреби. Наразі Molly знаходиться у обмеженому приватному бета-тестуванні, і зацікавлені користувачі можуть приєднатися до списку очікування, щоб відчути його можливості
Розподіл критеріїв
- Автоматизація робочих процесів
- Відстеження завдань і проектів
- Інструменти командної співпраці
- AI-ассистент, орієнтований на продуктивність
- Розумне планування та нагадування
- Інтеграції з іншими інструментами

Deepgram
API для обробки мови та перетворення тексту на мову для створення реального часу голосових застосунків.

Deepgram - платформа AI для роботи зі голосом, яка надає розробникам API для транскрибування аудіо та генерацію природного звучання мови. Її моделі розроблені для роботи зі малою затримкою і високою точністю виконання на широкому спектрі мов, акцентів та умов аудіо, тому вона підходить для реального часу капіталізації, аналіз викликів, голосових асистентів та агентів діалогу. Поза коровою трансляцією, Deepgram пропонує функції, такі як діаризація мовця, виявлення настрою та питань, навчання індивідуальних моделей та підтримку потокової передачі. Платформа спрямована на інженерні команди, яким потрібні можливості для інтеграції гучного вмісту в інструменти без створення інфраструктури розмов від початку.
Розподіл критеріїв
- Реальна часова робота зі згустенням мови
- Нейронні голоси мови для перетворення текства
- Визначення розмітки особи та часових діалогу слова
- Пристрій спеціальної моделі налаштування
- Пов'язані інтелектові аудио (відповідність відстрільної, теми, підсумовування)
- РЕСТ та API WebSockets із багатомовними наборами розширень розробників
Kokoro TTS
Відкритий-кодна багатомовна системи перетворення тексту у голос який перетворює написаний текст у природно-озвучені голоси.

Kokoro TTS - це текстово-мовна система, яка забезпечує перетворення набірних даних на ясну, природно-озвучену мову на різній масі мов і стилю голосу. Її метою є зробити високоякісну синтез мовлення доступною розробникам, вмістовим творцям і діловодам, які потребують реалістичного аудіовихідного сигналу для проєктів такі як відео, аудіокниги, інструменти для доступності та голосові виконавці. Модель зосереджується на виданні плавної ритміки та розпізнаванні індивідуальних рис мови тоді як залишається порівняно легкою для виконання у різноманітних середовищах використання. У користувачів є змога створювати сприйнятний на слух акустичний звук з твітів, вибір різних голосних і інтегрування виходу у власні поточно-орієнтовані роботи або програми.
Розподіл критеріїв
- Мовну перетворення мови тексту
- Повідомлення різних голосових профілів
- Натуралістне вимовляння й темп
- Виносний аудіо-вихід
- Підходить для застосунків відео й оповіщення
- Впровадження для розробників-підтримується




