Минала битка · 2024-11-03 UTC
Speech Recognition Двубой — 3 ноември 2024 г.
От категория Speech Recognition. 27 гласове поставени сред 6 бойци. WithAudio грабна короната.
Финално класиране
Съставът
Бойците
Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

WithAudio
Еднократна закупка с текст-на-звук чете на Mac и Windows със събрана от AI гласове.

WithAudio е достъпно на прозорците текст-до-глас текстово приложение за Mac и Windows, което преобразува писмен контент в изговаряне аудио. потребителите могат да въртят текста, да зареждат документи или да зареждат статиите и да ги четат гласовете на съществуващия избор на AI-създал гласове, което го прави полезно за проверка на текста, достъпност и ръчно четене. Напротив от най-често ТСЗТ инструменти, които се надяват на месечни абонаменти, WithAudio се предлага като еднократна куповка, която привлича читатели и писатели, които искат предвидими разходи. Апликацията се състои от чифтливо изслушване вместо сложна аудио производство, с контролни бутони за пуск и възможността да се изпълзва генерирана аудио за по-късно използване.
Разбивка на критериите
- Преобразуване от текст на говор с използване на AI гласове
- Крос платформена поддръжка за macOS и Windows
- Извеждане на аудио за неинтернетно проследяване
- Възможности за документи и въведени текстове
- Променихащи се контроли за проиграване
- Еднократна активация на лиценз

CallFluent
Платформа за анализ на телефонните съобщения, която транскрибира, анализира и автоматизира бизнес телефонни разговори със злеяваща аи.

CallFluent е платформа за анализ на разговори, държана от AI, задължена да помогне на предприятията да извлекат по-голямо стойност от тяхните телефонни взаимодействия. Тя обединява трансляция на говоримата реч, разумност на разговорите и автоматизация на потоци за работа с цел да изкарат инсайти от продажбени разговори, поддръжка, запитвания и др. на клиенти. Платформата анализира тон, намерение и основни теми през съботките, давайки тимовете прозорец в клиентското състояние, изпълнение на агентите и често срещани опозиции. Ръководителите могат да извършват ревизия на трендите през висока обем на разговори без да използват ръчно слушане на всяка запис. С помощта на автоматизирани функции като резюме на телефонните разговори, регистриране в CRM и тригери за последващи чакащи задачи, CallFluent целтата му е да намали повторителната дейност след телефонният разговор и да поспре отборите да отговорят бързо на всичко, което клиентите също говорят.
Разбивка на критериите
- Транскрипция от глас на текст
- Анализ на нюх и намерение
- Автоматични резюмета на телефонните съобщения
- Информативен десктоп за разговори
- Интеграции с климати и процесни системи
- Авторежими на действия след завършване на телефонното съобщение

Inworld AI
Създаване на интерактивни, AI-подвижли персонажи за игри и обхващащи виртуални изживявания.

Inworld AI е мотоно-моторен двигател, проектиран за развитието на разработчиците на игри, виртуални света и интерактивни медии. Той дава възможност създателите да проектират НПК и цифрови личности с различни особености, спомени, гласове и мотиви, а след това да ги приравнять на живот чрез реално-временни разговори и контекстуално поведение. Платформата комбинира езиционни модели с целеви, информационни бази и емоционални състояния, така че персонажите могат да отговарят динамично на играчите, вместо да следват написани диалози. Интегрите със системи като Unreal и Unity, плюс SDK-ове и API-те, се оказват способни да деплоитират персонажите през различни игра, чат и тренировъчен проекти, както и развлекателни приложения.
Разбивка на критериите
- Повече personalisedности на AI персонажи.
- Dълготрайна памет и бази на знания.
- Гласов синтез и емоционално изразяване.
- SDK за Unity и Unreal Engine.
- Контроли на цели, тригъри и поведение.
- Мултиплейър и мулти-персонажни интеракции.

Molly Personal Assistant
Асистент AI за автоматизиране на процеси и улесняване на сътрудничество в екипа.

Моли е интелектуална асистентка, предназначена да автоматизира потоци на работа и направи колаборацията в екипа по-лесна. Тя се стреми да предоставя изключително личен опит чрез своето възможно вечно запомнящо се функция, която позволява на асистентката да запомни предпочитанията на потребителите и да прилага взаимодействията според тях. Потребителите могат да упълномощават Моли да изпълнява задължения, които тя изпълнява на мъртви на някакъв начин, съгласуван с личния стил на потребителя. Асистентката също така предлага интерактивни съвети, които да държат потребителя пред очите с помощта на предвидяване на бъдещите му нужды. Моли моментално се намира в ограничена частна бета възможност и заинтересованите потребители могат да се включат в чакалата листа, за да изпробват възможностите ѝ.
Разбивка на критериите
- Sъздаване на потоци за работа
- Наложение и следене на задачи
- Инструменти за сътрудничество в екипа
- Асистент AI за продуктивност
- Интелектна планиране и напомняне
- Целеви интеграции между инструменти

Deepgram
API за преобразуване от говорещо към писмо и обратно и текст към говорещо за изграждане на реално-часови програми за работа със слогови.

Deepgram е платформа за интелектуално изобретение на глас, която предоставя програмистите с API за транскрибиране на аудио и генерация на естествена говореща реч. Нейните модели са проектирани за ниско-latentност, висока точност в изпълнение в широк спектър от езици, акценти и аудио условия, което го прави подходящ за жив превод, анализа на обаждания, гласови сътрудници и разговорни агенти. Върху основните транскрипции, „Deepgram“ предлага функции като диариране на говорещите лица, детекция на тон и теми, обучение на персонализирани модели, както и піддържане на потоци. Платформата ми се насочва към екипите по програмиране, които нуждаят се да вградят способностите за глас в продукти без да изграждат инфраструктурата за говор от скрап.
Разбивка на критериите
- Реално-часовите потоци за преобразуване на говорещо в писмо
- Нейронни гласове за текст и говор
- Диаризация на гласа и времеви маркер за букви
- Фитинг на цифров модел за произволни области
- Аудио интелектуалност (чувства, теми, сумариране)
- REST и веб-сокетни API с множество езикови SDK
Kokoro TTS
Обществена многоезична текстово-говореща система, превръщайки писан текст в естествен звук на глас.

Кокоро ТТС е система за преобразуване на текст в реч през различни езици и стилове на глас. Нейната цел е да направи достъпна висока качество на гласовата синтезиране за разработчици, създатели на съдържание и любители, които необходими за реалистичен звук изход съвместно със своите проекти като видеото, аудиокниги, инструменти за достъпност и гласовите асистенти в SaaS алатки с LLM и по-точния SDK, както и през различните API грешки в TTS. Моделът се състои в производството на добре проникна ритмика и признателни черти на говорещия, докато остава лека enough да бъде изпълнена на различни ambient, среда. Узрите могат да създават звучащо audio от текстови фрагменти, избиране между различни гласове, и интегриране на възратка на изделието при тяхна SАМ workflow или SАМ SСАПS, application.
Разбивка на критериите
- Многоезична генерация на текстово-говореща система
- Няколко избирими гласови профила
- Естествена интонация и ритъм
- Използваеми изходни данни за аудио
- СUITABLE за приложения, видеа и дикторство
- Разработчиково дружелюбно интеграция




