Korábbi csata · 2024-11-03 UTC
Speech Recognition Leszámolás — 2024. november 3.
A(z) Speech Recognition kategóriából. 27 jelölés elhelyezve 6 versenyző között. WithAudio szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

WithAudio
Egyszeri vásárlással használható szöveg-felolvasó Mac és Windows rendszerekre természetes AI hangokkal.

A WithAudio egy asztali szöveg-hangfal-lejátszó alkalmazás a Mac- és Windows-re, amely írott tartalmakat beszédes hangfalba alakítja. Felhasználók beilleszthetik a szöveget, betölthetik a dokumentumokat, vagy importálhatják a cikkeket, és szoftvergenerált hangok segítségével elmondják őket, ezzel hasznosnak bizonyulnak a kijavításhoz, az elfogadhatósághoz, illetve hangnélküli olvasáshoz kínálva. Míg a legtöbb beszédfelismerési eszköz havi előfizetéshez kötődik, a WithAudio egy alkalommal megvásárolható termék, ami megnyeri azokat a könyveket olvasókat és írókat, akiknek fontos a kiadható költségvetés. A felhasználóbarát felismerésről a felhasználóbarát hallgatásra összpontosít, egyszerű hallgatói vezérlőkkel és az általuk generált hang elmentésével későbbi használatra.
Kritériumok szétosztása
- Szöveg-felolvasás AI hangokkal
- Keresztplatformos támogatás macOS és Windows rendszerekhez
- Hang export offline hallgatáshoz
- Dokumentum és szöveg beviteli lehetőségek
- Állítható lejátszásvezérlők
- Egyszeri licenc aktiválás

CallFluent
Az AI hívásanalitikai platform, ami lefordítja, elemzéséhez és automatizálja az üzleti vonalas beszélgetéseket.

A CallFluent egy mesterséges intelligencia-vezérelt híváselemzési platform, amely arra lett kifejlesztve, hogy segítse a vállalkozásokat abban, hogy több értéket nyerjenek a telefonbeszélgetéseikből. Ötvözi a beszéd-szöveg átiratot, a beszélgetési intelligenciát és a munkafolyamat-automatizálást annak érdekében, hogy információkat szolgáltasson az értékesítési hívásokról, a támogatási jegyekről és az ügyfélekérdezőkről. A platform elemzi a hangulatot, a szándékot és a kulcstémákat a hívásokon keresztül, lehetővé téve a csapatok számára, hogy betekintést nyerjenek az ügyfélhangulatba, az ügynök teljesítményébe és a gyakori kifogásokba. A vezetők áttekinthetik a trendeket nagy mennyiségű beszélgetés felett anélkül, hogy manuálisan végighallgatnának minden felvételt. Az olyan automatizálási funkciókkal, mint a hívásösszegzés, CRM-naplózás és követési trigger, a CallFluent célja a repetitív hívás utáni munka csökkentése és a csapatok segítése abban, hogy gyorsabban reagáljanak arra, amit a ügyfelek valóban mondanak.
Kritériumok szétosztása
- AI beszédből szövegfordítás
- Hangulat- és szándék elemzés
- Automatikusan lekelt hívásösszefoglalások
- Beszélgetés elemzési kezelőpultra
- CRM és folyamatintegrációi
- Post-hívás automatikusan lépéseken

Inworld AI
Építsék ki az interaktív AI-vezérelt karaktereket játékok és környezetek által

Az Inworld AI egy karakter motor, amely a játékfejlesztők számára készült, akik virtuális világokat, interaktív média-tartalmat építenek. A tervezők megtervezhetnek érdekes szereplőkül személyiségű NPC-ket és digitális személyiségeket, érzelemgazdagsággal meg nem határozott számú emlékeket, hanglejtést és motivációt, majd éles idejű konverrációval és kontextuális viselkedéssel juttathatják őket az életbe. A platform párhuzamosan rendelkezik nyelvi modelljeivel, céljaink, ismeretbázisaival és érzelmi állapotokkal, hogy karakterek dinamikusan reagáljanak a játékosokra, ahelyett, hogy skriptolt sorokat követnének. Integrációk olyan motorokhoz, mint az Unreal és a Unity, valamint SDK-k és API-k a karakterek kibontakoztatását teszik lehetővé a játékos projektekben, a chat-érahrungenkben, a trainingszimmulációkban, és a szórakoztató alkalmazásokban.
Kritériumok szétosztása
- Személyre szabható AI-karakter személyiségek
- Rövid és hosszú távú emlékezet és tudásbázisok
- Hangszintézis és emocionális kifejezés
- Unity és Unreal Engine SDK-k
- Cél, indulatok és viselkedés kontrollerek
- Hálózati és több karakter szereplő interakciók

Molly Personal Assistant
Másodosztályú munkafolyamatok automatizálásáért és csapatmunkaközi együttműködés kordában tartásáért felelős AI segítő.

A Molly egy személyi AI-asszisztens, melyet a munkafolyamatok automatizálására és a csapatmunkaközi együttműködés kordában tartására terveztek. Szellemi tárhelye révén mélyen igazított és személyre szabott élményt tesz lehetővé, mely a felhasználó preferenciáinak megjegyzését engedi, és így a közösségbe tartozó ügyfelekkel a személyes hangolást tartja fent. Az egyes felhasználók képesek feladatokat delegálni a Molly-nek. Ezzel az AI-asszisztens végrehajtja a felhasználóhoz alkalmazkodik. A segédje a készülék automatikus javaslatokkal segít személlyé tenni felhasználóit. Előrehaladni próféciaként az elé rendelt felhasználó felhasználói igényéhez próféta készséget mutat fel. A Molly jelenleg privát alapon korlátozott béta verzióban van. Egy érdeklődő felhasználó azokat, akik részt fogjanak venni a rendelkezésére álló kapacitások használatához lehet regisztrálni.
Kritériumok szétosztása
- Munkafolyamatok automatizálása
- Feladat és projekt nyomon követés
- Csapatmunkaközi együttműködési eszközök
- Produktivitásszabályozási AI-asszisztens
- Smart ütemterv és emlékeztető
- Keresztezési tool integrációk

Deepgram
Beszéd-ről szövegre és szövegről beszédre API-k valós idejű hangalkalmazások építéséhez.

A Deepgram egy hangalapú AI platform, amely fejlesztőknek API-kat biztosít hangátírásra és természetesnek hangzó beszéd generálására. Modellei alacsony késleltetésű, nagy pontosságú teljesítményre lettek kialakítva széles nyelvi, akcentus- és hangkörnyezeti skálán, ami miatt alkalmas az élő feliratozásra, híváselemzésre, hangasszisztensekre és beszélgető ügynökökre. A magisztrális átíráson túl a Deepgram olyan funkciókat kínál, mint a beszélői diarizálás, a hangulat- és témafelismerés, egyéni modell betanítása és streamelési támogatás. A platform azokat a fejlesztői csapatokat célozza meg, amelyeknek be kell építeniük a hangfunkciókat a termékekbe anélkül, hogy nulláról kiindulva építenék fel a beszédfelismerési infrastruktúrát.
Kritériumok szétosztása
- Valós idejű streamelés beszéd-ről szövegre
- Neurális szövegről beszéd hangok
- Beszélő azonosítása és szószintű időbélyegek
- Egyéni modell finomhangolás
- Hangintelligencia (hangulat, témák, összefoglalás)
- REST és WebSocket API-k több nyelvű SDK-kkal
Kokoro TTS
Nyílt forráskódú, többnyelvű szövegbeszéd, amely az írott szöveget természetes hangzású beszéddé alakítja.

A Kokoro TTS egy szövegből beszéddé alakító rendszer, amely a különböző nyelvek és hangstílusok körében a felvitt írott bejegyzést nyílt, természetes hangzású beszédbe alakítja. Célja annak elérése, hogy magas minőségű hangszintézist biztosítson fejlesztőknek, tartalomalkotóknak és hobbiknak, akiknek szükségük van valósághű audió kimenetre projektekhez, mint például videókhoz, audiókönyvekhez, hozzáférési eszközökhöz és hangsegítőkhez. A modell a nyelvhangzás és a felismerhető beszédalany jellegzetességeinek előállítására összpontosít, miközben még elegendően könnyed ahhoz, hogy a különböző környezetekben is futtassák. Az alkalmazók a szövegrészletekre kipróbálhatják az elhangzását, kiválaszthatnak különféle hangokat, és integrálhatják az eredményt a saját alkalmazásaikba vagy folyamatukba.
Kritériumok szétosztása
- Többnyelvű szövegbeszéd-generálás
- Több választható hangprofil
- Természetes hanglejtés és tempó
- Exportálható audiokimenet
- Alkalmazható alkalmazásokhoz, videókhoz és narrációhoz
- Fejlesztőbarát integráció




