Tidigare batalj · 2024-11-03 UTC
Speech Recognition Uppgörelse — 3 november 2024
Från kategorin Speech Recognition. 27 markeringar placerade över 6 kämpar. WithAudio tog kronan.
Slutställning
Uppställningen
Kämparna
Profiler av varje verktyg som tävlade i den här bataljen, rankade efter sin slutpoäng.

WithAudio
En en-gång inköp med naturliga AI-stimmar för text-till-språk-läsare på Mac och Windows.

WithAudio är ett text-till-samtalshållbart program för Mac och Windows som omdaner skriven innehåll till talat ljud. Användarna kan klistra in text, läsa in dokument eller importera artiklar och låta dem läsas högt med hjälp av en uppsättning AI-genererade röster, vilket gör det tillfälligt användbart för korrekturläsning, tillgänglighet och hands-fritt läsande. Vart och ett av de flesta TTS-verktyg som litar till månadsbetalningar erbjuds som en enstaka återbetalning, vilket lockar till sig läsare och författare som vill ha förutsägbara kostnader. Appen fokuserar på en enkel lyssningsupplevelse snarare än komplex ljudproduktion, med styrningskontroller och möjligheten att exportera genererat ljud för senare användning.
Radbrytning av kriterier
- Converering av text till tal med AI-stimmar
- Korsplattformsstöd för macOS och Windows
- Ljudexport för offline lyssning
- Alternativ för dokument och textinmatning
- Justering av spelkontroller
- En-gångsköp aktivering

CallFluent
AI-baserad plattform för samtalsanalys som transkriberar, analyserar och automatiserar företagets telefonkonversationer.

CallFluent är en AI-driven samtalsanalysplattform som är utformad för att hjälpa företag att få mer värde från sina telefoninteraktioner. Den kombinerar tal-till-text-transkribering, konversationsintelligens och arbetsflödesautomatisering för att ge insikter från sälj-samtal, supportärenden och kundförfrågningar. Plattformen analyserar ton, avsikt och nyckelämnen i samtalen, vilket ger teamet synlighet till kundsentiment, agentens prestationer och vanliga invändningar. Chefer kan granska trender över stora volymer samtal utan att manuellt lyssna på varje inspelning. Med automatiseringsfunktioner som samtalsresuméer, CRM-loggning och uppföljningsutlösare strävar CallFluent efter att minska repetitivt arbete efter samtal och hjälpa team att agera snabbare på vad kunderna faktiskt säger.
Radbrytning av kriterier
- AI- röst-till-text transkription
- Sentiment- och avsiktsanalys
- Automatiska samtalssammanfattningar
- Dashboard med samtalsinsikter
- CRM- och arbetsflödesintegrationer
- Automatiska utlösare efter samtal

Inworld AI
Skapa interaktiva AI-drivna karaktärer för spel och immersiva virtuella upplevelser.

Inworld AI är ett karakterspelningsmotor som är utformat för utvecklare att bygga spel, virtuella världar och interaktiva media. Det låter skapare designa NCyper och digitala personligheter med distinkta personligheter, minnen, röster och motivationer, och sedan bringa dem till liv genom riktiga tidsåtgång samtal och samsyfte beteende. Plattformen kombinerar språkmodeller med mål, kunskapsbaserna och emotionella tillstånd så att karakterer kan svara dynamiskt på spelare istället för att följa skrivna repliker. Integreringar med motorer som Unreal och Unity, plus SDKs och APIs, gör det möjligt att deploya tecknen över spelprojekt, chattupplevelser, tränings simulatorer och underhållnings appar.
Radbrytning av kriterier
- Anpassbara AI-karaktärer
- Långsiktigt minne och kunskapsbas
- Stemmeffekter och emotionell uttryck
- Unity- och Unreal Engine-SDK
- Mål, utlösare och beteendekontroller
- Flerspels- och flerkaraktärssamspel

Molly Personal Assistant
Artificiell assistent för automatisering av arbetsflöden och förfining av samarbete inom gruppen.

Molly är en AI-personlig assistent som är utformad för att automatisera arbetsflöden och effektivisera samarbete inom team. Syftet är att erbjuda ett djupt anpassat upplevelse genom sin 'ovanlig minne' funktion, som möjliggör att den minns användarens föredrag och anpassar interaktioner enligt det. Användare kan delegera uppgifter till Molly, vilket denutförs åt i enlighet med användarens stil. Assistensen erbjuder också proaktiva förslag för att hålla användarna försedda genom att förutse deras framtidiga behov. Molly är för närvarande i ett begränsat privat beta och intresserade användare kan anmäla sig till väntelistan för att uppleva dess förmågor.
Radbrytning av kriterier
- Automatisering av arbetsflöden
- Spårning av uppgifter och projekt
- Verktyg för team samarbete
- AI-assistent med fokus på produktivitet
- Intelligenta schemaläggning och påminnelser
- Korsverktygsintegreringar

Deepgram
Tal‑till‑text- och text‑till‑tal‑API:er för att bygga röstapplikationer i realtid.

Deepgram är en röst‑AI‑plattform som erbjuder utvecklare API:er för att transkribera ljud och generera naturligt ljudande tal. Dess modeller är designade för låg latens och hög noggrannhet över ett brett spektrum av språk, accenter och ljudförhållanden, vilket gör dem lämpliga för live‑textning, samtalsanalys, röstassistenter och konversationsagenter. Utöver grundläggande transkription erbjuder Deepgram funktioner som speaker diarization, sentiment‑ och topic detection, custom model training och streaming support. Plattformen riktar sig till engineering teams som behöver embed voice capabilities i produkter utan att bygga speech infrastructure från grunden.
Radbrytning av kriterier
- Realtidsströmning tal‑till‑text
- Neurala text‑till‑tal‑röster
- Talardiarisering och tidsstämplar på ordnivå
- Finjustering av anpassade modeller
- Ljudintelligens (sentiment, ämnen, sammanfattning)
- REST‑ och WebSocket‑API:er med flerspråkiga SDK:er
Kokoro TTS
Öppen källkod för flerspråkig text-till-tal som omvandlar skriven text till naturligt klingande röster.

Kokoro TTS är ett text-till-tal-system utformat för att omvandla skriven inmatning till tydligt, naturligt klingande tal över ett brett språk- och röststilsområde. Det syftar till att göra högkvalitativ röstsyntes tillgänglig för utvecklare, innehållsskapare och hobbyister som behöver realistisk ljudutmatning för projekt som videor, ljudböcker, tillgänglighetsverktyg och röstassistenter. Modellen fokuserar på att producera flytande prosodi och igenkännliga talarkaraktäristika samtidigt som den förblir tillräckligt lätt för att kunna köras i en mängd olika miljöer. Användare kan generera talat ljud från textutdrag, välja mellan olika röster och integrera utdata i sina egna arbetsflöden eller applikationer.
Radbrytning av kriterier
- Flerspråkig text-till-tal-generering
- Flera valbara röstprofiler
- Naturlig intonation och takt
- Utexporterbar ljudutdata
- Lämplig för appar, videor och berättande
- Utvecklarvänlig integration




