Tidligere kamp · 2024-11-03 UTC
Speech Recognition Oppgjør — 3. november 2024
Fra kategorien Speech Recognition. 27 merker plassert på tvers av 6 kjempere. WithAudio tok kronen.
Endelige plasseringer
Oppstillingen
Kjemperne
Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.


Toolen WithAudio er en skrivebords tekst-till-tale-programmering for Mac og Windows som konverterer skrevet innhold til talt lyd. Brukere kan lime tekst, laste opp dokumenter eller importere artikler og ha dem lest ut med en rekke AI-genererte stemmer, noe som gjør det nyttig for å korrekturlese, gjøre innhold mer tilgjengelig og for å lese på skjermbenken. Unnlukkeligvis avviker WithAudio fra de fleste TTS-verktøy som avhenger av månedlige abonnement, ettersom det tilbyes som en enkeltbetaling. Dette kommer lesere og skriver åpentil, fordi det gir dem en forutsigbar kostnad. Appen er rettet mot en enkel avlyttingserfaring fremfor komplekse lydaindustruer, med spillekontroll og muligheten for å eksportere gjengenererte audiofiler for senere bruk.
Kriteriumfordeling
- Tekst-til-talt konversjon med AI-stemmer
- Kryss-plattformstøtte for macOS og Windows
- Lydfil-eksport for offline-opphytning
- Dokument og tekst-inndata valg
- Justerlige avspillingskontroller
- Egentlig lisensaktivering

CallFluent
AI-kall-analysetjeneste som transkriberer, analyserer og automatiserer forretningstelefonsamtaler.

CallFluent er en AI-drevet analyseplattform for samtaler som er designet for å hjelpe bedrifter med å få mer verdi av sine telefoninteraksjoner. Den kombinerer tale‑til‑tekst transkripsjon, samtaleintelligens og arbeidsflytautomatisering for å avdekke innsikter fra salgssamtaler, supportbilletter og kundehenvendelser. Plattformen analyserer tone, intensjon og nøkkeltemaer på tvers av samtaler, og gir teamene innsikt i kundens sentiment, representantenes ytelse og vanlige innvendinger. Ledere kan gjennomgå trender på tvers av store mengder samtaler uten å måtte lytte til hver opptak manuelt. Med automatiseringsfunksjoner som samtaleoppsummeringer, CRM-logging og oppfølgingsutløsere, har CallFluent som mål å redusere gjentakende arbeid etter samtaler og hjelpe team med å handle raskere på det kundene faktisk sier.
Kriteriumfordeling
- AI tale-til-tekst transkripsjon
- Sentiment- og intensjonsanalyse
- Automatiske samtalesammendrag
- Dashboard for samtaleinnsikt
- Integrasjoner med CRM og arbeidsflyt
- Trigger for etter-samtale automatisering

Inworld AI
Bygg interaktive AI-drevne karakterer for spill og oppslukende virtuelle opplevelser.

Inworld AI er en karaktermotor designet for utviklere som bygger spill, virtuelle verdener og interaktive medier. Den gjør det mulig for skapere å designe NPC‑er og digitale personas med særpregende personligheter, minner, stemmer og motivasjoner, og deretter bringe dem til live gjennom sanntids‑samtaler og kontekstuell atferd. Plattformen kombinerer språkmodeller med mål, kunnskapsbaser og emosjonelle tilstander, slik at karakterer kan svare dynamisk på spillere i stedet for å følge manusbaserte linjer. Integrasjoner med motorer som Unreal og Unity, samt SDK‑er og API‑er, gjør det mulig å distribuere karakterer på tvers av spillprosjekter, chat‑opplevelser, treningssimuleringer og underholdnings‑apper.
Kriteriumfordeling
- Tilpassbare AI-karakterpersonligheter
- Langtidshukommelse og kunnskapsbaser
- Stemmesyntese og emosjonell uttrykk
- Unity- og Unreal Engine SDK-er
- Mål, triggere og atferdskontroller
- Flerspiller- og flerkarakterinteraksjoner

Molly Personal Assistant
AI-assistent for automatisering av arbeidsflyter og effektivisering av team-samarbeid.

Molly er en AI-personlig assistent designet for å automatisere arbeidsflyter og forenkle team-samarbeid. Den har som mål å tilby en dypt personlig opplevelse gjennom sin 'infinite memory'-funksjon, som lar den huske brukerpreferanser og tilpasse interaksjoner deretter. Brukere kan delegere oppgaver til Molly, som den utfører på en måte som passer inn i brukerens stil. Assistenten gir også proaktive forslag for å holde brukerne foran ved å forutse deres fremtidige behov. Molly er for tiden i en begrenset privat beta, og interesserte brukere kan bli med på ventelisten for å oppleve dens muligheter.
Kriteriumfordeling
- Arbeidsflyt-automatisering
- Oppgave- og prosjektsporing
- Verktøy for team-samarbeid
- Produktivitetssentrert AI-assistent
- Smart planlegging og påminnelser
- Integrasjoner på tvers av verktøy

Deepgram
Tale‑til‑tekst og tekst‑til‑tale‑APIer for å bygge sanntids stemmeapplikasjoner.

Deepgram er en stemme‑AI‑plattform som gir utviklere API‑er for transkribering av lyd og generering av naturlig‑lydende tale. Modellene deres er designet for lav latens og høy nøyaktighet på tvers av et bredt spekter av språk, aksenter og lydforhold, noe som gjør den egnet for live‑teksting, samtaleanalyse, stemmeassistenter og konversasjonsagenter. Utover kjerne‑transkripsjon tilbyr Deepgram funksjoner som speaker diarization, sentiment og topic detection, custom model training og streaming support. Plattformen retter seg mot ingeniørteam som trenger å integrere talefunksjoner i produkter uten å bygge taleinfrastruktur fra bunnen av.
Kriteriumfordeling
- Sanntids streaming tale‑til‑tekst
- Nevrale tekst‑til‑tale‑stemmer
- Talergjenkjenning og tidsstempler på ordnivå
- Finjustering av egendefinerte modeller
- Lydintelligens (sentiment, temaer, oppsummering)
- REST‑ og WebSocket‑APIer med flerspråklige SDK‑er
Kokoro TTS
Open-source flerspråklig tekst-til-tale som omformer skrevet tekst til naturlig klingende stemmer.

Kokoro TTS er et tekst‑til‑tale‑system designet for å konvertere skriftlig input til klar, naturlig lydig tale på tvers av et bredt spekter av språk og stemmevarianter. Det har som mål å gjøre høykvalitets stemmesyntese tilgjengelig for utviklere, innholdsskapere og hobbyister som trenger realistisk lydutgang for prosjekter som videoer, lydbøker, tilgjengelighetsverktøy og stemmeassistenter. Modellen fokuserer på å produsere flytende prosodi og gjenkjennelige talerkarakteristikker samtidig som den forblir lett nok til å kjøre i ulike miljøer. Brukere kan generere talende lyd fra tekstutdrag, velge mellom ulike stemmer og integrere utdataen i sine egne arbeidsflyter eller applikasjoner.
Kriteriumfordeling
- Flerspråklig tekst-til-tale generering
- Flere valgbare stemmeprofiler
- Naturlig intonasjon og rytme
- Eksportérbar lydutgang
- Egnet for apper, videoer og fortelling
- Utviklervennlig integrasjon




