Tidligere kamp · 2025-02-07 UTC

Multimodal AI Oppgjør — 7. februar 2025

Fra kategorien Multimodal AI. 19 merker plassert på tvers av 5 kjempere. Omniverse Audio2Face tok kronen.

Endelige plasseringer

Oppstillingen

Kjemperne

Profiler av hvert verktøy som konkurrerte i denne kampen, rangert etter sin endelige poengsum.

1Omniverse Audio2Face logo

Omniverse Audio2Face

NVIDIAs AI-drevne verktøy for å generere sanntids, stemme-synkronisert 3D-ansiktsanimasjon

4.6 (5)
Freemium
Omniverse Audio2Face skjermbilde

Omniverse Audio2Face er en NVIDIA-applikasjon som automatisk genererer 3D‑ansiktsanimasjon fra en lydkilde. Ved hjelp av et forhåndstrent dyp nevralnettverk analyserer den taleinngangen og styrer ansiktsuttrykk, leppesynkronisering og følelser for en 3D-karakter i sanntid, og eliminerer mye av det manuelle nøkkelramme‑arbeidet som vanligvis kreves i animasjonsprosesser. Verktøyet kjører inne i NVIDIA Omniverse og støtter eksport til standard DCC-plattformer som Maya, Unreal Engine og Blender gjennom formater som USD og blendshapes. Det fungerer med tilpassede karakter-meshes via et retargeting-arbeidsflyt, noe som gjør det nyttig for spillutviklere, animatører, virtuelle produksjonsteam og skapere som bygger digitale mennesker eller interaktive avatarer. Audio2Face støtter både offline-behandling for filmarbeid og live streaming for interaktive applikasjoner, med justerbare emosjonskontroller og flerspråklig lydbehandling.

Kriteriumfordeling

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Lydstyrt ansiktsanimasjon via dyp læring
  • Sanntidssynkronisering av lepper og emosjonskontroll
  • Karakterretting til tilpassede mesh-modeller
  • Blendshape- og USD-eksportpipelines
  • Live-streaming-modus for interaktive avatarer
  • Støtte for flerspråklig stemmeinput
2Humane AI Pin logo

Humane AI Pin

Bærbar AI-assistent designet som et skjermfritt alternativ til smarttelefonen.

4.5 (6)
Freemium

Humane AI Pin er en liten, magnetisk festet bærbar enhet som bruker stemme, gestus og en laserprojisert skjerm for å tilby assistent‑lignende interaksjoner uten en tradisjonell skjerm. Den kombinerer innebygde kameraer, mikrofoner og sensorer med store språkmodeller for å svare på spørsmål, oversette språk, ta bilder, oppsummere meldinger og identifisere objekter i synsfeltet. Markedsført som en ambient computing‑enhet, har Pin som mål å redusere avhengigheten av telefoner ved kun å vise informasjon når den trengs. Den opererer på sin egen mobilplan i stedet for å være koblet til en smarttelefon, og støtter naturlige språkkommandoer i stedet for apper. Produktet mottok blandede anmeldelser ved lanseringen på grunn av batterilevetid, latens og nøyaktighet, og Humane har siden justert sin roadmap. Det er fortsatt et bemerkelsesverdig tidlig eksperiment innen frittstående, AI‑første bærbar maskinvare.

Kriteriumfordeling

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Stemmebasert AI-assistent
  • Laserblekk-projisert skjerm på håndflaten
  • Sanntids oversettelse av språk
  • Foto- og kort videoopptak
  • Kontekstuell gjenkjenning av objekter og scener
  • Frittstående mobil dataplan
3Project Astra logo

Project Astra

Google DeepMind's universelle AI-agent som ser, hører og forstår verden i sanntid.

5.0 (4)
Freemium
Project Astra skjermbilde

Project Astra er en eksperimentell universell AI-assistent fra Google DeepMind, designet for å hjelpe med hverdagslige oppgaver ved å forstå verden på samme måte som mennesker gjør. Den behandler video, lyd, bilder og tekst samtidig, slik at brukere kan peke med et kamera eller snakke naturlig og få kontekstbevisste svar. Bygget på Googles Gemini-modeller, er Astra utviklet for lav latens og samtalebasert interaksjon med vedvarende minne av nylig kontekst. Den er posisjonert som en forskningsprototype som utforsker hvordan en allsidig agent til slutt kan kjøre på telefoner, smartbriller og andre ambientenheter. Selv om den ennå ikke er et offentlig tilgjengelig produkt, signaliserer Astra Googles retning for agentisk AI som kan observere omgivelsene, huske det den har sett, og ta hjelpsomme handlinger på vegne av brukeren.

Kriteriumfordeling

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs0
Reliability1
  • Live video- og bildekognisjon
  • Stemmbasert samtalegrensesnitt
  • Vedvarende kontekstuell minne
  • Multimodal resonnement på tvers av tekst, lyd og bilder
  • Integrasjon med Gemini-modelfamilien
  • Prototype-støtte for smart glasses og telefoner
4H

Hume AI

Følelsesintelligent stemme‑AI som snakker og lytter med menneskelignende nyanser

4.8 (4)
Freemium
Hume AI skjermbilde

Hume AI utvikler stemme‑ og språkmodeller som er designet for å tolke og svare på emosjonelle signaler i menneskelig tale. Deres flagskipsprodukt Empathic Voice Interface (EVI) kombinerer uttrykksfull tale‑syntese med sanntidsanalyse av tone, prosodi og sentiment, og muliggjør samtaler som føles mer naturlige enn vanlige stemmeassistenter. Utviklere kan få tilgang til Hume AI sine funksjoner via API-er og SDK-er for å bygge applikasjoner innen områder som psykisk helsestøtte, kundeservice, tilgjengelighet og interaktiv underholdning. Plattformen tilbyr også verktøy for måling av uttrykk for å analysere emosjonelle signaler i stemme-, ansikts- og språkdata. Hume posisjonerer seg rundt ansvarlig distribusjon, publiserer forskning på affektiv databehandling og følger etiske retningslinjer for bruk av emosjons‑AI.

Kriteriumfordeling

Ease of use1
Value for money0
Features & power0
Integrations1
Support & docs0
Reliability0
  • Empatisk stemmegrensesnitt (EVI)
  • Måling av uttrykk gjennom stemme, ansikt og tekst
  • Tilpassbare stemmepersonligheter
  • Lavlatens samtalestrømming
  • REST- og WebSocket‑APIer
  • Retningslinjer og dokumentasjon for etisk bruk
5Alaya AI logo

Alaya AI

Web3-datamarked som kobler AI-utviklere med globale bidragsytere gjennom spillbaserte insentiver.

4.8 (5)
Freemium

Alaya AI er en desentralisert plattform som kobler AI-modellutviklere med distribuerte dataleverandører gjennom en Web3-fellesskapsstruktur. Den fokuserer på å skaffe mangfoldig, høykvalitets treningsdata for maskinlæring ved å dra nytte av et globalt nettverk av bidragsytere som merker, validerer og sender inn datasett. Plattformen bruker spillbaserte elementer, tokens og NFTs for å motivere deltakelse, og gjør innsamling og annotering av data til en engasjerende aktivitet i stedet for en kjedelig oppgave. Bidragsytere tjener belønninger basert på kvalitet og kvantitet i arbeidet sitt, mens utviklere får tilgang til skalerbare, varierte datasett egnet for trening av nisje- eller kulturspesifikke modeller. Ved å kombinere blokkjede‑gjennomsiktighet med sosial svarmsintelligens, har Alaya AI som mål å gjøre AI‑datapipelines mer rettferdige, sporbare og tilgjengelige for mindre team som mangler store interne merkelighetsressurser.

Kriteriumfordeling

Ease of use0
Value for money0
Features & power0
Integrations1
Support & docs0
Reliability0
  • Desentralisert datainnsamling og merkningsnettverk
  • Token- og NFT-basert belønningssystem
  • Spillbaserte oppgaver og samfunnsutfordringer
  • Sømningsintelligens for distribuert annotasjon
  • Støtte for varierte og nisjebehov for datasett
  • On-chain sporing av bidrag