Tidigare batalj · 2025-02-07 UTC
Multimodal AI Uppgörelse — 7 februari 2025
Från kategorin Multimodal AI. 19 markeringar placerade över 5 kämpar. Omniverse Audio2Face tog kronan.
Slutställning
Uppställningen
Kämparna
Profiler av varje verktyg som tävlade i den här bataljen, rankade efter sin slutpoäng.

Omniverse Audio2Face
NVIDIAs AI-drivna verktyg för att generera real-tidsstyrd, röstsinkronerad 3D-facialanimation

Omniverse Audio2Face är en NVIDIA-app som automatiskt genererar 3D-ansiktsanimation från en ljudkälla. Med hjälp av en tränad djupneuralnetverk analyserar det röster och styr uttryck, läppsynkronisering och känslor på ett 3D-karaktär i realtid, vilket eliminerar större delen av den manuella keyframing som vanligtvis krävs i animationpipelinen. Verktyget körs inom NVIDIA Omniverse och stödjer export till standard DCC-plattformar som Maya, Unreal Engine och Blender via format som USD och blendshapes. Det fungerar med anpassade figurmodeller genom ett omretargeting-flöde, vilket gör det användbart för spelutvecklare, animatörer, virtual production-lag och skapare som bygger digitala människor eller interaktiva avatarer. Audio2Face stödjer både nollinstationell bearbetning för sceniska uppgifter och direktströmning för interaktiva tillämpningar, med anpassningsbara känslotekniska kontroller och hantering av flerspråkig ljudinmatning.
Radbrytning av kriterier
- Ljudstyrd 3D-facialanimation via djup lärande
- Real-tidsförbindning och kontroll över känslor via läppar
- Retargeting av karaktärer till anpassade mesh-bilder
- Blenshapes och USD-exportpipeliner
- Lägen för direktströmning för interaktiva avatarer
- Stöd för flerspråkig röstingång

Humane AI Pin
En skärmfri AI-assistent utformad som en skärmfri ersättning till smartphone
Humane AI Pin är en liten, magnetiskt fastsatt enhet som kan bäras och använder röst, gester och ett laserprojicerat display för att tillhandahålla assistent-styren interaktioner utan ett traditionellt skärm. Den kopplar samman onboard-kameror, mikrofoner och sensorer med stora språkmodeller för att besvara frågor, översätta språk, ta foton, sammanfatta meddelanden och identifiera objekt som syns i omgivningen. Framställd som ett ambientes datoriserade enhet, har Pin som mål att minska beroendet av mobiler genom att presentera information endast när det behövs. Den fungerar med sin egen mobilabonnemang i stället för att vara bunden till en smartphone, och stödjer naturliga språkkommandon i stället för appar. Produkten fick blandade recensioner när den lanserades med kritik mot batteritid,-latens- och precision, och Humane har sedan anpassat sitt utvecklingsprogram. Den återstår som en notabel tidig experiment i självtändande, AI-orienterad huvudsaklig hårdvara.
Radbrytning av kriterier
- Styrd AI-assistent via röst
- Laserink-projektion av display på handflatan
- Real-tidsöversättning av språk
- Fotografisk och kort-videonspelning
- Kontextuell objekt- och scenerkännande
- Stående celulärt dataplansystem

Project Astra
Googles DeepMind universella AI-agent som ser, hör och resonerar om världen i realtid.

Project Astra är en experimentell universell AI-assistent från Google DeepMind utformad för att hjälpa till med vardagliga uppgifter genom att förstå världen på samma sätt som människor. Den behandlar video, ljud, bilder och text samtidigt, vilket gör det möjligt för användare att peka med en kamera eller prata naturligt och få kontextmedvetna svar. Byggd på Googles Gemini-modeller, är Astra konstruerad för interaktion med låg latens och konversationer med ihågkomst av nyligen kontext. Den är positionerad som en forskningsprototyp som undersöker hur en allmänt syftande agent slutligen skulle kunna köras på telefoner, smarta glasögon och andra omgivande enheter. Även om det än så länge inte är en offentligt tillgänglig produkt, indikerar Astra Googles riktning för agentiell AI som kan observera omgivningen, minnas vad den har sett och vidta användbara åtgärder på en användares vägnar.
Radbrytning av kriterier
- Live videoförståelse och bildanalys
- Röstbaserad konversationsgränssnitt
- Persistens kontextminne
- Multimodal resonemang över text, ljud och bilder
- Integration med Gemini-modellfamiljen
- Prototypsupport för smarta glasögon och telefoner

Hume AI utvecklar röst- och språkmodeller som är utformade för att tolka och svara på känslomässiga signaler i mänsklig tal. Företagets flaggskepp, Empathic Voice Interface (EVI), kombinerar uttrycksfull röstsynkronisering med realtidsanalys av ton, prosodi och attityd, så att konversationerna känns mer naturliga än typiska röststyrda assistenter. Utvecklare kan få tillgång till Hemos funktioner via API:er och SDK:er för att bygga applikationer inom områden som hjälp för psykisk hälsa, kundtjänst, tillgänglighet och interaktiv underhållning. Plattformen erbjuder också verktyg för uttrycksanalys för att analysera känsliga signaler i röst, ansiktsdata och språkdata. Hume positionerar sig runt ansvarsfullt implementering, publicerar forskning om affektiva datorkommunikation och följer etiska riktlinjer för användning av emotion AI.
Radbrytning av kriterier
- Empatiskt Röstgränsnitt (EVI)
- Förhållande avtryck över röst, ansikte och text
- Anpassbara röster och personligheter
- Lav-tidskonverserande strömning
- REST- och WebSocket-API:er
- Etiska användningsguider och dokumentation

Alaya AI
Web3-datamarknad som länkar AI-utvecklare med globala bidragsgivare via spelifierade incitament.
Alaya AI är en decentraliserad plattform som förbinder AI-modellutvecklare med distribuerade dataleverantörer genom en Web3‑communitystruktur. Den fokuserar på att samla in mångsidig, högkvalitativ träningsdata för maskininlärning genom att utnyttja ett globalt nätverk av bidragsgivare som märker, validerar och skickar in dataset. Plattformen använder gamification, tokens och NFTs för att motivera deltagande, och gör datainsamling och annotering till en engagerande aktivitet snarare än en tråkig syssla. Bidragsgivare tjänar belöningar baserade på kvaliteten och kvantiteten i deras arbete, medan utvecklare får tillgång till skalbara, varierade dataset som är lämpliga för att träna nischade eller kulturellt specifika modeller. Genom att kombinera blockkedjans transparens med social svärmintelligens strävar Alaya AI efter att göra AI-datapipelines mer rättvisa, spårbara och tillgängliga för mindre team som saknar stora interna resurser för märkning.
Radbrytning av kriterier
- Decentraliserat nätverk för datainsamling och märkning
- Token- och NFT-baserat belöningssystem
- Spelifierade uppgifter och samhällsutmaningar
- Svärmintelligens för distribuerad annotation
- Stöd för mångsidiga och nischade dataset-behov
- On-chain-uppföljning av bidrag



