Korábbi csata · 2025-02-07 UTC
Multimodal AI Leszámolás — 2025. február 7.
A(z) Multimodal AI kategóriából. 19 jelölés elhelyezve 5 versenyző között. Omniverse Audio2Face szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

Omniverse Audio2Face
NVIDIA azon AI-jelentőségű eszköze a valós idejű, hang-szinkronizált 3D arcánimáció generálásához

Az Omniverse Audio2Face egy NVIDIA alkalmazás, amely automatikusan generál 3D arcviszonylagos animációt egy audio forráshoz. Egy beaktaultatásos neuronális hálózat használatával elemzi a hangbemenetet, és irányítja az arckifejezést, a szájmozgást és az érzelmeket egy 3D szereplőben valós időben, nagyrészt megszünteti az animációs folyamatokban gyakran alkalmazott manuális kulcsszinkronizálások nagy részét. A eszköz a NVIDIA Omniverse-ben fut, támogatja az exportálást a standard DCC platformokra, mint például a Mayara, a Unreal Engine, a Blenderre az USD és a blendshape-formátumokon keresztül. Egy custom karakterhálót kezelő re-targeting folyamaton dolgozik, így hasznos a játékkészítőknek, animációs művészeknek, virtuális produkciós csapatoknak és alkotóknak, akik digitális embereket vagy interaktív avatarokat készítenek. Az Audio2Face támogatja az offline feldolgozást a filmes munkákhoz és élő streamelést az interaktív alkalmazásokhoz, különálló érzelemvezérléssel és több nyelv támogatásával a hanganyaghoz.
Kritériumok szétosztása
- A hang által is vezérelt arc kifejezései a mély tanulás használatával
- Real-time ajkaszinkronizáció és érzelem kontroll
- A karakterek kiosztása egyedi mesh-ekre
- Blendshape és USD export folyamatok
- Live streaming módszer az interakcióhoz szánt avatarok számára
- Több nyelvű hang bevitel támogatása

Humane AI Pin
Viselhető virtuális asszisztensi készülék, kijelző nélküli alternatívájaként az okostelefonokhoz.
A Humane AI Pin egy kis méretű, mágneseshez rögzíthető viselhető eszköz, mely szavazásra, gesztusra és egy fénybölcskezéses képernyőre figyelembevételét nélkülözve biztosítja aszisztensekhez hasonlóan működőképes kölcsönhatásokat. Össze van kötve a tároló kamerákkal, mikrofonokkal és érzékelőkkel a nagy nyelvmintákhoz, hogy válaszoljon feladatokra, fordítsa le nyelveket, kapcsolja le fényképeket, rövidítse össze üzeneteket és azonosítsa a felületen látható tárgyakat. A Pinot gyakran olyan környezeti számítógépnek nevezik, amely automatikusan felhalmozott információt tesz elérhetővé, amikor azokra szükség van. A Pin saját mobilhálózati csomagon fut, nem kötődik tehát mobiltelefonhoz, és támogatja a természetes nyelvi parancsokat helyettézve alkalmazásokat. A termék vegyes reakciókat váltott a debütálása után tároló élettartamról, a késleltetésről és a pontosságról, és a Humaneó azóta módosította fejlesztési tervét. A standalone, AI-first hardverű készülék mintájaként kiemelkedő korai kísérlet maradt.
Kritériumok szétosztása
- Hangvezérlésű virtuális asszisztens
- Lázer hajlítási kiírót a tenyéren
- Valós idejű nyelvi fordítás
- Képek és rövid videófelvételek
- Kortárs tárgy és jelenet felismerés
- Állítható cellári adatforrás

Project Astra
A Google DeepMind által fejlesztett univerzális mesterséges intelligencia-agyunk, ami érzékeli, hallja, és a világot a valós időben értelmezi.

A Project Astra egy kísérleti, általános AI-asszisztens a Google DeepMindtől, amely segítségnyújtást nyújt az egyedüli napközismert feladatokhoz azáltal, hogy megérti a világot úgy, ahogyan az emberek teszik. Képeket, hangfelvételt, videót és szöveget feldolgozva egyszerre, lehetővé teszi a felhasználóknak, hogy egy kamerát mutassanak vagy természetesen beszéljenek, hogy érzékeny kontextusú válaszokat kapjanak. Az Astra a Google Gemini modeljei alapján készül, tervezett az alacsony késleltetésű, konverzacionális interakcióhoz biztosított tartós memóriával a nagyon közel körülemet tartó kontextusnak. Pozicionálják az algoritmusfejlesztési prototípusnak, ami megvizsgálja azt, hogyan lehetett volna egyáltalán általános célú ügynök futtatása is telefonok, okos napszemüvegek, egyéb szobai eszközökön egy idővel. Bár a terméket még nem kínálják közönségnek, a Project Astra jelzi, hogy a Google mely irányba halad az agilis AI-vel kapcsolatban, az lehetővé teszi a környezet figyelmében, az emlékezésre, amit láttunk, és olyan hasznos cselekedeteket tegyen egy felhasználó érdekében.
Kritériumok szétosztása
- Élő videó- és képrendszer
- Hangszerű beszélgetési interfész
- Tartós kontextuális emlékezet
- Az erősített érzékszervi észlelés az erősített multimodális észlelés központjában van
- Az összefogás a Gemini modell családdal
- Támogatás a smart glasses és phone eszközök számára
Hume AI
Érzelmileg intelligens hangképes AI, amely emberi jellegű finomságokkal beszél és hallgat

A Hume AI a hang és nyelvi modelljeit fejleszti az érzelmi jeleket értelmezi és válaszol az emberi beszédre. Főtermékének, az Empathic Voice Interface (EVI)-nek expresszív szövegalkalmazása és az adott pillanatban létrejövő tartalom analízist kombinálja a hanghordozás, a prozódia és az üzenet szorongatós értelmezésével, lehetővé téve a természetesebb hangkeverés, mint a szokványos hangvezérlők esetében folytatott beszélgetéseket. A fejlesztők a Hume kapacitásaihoz hozzáférhetnek API-kon és SDK-kon keresztül, hogy alkalmazásokat építsenek fel a mentális egészségi támogatás, a vevőszolgálat, a megközelíthetőség és az interaktív szórakozás szakterületein. A platform kifejezés-mérési eszközöket is kínál, hogy elemzéseket végezzek emocionális jeljekekről hang, arckifejezés és nyelvadata elemzése során. A Hume az olyan felelős bevezetésre összpontosít, amely az érzelmekkel foglalkozó számítástechnika terén publikál kutatásokat, és betartó az etikai irányszabályoknak a közömbösülési mesterséges intelligencia használatát illetően.
Kritériumok szétosztása
- Empathic Voice Interface (EVI)
- Hang, arc és szöveg adatain végzett kifejezés mérés
- Kapcsolható hangszemélyiségek
- Alacsony késleltetésű beszélgetések során folyamatos adatfolyam
- REST és WebSocket API-k
- Etikus felhasználási utasítások és dokumentáció

Alaya AI
Web3 adatpiac, amely AI fejlesztőket globális hozzájárulókhoz kapcsol át játékosított ösztönzéssel.
Az Alaya AI egy decentralizált platform, amely az AI modell fejlesztőket a szétosztott adatszolgáltatókkal köti össze egy Web3 közösségi struktúrán keresztül. Célja a sokszínű, magas minőségű képzési adatok forrásának biztosítása a gépi tanuláshoz egy globális hozzájárulók hálózatának bevonásával, akik címkéznek, ellenőriznek és adatkészleteket nyújtanak be. A platform gamifikációt, tokeneket és NFT-ket használ a részvétel ösztönzésére, ami így az adatgyűjtést és -annotációt egy érdekes tevékenységgé változtatja, nem pedig egy kellemetlen feladattá. A közreműködők jutalmat kapnak munkájuk minősége és mennyisége alapján, míg a fejlesztők hozzáférést kapnak skálázható, változatos adatkészletekhez, amelyek alkalmasak niklus vagy kulturális specifikus modellek tanítására. Az Alaya AI a blockchain átláthatóságának és a társasalmi swarm intelligenciának az ötvözésével célba veszi, hogy az AI adatfolyamok egyenlőbbek, nyomon követhetőbbek és elérhetőbbek legyenek a kisebb csapatok számára, amelyek nem rendelkeznek nagy belső címkézési erőforrásokkal.
Kritériumok szétosztása
- Decentralizált adatgyűjtő és címkéző hálózat
- Token és NFT alapú jutalmazási rendszer
- Gamifikált feladatok és közösségi kihívások
- Zsiráf intelligencia a terjesztett címkézéshez
- Támogatás a sokféle és szűk adatkészlet igényekhez
- On-chain nyomon követés a hozzájárulásokra



