Bătălie trecută · 2025-02-07 UTC
Multimodal AI Confruntare — 7 februarie 2025
Din categoria Multimodal AI. 19 puncte plasate pe 5 luptători. Omniverse Audio2Face a luat coroana.
Clasament final
Lotul
Luptătorii
Profilurile fiecărui instrument care a concurat în această bătălie, clasate după scorul lor final.

Omniverse Audio2Face
Crearea animațiilor personajelor digitale fără ansamblu de gândiri

Omniverse Audio2Face este o aplicație NVIDIA care generează în mod automat animație facială 3D dintr-o sursă audio. Folosind o rețea neuronală profundă pre-antrenată, analizează intrarea vocală și controlează expresiile faciale, sincronizarea buzelor și emoția unui personaj 3D în timp real, eliminând o mare parte din keyframingul manual necesar de obicei în fluxurile de lucru de animație. Instrumentul rulează în interiorul NVIDIA Omniverse și acceptă exportul către platforme DCC standard, cum ar fi Maya, Unreal Engine și Blender, prin formate precum USD și blendshapes. Funcționează cu mesh-uri de caractere personalizate prin intermediul unui flux de lucru de retargetare, ceea ce îl face util pentru dezvoltatorii de jocuri, animatori, echipe de producție virtuală și creatori care construiesc oameni digitali sau avataruri interactive. Audio2Face suportă atât procesarea offline pentru lucrări cinematografice, cât și streaming live pentru aplicații interactive, cu controale ajustabile de emoție și gestionare multilingvă a sunetului.
Diviziunea criteriilor
- Animare facială condusă de sunet prin învățare profundă
- Sincronizare buzelor și control al emoțiilor în timp real
- Retargetare caracterelor pe meshe personalizate
- Pipeleine de export Blendshape și USD
- Mod de transmisie live pentru avatare interactive
- Suport pentru intrare vocală multilingvă

Humane AI Pin este un dispozitiv purtător mic, atașat magnetic, care folosește voce, gesturi și o display proiectată cu laser pentru a oferi interacțiuni de tip asistent fără o ecran tradițională. Se conectează cu camerele onboard, microfoanele și senzorii la modele mari de limbaj pentru a răspunde la întrebări, traduce limbi, surprinde poze, rezumă mesaje și identifică obiecte din campul vizual. Prezentată ca un dispozitiv de calcul ambiental, Pin își propune să reducă dependența de telefone prin prezentarea de informații doar atunci când este nevoie. Fără a necesita o conexiune la smartphone, Pin rulează pe planul celular propriu și suportă comanda naturală a limbajului în loc de aplicații. Produsul a primit recenzii mixte în momentul lansării, datorită duratei de viață a bateriei, latenței și preciziei, și Humane a ajustat mai târziu planul său de dezvoltare. În continuare rămâne un experiment notabil de la început, în domeniul dispozitivelor wearable standalone, bazate pe inteligent artificial.
Diviziunea criteriilor
- Asistent AI controlat de voce
- Proiectarea de afişaj cu cerneală la rază cu laser pe palma mâinii
- Traducerea în timp real a limbajului
- Captura de fotografii şi videoclipuri scurte
- Recunoașterea contextuală a obiectelor şi a scena
- Plan de date celular independent

Project Astra
Agentul AI universal de la Google DeepMind care vede, aude și înțelege lumea în timp real.

Proiectul Astra este un asistent inteligent universal experimental dezvoltat de Google DeepMind, conceput pentru a ajuta cu sarcinile de zi cu zi de căre înțelege lumea așa cum o face omul. Acesta procesează video, audio, imagini și text simultan, permițând utilizatorilor să indice o cameră sau să vorbească firesc și să primească răspunsuri contextualizate. Proiectat pe baza modelelor Gemini de la Google, Astra este proiectat pentru interacțiune conversațională cu latență redusă și pentru stocarea memoriei persistente a ultimului context. Acesta este pozicionat ca o prototip de cercetare, explorând felul în care un agent general-pur este capabil să ruleze la telefon, ochelari inteligenți și alte dispozitive ambiane. În ciuda absenței sale în momentul de față ca produs disponibil pentru public, Astra semnalează direcția pe care o urmează Google pentru inteligența artificială agentică capabilă să observe mediul împrejur, să-și aducă aminte din ce a văzut și să lucreze la un comportament util pe numărul utilizatorului.
Diviziunea criteriilor
- Înțelegerea live a video și imagini
- Interfață conversațională bazată pe voce
- Memorie contextuală persistentă
- Raționament multimodal peste text, audio și vizuale
- Integrare cu familia de modele Gemini
- Suport de prototip pentru ochelari inteligenți și telefoane

Hume AI dezvoltă modele vocale și de limbă proiectate pentru a interpreta și răspunde la indicii emoționale din vorbirea umană. Interfeța Vocală Empatică (EVI) principală a sa combina sinteza de vorbă expresivă cu analiza în timp real a tonului, prosodiei și sentimentului, permițând conversații care se simt mai naturale decât asistențtile vocale tipice. Dezvoltatorii pot accESA cu puterile Hume prin intermediul APIilor și SDK-urilor pentru a construi aplicații în domenii precum sprijinul sănătății mintale, servicii de relații cu clienții, accesibilitate și divertisment interactiv. Platforma oferă, de asemenea, instrumente de măsurare a expresiei pentru analiza semnalelor emoționale în datele vocale, faciale și de limbaj. Hume se poziționează în jurul implantării responsabile, publicând cercetări despre calcularea afectivă și urmando ghidurile de etică pentru utilizarea AI emoțională.
Diviziunea criteriilor
- API-uri versatil Puterea voice, speech synthesis și tone recognition
- Empathic Voice Interface (EVI) care combine expresie și synthisație de starea emoțională
- Experimentări în afaceri și cunoasterea emoțiilor de emoții și analize cu un fiecare persoană interacționare
- Luare în considerare implicațiile afectivi vești pentru acțiunile sociale și înțelegerea sentimentelor emocionale
- API-uri versatil Puterea oferirii care este voie în română: o echipă de researchează și comprende emoțiile sentimentale
- API-uri versatile Puterea platformei și analiza sentimentelor în conversații vocaluri

Alaya AI
Piață de date Web3 care conectează dezvoltatorii AI cu colaboratori globali prin stimulente gamificate.
Alaya AI este o platformă descentralizată care creează o punte între dezvoltatorii de modele AI și furnizorii de date distribuiți, prin intermediul unei structuri comunitare Web3. Aceasta se concentrează pe obținerea unor date de antrenament diverse și de înaltă calitate pentru machine learning, apelând la o rețea globală de colaboratori care etichetează, validează și trimit seturi de date. Platforma utilizează gamificarea, tokenurile și NFT-urile pentru a motiva participarea, transformând colectarea și adnotarea datelor într-o activitate captivantă, mai degrabă decât într-o sarcină obositoare. Colaboratorii câștigă recompense bazate pe calitatea și cantitatea muncii lor, în timp ce dezvoltatorii obțin acces la seturi de date scalabile și variate, potrivite pentru antrenarea modelelor de nișă sau a celor specifice din punct de vedere cultural. Combinând transparența blockchain-ului cu inteligența colectivă socială, Alaya AI își propune să facă fluxurile de date pentru AI mai echitabile, trasabile și accesibile pentru echipele mai mici, care nu dispun de resurse interne mari de etichetare.
Diviziunea criteriilor
- Rețea descentralizată pentru colectarea și etichetarea datelor
- Sistem de recompense bazat pe tokenuri și NFT-uri
- Sarcini gamificate și provocări comunitare
- Inteligență colectivă pentru adnotare distribuită
- Suport pentru nevoi diverse și de nișă privind seturile de date
- Urmărirea contribuțiilor on-chain



