Miniona bitwa · 2025-02-07 UTC
Multimodal AI Pojedynek — 7 lutego 2025
Z kategorii Multimodal AI. 19 ocen oddanych na 5 zawodników. Omniverse Audio2Face zdobył koronę.
Klasyfikacja końcowa
Zestawienie
Zawodnicy
Profile każdego narzędzia, które rywalizowało w tej bitwie, uszeregowane według ich wyniku końcowego.

Omniverse Audio2Face
Narzędzie oparte na sztucznej inteligencji NVIDIA do generowania animacji twarzy 3D w czasie rzeczywistym, synchronizowanej z głosem

Omniverse Audio2Face to aplikacja NVIDIA, która automatycznie generuje 3D animację twarzy z źródłem dźwiękowym. Korzystając z zaprojektowanego z wyprzedzeniem sieci neuronowej głębokiej, analizuje wejście głosowe i kontroluje ekspresje twarzy, synchronizację warg i emocję 3D postaci w czasie rzeczywistym, eliminując znaczną część ręcznej keyframing, typowej w łańcuchach analitycznych. Otool jest uruchamiany w NVIDIA Omniverse i obsługuje eksport do standardowych platform DCC, takich jak Maya, Unreal Engine, i Blender, za pośrednictwem formatów takich jak USD i blendshape. Funkcjonuje z personalizowanymi modelami mesh poprzez przycięgę workflow, czyniąc ją przydatną dla deweloperów gier, animatorów, zespołów produkcji wirtualnej, i twórców budujących cyfrowe istoty lub interaktywne awatary. Audio2Face obsługuje oba rozwiązania offline dla pracy kina oraz w czasie rzeczywistym dla aplikacji interaktywnych, z możliwością regulacji emocji i obsługą multilingualizmu audio.
Podział kryteriów
- Animacja twarzy sterowana dźwiękiem za pomocą głębokiego uczenia
- Synchronizacja ust i kontrola emocji w czasie rzeczywistym
- Retargeting postaci do niestandardowych siatek
- Potoki eksportu Blendshape i USD
- Tryb transmisji na żywo dla interaktywnych awatarów
- Wsparcie wielojęzycznych danych głosowych

Humane AI Pin
Przenośny asystent AI zaprojektowany jako alternatywa bez ekranu dla smartfona
Humane AI Pin to małe urządzenie noszone, magnetycznie przymocowane, które wykorzystuje głos, gesty oraz projektowany laserowo ekran, aby zapewnić interakcje w stylu asystenta bez tradycyjnego wyświetlacza. Łączy wbudowane kamery, mikrofony i czujniki z dużymi modelami językowymi, aby odpowiadać na pytania, tłumaczyć języki, robić zdjęcia, podsumowywać wiadomości i rozpoznawać obiekty w polu widzenia. Sprzedawane jako urządzenie ambient computing, Pin dąży do ograniczenia polegania na telefonach, prezentując informacje tylko wtedy, gdy są potrzebne. Działa na własnym planie komórkowym zamiast być powiązane z smartfonem i obsługuje polecenia w języku naturalnym zamiast aplikacji. Produkt otrzymał mieszane recenzje przy wprowadzeniu, dotyczące żywotności baterii, opóźnień i dokładności, a Humane od tego czasu dostosowało swoją roadmapę. Pozostaje ważnym wczesnym eksperymentem w samodzielnym, AI-first sprzęcie noszonym.
Podział kryteriów
- Asystent AI sterowany głosem
- Ekran laserowo-inkowy na dłoni
- Tłumaczenie języków w czasie rzeczywistym
- Robienie zdjęć i krótkich filmów
- Rozpoznawanie kontekstualne obiektów i scen
- Samodzielny plan danych komórkowych

Project Astra
Uniwersalny agent AI od Google DeepMind, który widzi, słyszy i rozumie świat w czasie rzeczywistym.

Project Astra jest eksperymentalnym uniwersalnym asystentem AI firmy Google DeepMind do celów pomocy w przeprowadzaniu każodnia rzeczy poprzez zrozumienie tego, jak świat widziany przez ludzi. Pozwala na przechwytywanie wideo, audio, obrazów, tekstów w czasie rzeczywistym, pozwalając na podanie kamerą lub rozmowę językową, by otrzymać odpowiedzi w zależności od kontekstu. Nawiązując do modeli Gemini od Google, Astra została zaprojektowana dla niskich opórdziejności, interakcji rozmówczej z trwałym pamięcią ostatniego kontekstu. Jest to prototyp badawczy, eksplorujący w jaki sposób agent ogólnego przeznaczenia mógłby w przyszłości działać na telefonach, smartowych okularach i innych urządzeniach otoczenia. Niepubliczny jeszcze produkt, Astra wskazuje na stronę kierunku, którego Google chce dotrzeć w kwestii wysoce aktywnych AI. Agenty powinny być w stanie obserwować otoczenie, przypominać sobie, co już zobaczyli i podejmować użyteczne działania na rzecz użytkowników.
Podział kryteriów
- Rozumienie wideo na żywo i obrazów
- Interfejs konwersacyjny oparty na głosie
- Trwała pamięć kontekstowa
- Rozumienie multimodalne obejmujące tekst, dźwięk i obrazy
- Integracja z rodziną modeli Gemini
- Wsparcie prototypowe dla smart glasses i telefonów
Hume AI
Inteligentny emocjonalnie głosowy AI, który mówi i słucha z ludzkimi niuansami

Hume AI opracowuje modele głosu i języka przeznaczone do interpretacji i reagowania na emocjonalne sygnały w ludzkiej mowie. Flagowa Empathic Voice Interface (EVI) łączy ekspresyjną syntezę mowy z analizą tonu, prozodii i sentymentu w czasie rzeczywistym, umożliwiając konwersacje, które wydają się bardziej naturalne niż typowe asystenty głosowe. Programiści mogą korzystać z możliwości Hume poprzez API i SDK, aby budować aplikacje w obszarach takich jak wsparcie zdrowia psychicznego, obsługa klienta, dostępność oraz interaktywna rozrywka. Platforma oferuje również narzędzia do pomiaru ekspresji, służące do analizy emocjonalnych sygnałów w danych głosowych, twarzy i języka. Hume stawia na odpowiedzialne wdrażanie, publikując badania z zakresu obliczeń afektywnych i przestrzegając wytycznych etycznych dotyczących stosowania AI emocjonalnej.
Podział kryteriów
- Empathic Voice Interface (EVI)
- Pomiar ekspresji w głosie, twarzy i tekście
- Konfigurowalne osobowości głosowe
- Strumieniowanie konwersacyjne o niskiej latencji
- REST i WebSocket API
- Wytyczne i dokumentacja dotycząca etycznego użycia

Alaya AI
Rynek danych Web3 łączący programistów AI z globalnymi współpracownikami dzięki gamifikowanym zachętom.
Alaya AI to zdecentralizowana platforma, która łączy twórców modeli AI z rozproszonymi dostawcami danych poprzez strukturę społeczności Web3. Skupia się na pozyskiwaniu różnorodnych, wysokiej jakości danych treningowych do uczenia maszynowego, wykorzystując globalną sieć współtwórców, którzy etykietują, weryfikują i przesyłają zestawy danych. Platforma korzysta z gamifikacji, tokenów i NFT, aby motywować uczestnictwo, przekształcając zbieranie i etykietowanie danych w angażującą aktywność, zamiast obowiązku. Współtwórcy zdobywają nagrody na podstawie jakości i ilości swojej pracy, podczas gdy twórcy zyskują dostęp do skalowalnych, zróżnicowanych zbiorów danych przeznaczonych do trenowania niszowych lub kulturowo specyficznych modeli. Łącząc przejrzystość blockchain z społecznościową inteligencją rojową, Alaya AI dąży do uczynienia rurociągów danych AI bardziej sprawiedliwymi, śledzonymi i dostępnymi dla mniejszych zespołów, które nie posiadają dużych wewnętrznych zasobów etykietowania.
Podział kryteriów
- Rozproszona sieć zbierania i etykietowania danych
- System nagród oparty na tokenach i NFT
- Zadania gamifikowane i wyzwania społecznościowe
- Inteligencja rojowa do rozproszonej etykietacji
- Obsługa różnorodnych i niszowych potrzeb zestawów danych
- Śledzenie wkładu na łańcuchu (on-chain)



