Минала битка · 2025-02-07 UTC
Multimodal AI Двубой — 7 февруари 2025 г.
От категория Multimodal AI. 19 гласове поставени сред 5 бойци. Omniverse Audio2Face грабна короната.
Финално класиране
Съставът
Бойците
Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

Omniverse Audio2Face
Уреди от NVIDIA за генерация на реално время с реално-time, синхронизиран с гласа 3D animation на лице

Характеристиката Omniverse Audio2Face е приложение на NVIDIA, което автоматично генерира 3D анимация на лицето от аудио източник. Използвайки предтрениран нейронен модел, тя анализира гласовата въвеждаща информация и управлява израженията на лицето, съответствието на устните движения и емоциите на 3D фигура в реално време, облекчавайки значително част от ръчната настройка на ключовите кадри, обичайна в анимационните линии за поток. Инструментът работи извъншно в NVIDIA Omniverse и поддържа извеждане до стандартизирани ДЦ платформи като Maya, Unreal Engine и Blender чрез формати като USD и blendshapes. Той работи с лични meshes на личности чрез retargeting workflow, което го прави полезен за開発ери на игри, аниматори, тимове за виртуален продъжване и създатели на цифрови хора или интерактивни аватарите. Омниверс Аудио2Фейс поддържа както офライン обработка за кинематографически работи, така и живи потоци за интерактивни приложения с променлива контрола на емоциите и обработка на аудио на множество езици.
Разбивка на критериите
- Фасиална анимация, която се управлява чрез дълбоко учене
- Реално time лип синк и контрол на емоциите
- Прикачване на личности към лични модели
- Изходни пайплайни на съчетани облици и USD
- Живи режим на поточна траслировка за интерактивни аватар
- Поддръжка на множество езици за въведение на глас

Humane AI Pin
Острягъл помощник на интелектуалната машина, конструиран като екранна безплатна алтернативата на смуартфона.
Устройството за човешки интелект Pin е малка, магнитно прикачена ношна устройства, което използва глас, мимика и лазерно-проектиран дисплей, за да предостави интеракции тип на асистент без традиционен екран. То се свързва с интегрирани камери, микрофони и датчици с големи модели за естествен процес на лого, за да отговори на въпроси, превежда езици, заснето изображение, сумарира съобщения и разпознава обекти в гледната област. Представен като уред за приобщаващ компютър, пинът има за цел да намали зависимостта от телефоните чрез показване на информация само когато нея се изисква. Той работи с собствена мрежова сметка вмъкната в плана, а не е привързан към смартфона, и поддържа командите в естественоезиков формат вместо приложения. Производството получи смесени оценки при старта си за batter life, latency и точност, и след това Умана се е справила с мярката на приоритетите си. Съществува въпреки това като значима рани изпитване в самостоятелно, AI-first изделие от носяма.
Разбивка на критериите
- Гласово контролиран помощник на интелектуалната машина
- Палмово дисплей чрез лазерната инк проецкия
- Обновяване на езика в реално време
- Фотографски и кратки видеозаписи снимки
- Различни обекти и сцени ролинг на контекст
- Съхраняваща клетъчна данни с план

Project Astra
Универсалната AI-агентност, която вижда, чува и прави умни изводи за световните реални-time

Програмата Астра е експериментален універсален асистент на AI от Гугъл ДийпМайнд дизайнирана да помага с ежедневните задачи чрез да разбира светът на същата начин как го разбират хората. Тя обработва видео, аудио и изображения и текст съвременно, което позволява на потребителите да показват камера или говорят естествено и да получават контекстно-озарявящи отговори, API, SDK и платформа по услуга SaaS. Сложена е на моделите Gemini от Гугъл, Астра е проектирана да поддържа ниски латенция за конвесионални взаимодействия с запомняще памет на последните контексти. Тя се представя като експериментален прототип, изследващ възможността как генерална агента също да може да работи на телефони, умни очила и други амбитни устройства. Това не е още публично достъпно произведение, но Астра показва посоката на Google за агентни АИ, които могат да наблюдават surroundings, да си припомнят, що са видели и да извършат полезни действия на съмнята на потребителя.
Разбивка на критериите
- Умно разбиране на видео и картини
- Гласов интерфейс за конверсация
- Постоянна контекстуална памет
- Мултимодален извод за текст, аудио и визуал
- Обединение с семейството модели Gemini
- Поддръжка за прототипи на умни очила и телефони
Hume AI
Мъдростно осетилна гласова AI, която говори и слуша с многообразие, подобно на човешка нюанса

Системата Hume AI създава гласови и јазични модели създадени, за да интерпретират и отговарят на емоционални подсказки в човешкия говор. Наредният си Емпатичен Гласов Интерфейс (EVI) комбинира експресивна говореща синтеза с реално време анализа на тон, ритм и настроение, в резултат на което създава самостоятелни разговори, които изпитват също така емоцията, с обикновените гласови асистенти. Разработчиците могат да споделят способностите на платформата през API и SDK за да създават приложения в областите като психическа поддържка, клиентска служба, достъпност и интерактивно забавление. Платформата също предлага инструменти за изразяване на измеренията, които анализират емоционалните сигнали в гласовни данни, лица и езикове. Хюм се класира около ответствено разширяване, публикува изследване в областта на афективен компютър и се подчинява на етични насоки за използване на емоционална AI.
Разбивка на критериите
- Емпатичен гласов интерфейс (EVI)
- Изразно измерване из voice, face, и текст
- Конфигурьониран гласов характер
- Низко-затежен конверзационен поток
- API и WebSocket API
- Нормативи за этичената употреба и документация

Alaya AI
Web3 пазар на данни, свързващ разработчици на ИИ с глобални допринасящи лица чрез игрификованни стимули
Alaya AI е децентрализирана платформа, която свързва разработчици на модели за изкуствен интелект с разпределени доставчици на данни чрез структура на Web3 общност. Тя се фокусира върху получаването на разнообразни, висококачествени тренировъчни данни за машинно обучение, като използва глобална мрежа от.contributorи, които маркират,.validate и подават набори от данни. Платформата използва геймификация, токени и NFT, за да мотивира участието, превръщайки събирането и анотацията на данни във захватващо занятие, а не в корек, и по този начин повишава качеството на резултатите. Сътрудниците получават награди в зависимост от качеството и количеството на работата, а разработчиците получават достъп до мащабируеми, вариращи набори от данни, подходящи за обучение на нишови или културноспецифични модели. Чрез комбинироване на blockchain прозрачност с социална роячна интелигентност, Alaya AI цели да направи AI данни потоци по-справедливи, следими и достъпни за по-малки отбори, които липсват на големи вътрешни ресурси за о标uchiване.
Разбивка на критериите
- Децентрализирана мрежа за събиране и отбелязване на данни
- Система за награди, базирана на токени и NFT
- Игрификованни задачи и изповеди на общността
- Роева интелигентност за разпределена анотация
- Поддръжка на разнообразни и нишови потребности за набори от данни
- Отслежване на приноса в веригата



