Минала битка · 2025-02-07 UTC

Multimodal AI Двубой — 7 февруари 2025 г.

От категория Multimodal AI. 19 гласове поставени сред 5 бойци. Omniverse Audio2Face грабна короната.

Финално класиране

Съставът

Бойците

Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

1Omniverse Audio2Face logo

Omniverse Audio2Face

Уреди от NVIDIA за генерация на реално время с реално-time, синхронизиран с гласа 3D animation на лице

4.6 (5)
Freemium
Снимка на Omniverse Audio2Face

Характеристиката Omniverse Audio2Face е приложение на NVIDIA, което автоматично генерира 3D анимация на лицето от аудио източник. Използвайки предтрениран нейронен модел, тя анализира гласовата въвеждаща информация и управлява израженията на лицето, съответствието на устните движения и емоциите на 3D фигура в реално време, облекчавайки значително част от ръчната настройка на ключовите кадри, обичайна в анимационните линии за поток. Инструментът работи извъншно в NVIDIA Omniverse и поддържа извеждане до стандартизирани ДЦ платформи като Maya, Unreal Engine и Blender чрез формати като USD и blendshapes. Той работи с лични meshes на личности чрез retargeting workflow, което го прави полезен за開発ери на игри, аниматори, тимове за виртуален продъжване и създатели на цифрови хора или интерактивни аватарите. Омниверс Аудио2Фейс поддържа както офライン обработка за кинематографически работи, така и живи потоци за интерактивни приложения с променлива контрола на емоциите и обработка на аудио на множество езици.

Разбивка на критериите

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Фасиална анимация, която се управлява чрез дълбоко учене
  • Реално time лип синк и контрол на емоциите
  • Прикачване на личности към лични модели
  • Изходни пайплайни на съчетани облици и USD
  • Живи режим на поточна траслировка за интерактивни аватар
  • Поддръжка на множество езици за въведение на глас
2Humane AI Pin logo

Humane AI Pin

Острягъл помощник на интелектуалната машина, конструиран като екранна безплатна алтернативата на смуартфона.

4.5 (6)
Freemium

Устройството за човешки интелект Pin е малка, магнитно прикачена ношна устройства, което използва глас, мимика и лазерно-проектиран дисплей, за да предостави интеракции тип на асистент без традиционен екран. То се свързва с интегрирани камери, микрофони и датчици с големи модели за естествен процес на лого, за да отговори на въпроси, превежда езици, заснето изображение, сумарира съобщения и разпознава обекти в гледната област. Представен като уред за приобщаващ компютър, пинът има за цел да намали зависимостта от телефоните чрез показване на информация само когато нея се изисква. Той работи с собствена мрежова сметка вмъкната в плана, а не е привързан към смартфона, и поддържа командите в естественоезиков формат вместо приложения. Производството получи смесени оценки при старта си за batter life, latency и точност, и след това Умана се е справила с мярката на приоритетите си. Съществува въпреки това като значима рани изпитване в самостоятелно, AI-first изделие от носяма.

Разбивка на критериите

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Гласово контролиран помощник на интелектуалната машина
  • Палмово дисплей чрез лазерната инк проецкия
  • Обновяване на езика в реално време
  • Фотографски и кратки видеозаписи снимки
  • Различни обекти и сцени ролинг на контекст
  • Съхраняваща клетъчна данни с план
3Project Astra logo

Project Astra

Универсалната AI-агентност, която вижда, чува и прави умни изводи за световните реални-time

5.0 (4)
Freemium
Снимка на Project Astra

Програмата Астра е експериментален універсален асистент на AI от Гугъл ДийпМайнд дизайнирана да помага с ежедневните задачи чрез да разбира светът на същата начин как го разбират хората. Тя обработва видео, аудио и изображения и текст съвременно, което позволява на потребителите да показват камера или говорят естествено и да получават контекстно-озарявящи отговори, API, SDK и платформа по услуга SaaS. Сложена е на моделите Gemini от Гугъл, Астра е проектирана да поддържа ниски латенция за конвесионални взаимодействия с запомняще памет на последните контексти. Тя се представя като експериментален прототип, изследващ възможността как генерална агента също да може да работи на телефони, умни очила и други амбитни устройства. Това не е още публично достъпно произведение, но Астра показва посоката на Google за агентни АИ, които могат да наблюдават surroundings, да си припомнят, що са видели и да извършат полезни действия на съмнята на потребителя.

Разбивка на критериите

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs0
Reliability1
  • Умно разбиране на видео и картини
  • Гласов интерфейс за конверсация
  • Постоянна контекстуална памет
  • Мултимодален извод за текст, аудио и визуал
  • Обединение с семейството модели Gemini
  • Поддръжка за прототипи на умни очила и телефони
4H

Hume AI

Мъдростно осетилна гласова AI, която говори и слуша с многообразие, подобно на човешка нюанса

4.8 (4)
Freemium
Снимка на Hume AI

Системата Hume AI създава гласови и јазични модели създадени, за да интерпретират и отговарят на емоционални подсказки в човешкия говор. Наредният си Емпатичен Гласов Интерфейс (EVI) комбинира експресивна говореща синтеза с реално време анализа на тон, ритм и настроение, в резултат на което създава самостоятелни разговори, които изпитват също така емоцията, с обикновените гласови асистенти. Разработчиците могат да споделят способностите на платформата през API и SDK за да създават приложения в областите като психическа поддържка, клиентска служба, достъпност и интерактивно забавление. Платформата също предлага инструменти за изразяване на измеренията, които анализират емоционалните сигнали в гласовни данни, лица и езикове. Хюм се класира около ответствено разширяване, публикува изследване в областта на афективен компютър и се подчинява на етични насоки за използване на емоционална AI.

Разбивка на критериите

Ease of use1
Value for money0
Features & power0
Integrations1
Support & docs0
Reliability0
  • Емпатичен гласов интерфейс (EVI)
  • Изразно измерване из voice, face, и текст
  • Конфигурьониран гласов характер
  • Низко-затежен конверзационен поток
  • API и WebSocket API
  • Нормативи за этичената употреба и документация
5Alaya AI logo

Alaya AI

Web3 пазар на данни, свързващ разработчици на ИИ с глобални допринасящи лица чрез игрификованни стимули

4.8 (5)
Freemium

Alaya AI е децентрализирана платформа, която свързва разработчици на модели за изкуствен интелект с разпределени доставчици на данни чрез структура на Web3 общност. Тя се фокусира върху получаването на разнообразни, висококачествени тренировъчни данни за машинно обучение, като използва глобална мрежа от.contributorи, които маркират,.validate и подават набори от данни. Платформата използва геймификация, токени и NFT, за да мотивира участието, превръщайки събирането и анотацията на данни във захватващо занятие, а не в корек, и по този начин повишава качеството на резултатите. Сътрудниците получават награди в зависимост от качеството и количеството на работата, а разработчиците получават достъп до мащабируеми, вариращи набори от данни, подходящи за обучение на нишови или културноспецифични модели. Чрез комбинироване на blockchain прозрачност с социална роячна интелигентност, Alaya AI цели да направи AI данни потоци по-справедливи, следими и достъпни за по-малки отбори, които липсват на големи вътрешни ресурси за о标uchiване.

Разбивка на критериите

Ease of use0
Value for money0
Features & power0
Integrations1
Support & docs0
Reliability0
  • Децентрализирана мрежа за събиране и отбелязване на данни
  • Система за награди, базирана на токени и NFT
  • Игрификованни задачи и изповеди на общността
  • Роева интелигентност за разпределена анотация
  • Поддръжка на разнообразни и нишови потребности за набори от данни
  • Отслежване на приноса в веригата