Минула битва · 2025-02-07 UTC
Multimodal AI Протистояння — 7 лютого 2025 р.
З категорії Multimodal AI. 19 позначок поставлено серед 5 бійців. Omniverse Audio2Face здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

Omniverse Audio2Face
Інструмент NVIDIA на основі ШІ для створення анімації 3D облич у реальному часі зі синхронізацією голосу

Omniverse Audio2Face є застосуваннями NVIDIA, яке автоматично генерує анімацію обличчя в простір у 3D від джерела аудію. Використовуючи попередньо навчену глибинну мережу neuron, воно аналізує вхідне голосове повідомлення та керує експресією обличчя, синхронізуються губ та емоціями 3D-характера у реальному часі, видаляючи велику частину ручної встановлювання ключових кадрів, які мають місце в традиційних кінематографічних процесах. Інструмент працює всередині NVIDIA Omniverse та підтримує експорт у стандартні платформи ДCC, такі як Maya, Unreal Engine та Blender, через формати, такі як USD та blendshapes. Він працює зі спеціалізованими мережами meshes Characters за допомогою процесу перекиду, що робить його корисним для розробників ігор, мультиплікаторів, команд віртуальної виробництва та творців цифрових гуманітарних робіт чи інтерактивних аватарів. Audio2Face підтримує як безперервне оброблення даних для кінематографічних робіт, так і потік даних в режимі реального часу для інтерактивних застосунків, із регулюванням рівня емоцій та підтримкою декілька мов.
Розподіл критеріїв
- Анімація обличчя на основі аудіо за допомогою глибокого навчання
- Синхронізація губ та керування емоціями в реальному часі
- Ретаргетинг персонажів на користувацькі сітки
- Канали експорту Blendshape та USD
- Режим трансляції в реальному часі для інтерактивних аватаров
- Підтримка багатомовного голосового введення

Humane AI Pin
Повний комп'ютерна система для розуміння, яка працює без екранного інтерфейсу.
Humane AI Pin є компактним пристрій для носіння, який встановлюється на поверхню за магнітною взаємодією. Він використовує мову, жести та проєкцію світлового дисплея для надання взаємодій типу особистого помічника без класичної екранної навігації. Він поєднує встановлені камери, мікрофони та сенсори з великими мовними моделями для відповідей на запитання, перекладу мов, захоплення фотографій, підсумовування повідомлень та розпізнавання предметів у полі зору. Продукований як пристрій ампіантних計算ів, Pin спонукає до зниження залежності від смартфонів, надаючи інформацію тільки тоді, коли вона потрібна. Він працює зі своїм індивідуальним смартфонним планом, замість зв'язку зі смартфоном і підтримує природно-мовні команди, замість застосунків. Продукт отримав змішані відгуки при виході на ринок з питань тривалості роботи батареї, затримок та точності, а Humane з тих пір змінила свій розробничий план. Цілком істотно він залишається своєрідним експериментом з початку в розробці самодостатнього однотарного вбудованого програмно-технічного засобу (AI-first wearable hardware).
Розподіл критеріїв
- Відповідність голосовим командам
- Проєкція лазерної друкарської технологією на ладонь
- Переклад мови в режимі реального часу
- Захоплення фотографій та коротких відеороликів
- Виявлення об'єктів та сцен в режимі реального часу
- Індивідуальний мобільний план

Project Astra
Універсальний AI‑агент Google DeepMind, що бачить, слухає і розуміє світ у реальному часі.

Праект Астра являє собою експериментальний всебічний штучний інтелект асистент від Google DeepMind, призначений для надання допомоги при виконанні кожного дня завдань шляхом розуміння світу тією ж самою метою, з яким розуміють їх люди. Він обробляє відео, аудіо, зображення та тексти одночасно, дозволяючи користувачам вказувати камерою або розмовляти природно, отримуючи відповіді, що розуміли контекст. Розроблений на основі моделей Gemini Google, Астра запропонована із метою низької затримки, взаємодії з розмовного типу з збереженням пам'яті останніх повідомлень контексту. Він розгортований як дослідницький прототип, який досліджує можливості створення загального призначення агента, який міг би виконувати роботу на телефонах, окулярах смарт і інших застиглих пристроях. Хоча продукт досі не доступний для загального використання, Project Astra вказує на напрямок Google у створенні агентного AI, який може спостерігати своє оточення, відновлювати спогади про те, що бачив раніше та брати дієві дії замість користувача.
Розподіл критеріїв
- Розуміння живого відео та зображень
- Розмовний інтерфейс на основі голосу
- Постійна контекстна пам'ять
- Мультимодальне розуміння тексту, аудіо та візуальних даних
- Інтеграція з сімейством моделей Gemini
- Підтримка прототипу для смарт-оглядів і телефонів

Hume AI розробляє голосові та мови моделі, призначені для інтерпретації та відповіді на емоційні імпульси в людській мові. Її основна Empathic Voice Interface (EVI) поєднує експресивний синтез мови з реал-тайм-аналізі тональности, інтонації та настрою, що дозволяє здійснювати переговори, які відчувають більш natürlichі ніж звичайні голосові асистенти. Википедисти мають доступ до можливостей Hume через API та SDK для створення застосунків в областях, такі як підтримка фізичної та психічної здоров'я, клієнтська служба, доступність та інтерактивне розвагування. Платформа також пропонує інструменти вимірювання виразу для аналізу сигналів емоцій у даних мови, обличчя та мови. Hume позиціонує себе навколо відповіємого розгортання, публікує дослідження щодо комп'ютерного аналізу емоцій та дотримується етичних принципів щодо використання інтелектуальної системи для обробки емоцій.
Розподіл критеріїв
- Емпатичний інтерфейс голосового розмови (EVI)
- Оцінка вираження на основі голосу, обличчя та мови
- Підлаштовувані особистості голосів
- Бічна струменя інформаційний потік розмов
- Прив'язка до інтерфейсів API і WebSocket
- Етичні рекомендації та документація щодо використання емоційної AI

Alaya AI
Мережа даних Web3, яка сполучає розробник-інтелектуальну зброю з глобальним співробітником шляхом відігрувальних мотивів.
Alaya AI — це деценталізована платформа, яка поєднує розробників моделей штучної інтелекту з розподіленими джерелами даних за допомогою структури спільноти Web3. Вона зосереджена на отримання багатовидових, високоякісних даних для навчання машинним навчанням шляхом відтінювання глобальної мережі учасників, які ідентифікують, підтверджують та надсилають набори даних. Платформа використовує гейміфікацію, токени та NFT для мотивації учасників, перетворюючи збір даних та їх орієнтування на захватливу діяльність замість обов'язку. Учасники відзначають нагороди на основі якості та об'єму своїх робіт, тоді як розробники отримують доступ до масштабованих різноманітних наборів даних, придатних для тренування спеціалізованих або культурно специфічних моделей. Інтегруючи прозорість блокчейна з соціальним збирачним інтелектом, Alaya AI має за мету зробити мережеві дані штучного інтелекту більш рівними, трасовані та доступними для більш малих команд, які відчувають відсутність великих внутрішніх ресурсів підписання.
Розподіл критеріїв
- Децентралізована мережа збірки даних і маркування
- Діяльність за допомогою токенів і NFT
- Система завдань і спільних викликів для підвищення рівня захоплення
- Загальне розуміння зі створення розподілених завдань
- Підтримка різноманітних та особливих вимог щодо даних
- Надання на шанці відмітки співробітників



