過去のバトル · 2025-02-07 UTC
Multimodal AI 対決 — 2025年2月7日
Multimodal AIカテゴリーから。 5名の参戦者に19票が投じられました。 Omniverse Audio2Faceが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


Omniverse Audio2Faceは、音声入力を分析し、3Dキャラクターの表情、唇の合わせ込み、感情などのリアルタイムのアニメーションを生成することを目的とした、NVIDIAの製品です。この製品では、事前訓練された深層ニューラルネットワークを用いて、音声入力を分析し、リアルタイムで3Dキャラクターの表情、唇の合わせ込み、感情などのアニメーションを駆動することで、一般的なアニメーションパイプラインで使用されることが多い手動のキーフレーミングの手間を多く省くことができます。 アライアテエカモーヒは NVトアンストだたですざくつっのミーレネー合使帹を被ようだた ミーレネー合使帹を合んにだたをします? USD。ャッブエ ブエステエし、ブスブックを合んにだたです必項にちた、アタイバエドタイバはだた オムニバース オーディオ 2 フェイスは、シネマティック ワークやインタラクティブ アプリケーション用のリアルタイム ストリーミングをサポートしています。 オフライン のプロセッサとアダプティブ な感情のコントロール、 マルチ ラングワージュ の音声ハンドリングなど、柔軟な機能が備わっています。
評価基準の詳細
- a deep learningを利用した声音ドライヴされた顔面アニメーション
- リアルタイムの口唇同期・感情制御
- カスタムメッシュへのキャラクターテゲティング
- USDおよびブレンドシェイプ出力パイプライン
- ライブストリーミングモードで使用できる
- マルチリンガル声入力サポート

「Humane AI Pin」は、小型の磁気で取り付けられるウェアラブルデバイスで、ボイス、ジェスチャー、レーザープロジェクタディスプレイを用いて、シームレスなアシスタントスタイルで従来のディスプレイ無しでインタラクションができるデバイスです。端末内蔵のカメラ、マイクセンサーを、大きな言語モデルと組み合わせて、質問に答える、言語の翻訳、撮影、文章の要約、見える視界内のオブジェクトの検出をサポートします。 "Pinは、ユーザーが情報にアクセスするときのみに情報を提示することで、携帯電話の依存性を減らすことを目的としたオーディオ型コンピュータデバイスとしてマーケット化されています。 Pinは携帯電話のバンドルではなく独自の回線プランに依存しています。 また、自然言語コマンドのサポートでアプリに頼るのではなく、ユーザー操作を可能にします。" リリース当初、バッテリー・ライフ、遅延、精度面で賛否両論あった。その後、ハマネのロードマップが調整された。その成果は、従来のワイヤレスハードウェアでは無ければならない、独立したAIベースのウェアラブルハードウェアとしての初期実験のうちの一つとなって残る。
評価基準の詳細
- ボイスコントロールの AI アシスタント
- 手の平に発光するレーザーインクプロジェクションディスプレイ
- リアルタイムの言語翻訳
- 写真と短い動画の撮影
- 視覚領域内の認識
- スタンドアローンのセルラー データ プラン


**Projekuto Asutora**は、Google DeepMindによって開発された実験的なユニバーサルなAIアシスタントで、日常のタスクに協力するために世界を人と同じように理解しています。Video、Audio、イメージ、テキストを同時に処理できるため、そのカメラでポイントするか自然に話すことができるユーザーに、コンテキストに応じた反応を提供することができます。 "Project AstraはGoogleのGeminiモデルのバックボーンを持ち、低遅延による会話型インタラクションと、最近のコンテキストの永続的なメモリーを実現している。 また、これはスマートフォンやスマートグラス、他の周辺デバイスなどにわたって、普遍的なエージェントの実行を可能にする、研究プロトタイプとしての位置付けを担っている Astraはまだ一般向けの製品ではなく、グーグルの意図は環境に存在する状態を観測し、それを思い出しながら、ユーザーのために役立つアクションを起こすことができる、機械学習ベースのエージェント的なAIの方向性を示している。
評価基準の詳細
- ライブビデオとイメージの理解
- ボイスベースの会話インターフェイス
- 永続的なコンテキストメモリ
- テキスト、オーディオ、ビジュアルのマルチモーダル推論
- Geminiモデルファミリーと統合
- スマートグラスと携帯電話用のプロトタイプサポート

ヒューム・AIは、人間の言語に対する感情を解釈し、反応するために設計された声や言語モデルを開発しています。旗艦のエンパシティック・ボイス・インターフェイス( EVP: Empathic Voice Interface )は、音韻や感情をリアルタイムに分析し、高度なスピーチ・シンセシス機能と組み合わせたことで、一般的なボイスアシスタントとの会話と比べて、より自然な会話が可能になります。 開発者は、心の健康サポート、顧客サービスの支援、アクセシビリティ、インタラクティブエンターテインメントなど幅広い分野にアプリケーションを構築するためにAPIやSDKを通じてHumeの機能にアクセスすることができます。また、ボイス・フェイス・言語データ内の感情信号の分析に利用できる表現量測ツールの提供も行っています。 ハムAIでは、責任あるデプロイメントを軸に据え、感情認知論に関する研究報告書を公開し、感情AI利用に適した倫理ガイドラインに準拠している。
評価基準の詳細
- Empathic Voice Interface (EVI)
- 声、顔、テキストすべてで感情を測定する機能
- カスタマイズ可能な声パーソナリティ
- 低遅延会話ストリーミング
- RESTおよびWebsocket API
- 倫理的使用ガイドラインおよびドキュメント
Alaya AIは、Web3コミュニティ構造を通じてAIモデル開発者と分散データプロバイダーを結ぶデセントラライズプラットフォームです。これは、contributorが全世界から集まったデータセットをラベル付け、検証し 提出することで、分散的なデータ源から高品質の多様なトレーニングデータを取得することに重点を置いています。 このプラットフォームでは、ゲーム化、トークン、NFTを使ってパートナーのモチベーションを高め、データ収集および注釈の作業を楽しみにする活動に変える。コントリビューターは仕事の質と量に応じて報酬を獲得し、開発者はトレーニングのためのニッチまたは文化的に特定のモデルに適したスケーラブルで、バリエーションが豊富なデータセットにアクセスする。 ブロックチェーンの透明性とソーシャル・スワーム・インテリジェンスの組み合わせで、 Alaya AI は、自社内に大規模なラベル付け資源がないチームにも、AI データパイプラインをより公平に、追跡可能に、そしてアクセス可能にすることを目指しています。
評価基準の詳細
- 分散型データ収集およびラベル付けネットワーク
- トークンおよびNFTベースの報酬システム
- ゲーム化されたタスクおよびコミュニティチャレンジ
- 分散アンノテशनのスワーム知能
- 多様性のあるおよびナーシュなデータセットのサポート
- オンチェーンの貢献履歴のトラッキング




