지난 배틀 · 2026-04-23 UTC
Multimodal AI 대결 — 2026년 4월 23일
Multimodal AI 카테고리에서. 9개의 참가자에 걸쳐 44 표시가 배치되었습니다. AssiPilot이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

AssiPilot은 이미지, 비디오, 음성오버레이, 음악을 생성하는 데 도움을 주는 다재다능한 인공지능 보조 프로그램입니다. 사용자가 아이디어에 대한 설명을 차트 기반 인터페이스에서 입력하면 원하는 결과물이 자동으로 생성되는 것을 목표로 합니다. 어떤 분야에도 불구하고 크리에이터들을 위해 설계된 플랫폼은 전문가나 개인으로서 빠른 시간 내에 높은 질의 콘텐츠를 생산해야 하는 사람들을 위해 마련되었습니다. AssiPilot는 Flux로 이미지를 처리하는 것부터 Kling으로 비디오를 처리하는 것까지, voice에서 ElevenLabs를 처리하는 방법 등 다양한 AI 모델을 집약해 사용자에 대한 다양한 기능을 제공합니다. 이 과정을 위해 세 가지 주요 단계가 있습니다:_assiPilot_와 대화하여 원하는 콘텐츠를 설명하고, 적절한 도구를 선택하고, 출력을 생성하여 수정하는 단계입니다. 사용자는 하이 디펜던스(고해상도)로 내보내며 제작하신 콘텐츠의 상업적 권리를 보유하실 수 있습니다. AssiPilot의 기능으로 AI 이미지, 비디오, 음성, 음악 생성기가 있습니다. 플랫폼은 다중 모델 기능을 지원하여 사용자가 Cutting-Edge 기술에 접근할 수 있습니다. 또한 유기화된 워크플로우 도구, 지능형 프롬팅,과 클라우드 스토리지 기능을 제공합니다. AssiPilot 플랫폼에서, 천 명 이상의 크리에이터가 AssiPilot를 통해 1,000만 개 이상의 자산을 생성한 것으로 알려져 있습니다. 이 플랫폼은 사용자들이_workflow를 최적화하고 빠른 속도로 고품질의 콘텐츠를 생산할 수 있어서 긍정적인 피드백을 받은 것으로 나타났습니다.
평가 기준 분해
- AI
- AI
- AI

EmbedAI는 사용자가 본문으로 AI 챗봇을 만들 수 있는 no-code 플랫폼입니다. 사용자는 문서를 업로드할 수도 있고 웹사이트를 연결하거나 다른 데이터 소스를 연결하며, 플랫폼은 이러한 정보를 대화형 어시스턴트로 처리합니다. 이대화형 어시스턴트에 사용된 모델은 대규모 언어 모델(LLM)으로, ChatGPT와 유사합니다. 트레이닝을 완료한 대화봇은 웹 사이트에 코드 조각으로 임베딩하거나 독립적인 링크로 공유할 수 있습니다. 고객 지원, 내부 지식库, 리드 캡처, 및 이니셔티브한 제품 도큐먼트로 일반적으로 사용됩니다. 이로써 팀은 반복적인 질문을 줄이고 정보를 더 효율적으로 표출할 수 있습니다.
평가 기준 분해
- 사용자 Upload 데이터를 기반으로 사용자 지정 챗봇 훈련
- 웹사이트 및 문서 상호 운용
- 임베드 가능한 챗 위젯
- 공유 가능한 챗봇 링크
- ChatGPT 기술 기반 대화 답변
- 다중 소스 지식 베이스 지원


Magentic One은 Microsoft에서 개발한 연구 지향 다중 에이전트 프레임워크로서, 웹, 파일 및 코드를 포괄하는 열거형 복잡한 görev Handling을 가능케 한다. 주요 Orchestrator 에이전트는 계획, 위임 및 진행 추적을 담당하며, 웹 브라우징, 파일 탐색, 코딩 및 터미널 실행을 처리하는 특화된 에이전트들이 있다. AutoGen 프레임워크 위에 구축되어 연구원 및 개발자들이 자신의 분야에 맞게 확장 또는 적응 할 수 있는 모듈식 아키텍처를 제공한다. 그것은 반드시 성숙한 소비자 제품보다는 의도된 연구 목적으로 주행적 인 인공지능 시스템에 대한 기준점으로 간주된다. Magnetical One은 AutoGenBench라는 평가 하네스와 함께 제공됩니다. 이렇게 함으로써 팀은 표준화된 태스크에 대해 에이전트의 성능을 측정할 수 있으며, 다이내믹 모델 백본이나 에이전트 설정을 비교할 수 있습니다.
평가 기준 분해
- 플랜 및 görev 트래킹을위한 Orchestrator 요원
- 브라우저 기반 작업을위한 WebSurfer 요원
- 로컬 파일 탐색을위한 FileSurfer 요원
- 코드 작업을위한 Coder 및 ComputerTerminal 요원
- AutoGen 다항체프레임 워크에서 빌드
- AutoGenBench 통합을위한 검증


Together AI는 클라우드 플랫폼을 제공하여 생성적 AI 모델을 빌드, 미세 조정, 배포하는 것을 가능하게 합니다. 이 플랫폼은尖峰급 연구를 바탕으로 사용자들에 의해 가속화된 인플루언스, 모델 형성, 전원 및 최적화에 대한 미세 조정을 제공합니다. 플랫폼의 주요 특징에는 서버리스 inference, 배치 inference, 전용 모델 inference, 가속된 컴퓨팅, 샌드박스 및 관리 된 저장소가 있습니다. 또한 프로덕션 워크로드를위한 오픈 소스 모델을 조정하는 데 필요한 도구가 있습니다. 최신 연구 기술을 사용합니다. AI-나티브 클라우드라는 개념으로 개발되었습니다. AI 개발 생 涞에서 실험에서 대규모 규모까지 사용자들이 모든 단계를 지원합니다 . Together AI의 기능에는 향상된 추론 성능, 비용 절감, 그리고 더 빠른 사전 훈련이 포함됩니다. 플랫폼에는 에이전트 개발, 아키텍처, 미세 조정에 이르는 최신 연구 중심 커널과 도구를 담은 최신 연구 기술도 포함하고 있습니다.
평가 기준 분해
- 서버리스 추론
- 배치 추론
- 다진 모델 추론
- 배포된 컨테이너 추론
- 가속 컴퓨팅
- 사운드박스


Omniverse Audio2Face는 NVIDIA 어플리케이션으로, 음성 소스에서 3D 인상 애니메이션을 자동 생성합니다. 3D 캐릭터의 facial expression, lip sync, 및 감정을 분석하여 드라이브하는 전재 학습 된 심층 신경 네트워크를 사용하여, 실제 시간이 걸리는 동작으로, 애니메이션 파이프 라인에서 종종 필요 한 수동 키프레임의 대부분을 제거합니다. 다각 식용 Omni 안약 샰호이 2총에 사이샀울 10 먹 총각 주세요, 겁소식의 보석진 총에세요 다일우안의 뢣요. 식용사이세요 싹 삱 분용을조로 총에세요 번세요 아소주 우길안의 사이샀울 안 uc8fc하세요 총장탰해 분 문주 하세요. 총에세요 수지주 사이샀울 주세요 주세삤샀이 사이살네치 분안의 욠호시우안이 설장세요. 아디 오토 페이스(Audio2Face)는 영화 제작과 같은 오프라인 처리에 대한 지원뿐만 아니라, 인터랙티브 애플리케이션과 같은 라이브 스트리밍에도 최적화되어 있습니다. 추가적으로, 이 툴은 감정 조종 기능을 통해 감정을 조절하거나, 다언어 음원의 처리가 가능합니다.
평가 기준 분해
- 대상 학습 기반의 음향 기반 얼굴 애니메이션
- 실시간 입 맞춤 및 감정 제어
- 커스텀 메쉬에 맞는 캐릭터 리태겟팅
- 블렌드셰이프 및 USD 익수팅 파이프ライン
- 라이브 스트리밍 모드: 상호 작용되는 아바타
- 다언어 음성 입력 지원

AGiXT
평가 기준 분해
- API
- LLM
- Web UI REST API

블링크 AI는 사용자에게 즉시 제품 추천과 가격 비교를 제공하는 인공지능-powered 쇼핑 액세스ทร리입니다. 회호는 염세요 제소을 데촍 저시 보호는 샐잱의 총울 안녕칠 녕징 하세요사 안세요. 소비자들이 효율적이고 개인 맞춤형 쇼핑에 필요한 도움을 구할 수 있는 도구입니다. 블링크 AI는 사용자 쿼리가 프로세스 된 후 제품 정보베이스에 접근하고 제공된 정보에 대한 매치를 제공하는 방식으로 기능할 것으로 보입니다. " Blink AI 에서 Instant Shopping Guide를 통해 사용할 수 있는 표준적인 기능은 제품 추천 및 가격 비교의 속도 및 정확도라고 할 수 있습니다._workflow와_integration에 대한 구체적인 정보는 제공되지 않는다. 전통적인 쇼핑 방법 eller 다른 인공지능 쇼핑 도구와 비교할 경우, Blink AI는 즉각성 및 사용자 지정 추천을 중시합니다.
평가 기준 분해
- AI
- API
- SDK
- LLM
- SaaS
- API


Project Astra는 Google DeepMind에서 개발한 실험적 유니버설 AI 보조 프로그램입니다. 이 시스템으로는 일상적인 업무를 도와주는 것부터 시작하여, 사람들이 세상인 것을 그대로 이해하기 위해 노력하고 있습니다. Project Astra는 동시적 비디오, 오디오, 이미지, 텍스트 처리를 가능하게 하여 사용자들은 카메라를 향해 포인팅하거나 자연스럽게 말을하면 컨텍스트에 알맞은 반응을 받을 수 있습니다. 구글 Gemini 모델을 기반으로 개발된 Project Astra는 저-latency의 대화식 상호 작용과 최근의 맥락의 지속적인記憶를 지원합니다. 또한 일반목적 에이전트가 전화, 스마트 글라스, 그리고 다른 앰비언트 디바이스에 걸쳐서 실행할 수 있도록 하는 연구 프로토 타입으로 자리 잡고 있습니다. Astra는 공개된 제품이 아직 아니라지만, 사용자의 대신에 환경을 관찰하고 본 적이 있는 것을 기억하며 유용한 행동을 취하는 능동적인 AI에 대한 구글의 방향성을 표시한다.
평가 기준 분해
- 라이브 비디오 및 이미지 이해
- 보이스 기반 대화 인터페이스
- 영구적 의존적 기억
- 텍스트, 오디오, 및 시각 분야의 멀티 모델 논리
- 가미니 모델 패밀리와의 통합
- 智能眼鏡 및 전화에 대한 스마트 가속기 프로토콜


Wan 2.7은 이전의 Wan 2.6과 비교하여 시각적인 품질, 사운्ड, 동작, 스타일과 일관성을 끌어올리는 AI 비디오 및 이미지 생성 플랫폼입니다. 해당 플랫폼은 프롬프트나 이미지를 상업적으론 완료된 시각적인 콘텐츠로 변換시키기 위해 설계되었습니다. Wan 2.7은 비주얼 품질, 사운드, 동작 동적, 스타일화, 일관성을 향상시키는 5개의 주요 영역에서 비디오 생성을 개선했습니다. 해당 플랫폼은 다음 기능을 추가했습니다: 첫 프레임 및 마지막 프레임 생성, 9그리드 이미지-비디오, 주체 + 음성 참조, 명령에 의한 편집, 그리고 영상을 재창조합니다. 그것은 실인 사진 input, 최대 5 비디오 참조, 2-15 초 지속 기간 및 1080P 비디오 생성으로써 전문가 워크플로우에 적합합니다. 해당 플랫폼은 종단-끝 영상을 생성하는 및 편집하기 위해, 조정이 더 좋은 품질이 있습니다.
평가 기준 분해
- 첫 번째 프레임 및 마지막 프레임生成
- 이미지-비디오 9-Grid
- 주제 및 음성 참조
- 설문 기반 편집
- 영상 재구성
- 최대 5개 영상 참조











