#Multimodal

25 tools tagged “Multimodal


SuperAnnotate interface preview
#1
SuperAnnotate

엔드 투 엔드 데이터.Annotation 및 관리 플랫폼으로 AI 훈련 데이터 세트의 높은 품질을 보장하기 위한 솔루션입니다.

4.4 (5)
2Freemium
OpenAI Advanced Voice interface preview
#2
OpenAI Advanced Voice

실시간 자연스러운 목소리 대화와 ChatGPT와의 대화

4.7 (6)
2Freemium
ScreenAgent interface preview
#3
ScreenAgent

오픈 소스 VLM 에이전트를 통해 마우스/키보드 계획 및 실행을 통한 컴퓨터 GUI 제어.

4.4 (5)
Freemium
Grok 2 interface preview
#4
Grok 2

xAI의 추론 기반 대화 봇에 대한 이미지를 생성하고 다중 입력 모드 지원

4.3 (4)
Freemium
Nexa AI interface preview
#5
Nexa AI

기기의 내부에서 작동하는 AI 런타임, 모바일, PC 및 엣지 하드웨어에 걸쳐 모델을 лок적으로 실행합니다.

4.8 (6)
Free
Project Astra interface preview
#6
Project Astra

실시간으로 세계를 볼 수, 들어볼 수, 그리고 이해할 수 있는 구글 딥마인드의 UNIVERSAL 인공지능 에이전트입니다.

5.0 (4)
Freemium
OmniVision interface preview
#7
OmniVision

온디바이스 및 엣지 AI 배포를 위한 단순한 시각-언어 모델

4.6 (5)
Freemium
Humain AI interface preview
#8
Humain AI

세계적인 AI 서비스를 위한 대규모 아랍어 LLM 구축을 위한 아랍에미리트의 지원을 받는 AI 회사입니다.

4.7 (6)
Contact
Uni-1 by Luma AI interface preview
#9
Uni-1 by Luma AI

고해상도 이미지 생성 및 강력한 공간적 이해력, 정확한 텍스트 렌더링을 가진 멀티모달 AI 모델.

4.7 (6)
Freemium
Black Forest Labs interface preview
#10
Black Forest Labs

"AI 기계학습 분야에서의 선구적인 스타트업으로, 최첨단 생성 모델을 통한 이미지와 비디오 합성 분야에 전문화되어 있습니다.

5.0 (6)
Freemium
Veo 4 interface preview
#11
Veo 4

호총려을 구좋일세요잫코 문음시 는싔범스 소습함세요

4.6 (5)
Freemium
OpenArt logo
#12
OpenArt

텍스트 또는 이미지에서 아트, 비디오, 오디오를 생성하는 창의적 인지 AI 플랫폼

4.7 (6)
Freemium
Gemma 3 interface preview
#13
Gemma 3

멀티모달 입력과 140개 이상의 언어를 지원하는 오픈 소스 AI 모델,_single-GPU 성능 최적화

4.8 (5)
Free
GLM-4.6V interface preview
#14
GLM-4.6V

Z.ai의 오픈 소스 멀티 모달 GLM (4.6V) : 시각, 텍스트, 도구 호출을 통합한 장거리 사고, 검색, 코딩 및 UI-to-코드를 위한 멀티 모달 GLM

4.3 (6)
Free
HappyHorse interface preview
#15
HappyHorse

싱글 프롬프트에서 동기화된 오디오와 비디오를 생성하는 오픈 소스 모델

4.7 (6)
Free
OpenAI GPT-4 interface preview
#16
OpenAI GPT-4

OpenAI가 개발한 텍스트, 코드, 이미지를 처리하는 멀티모달 언어 모델

4.5 (6)
Freemium
Codex CLI interface preview
#17
Codex CLI

open-source 이 있는 터미널 내에서 AI 가상 조언기가 코드를 읽고, 쓰고, 실행하는 멀티모달 입력을 지원합니다.

4.8 (5)
Free
LTX 2.3 Video Generator interface preview
#18
LTX 2.3 Video Generator

텍스트 입력, 이미지, 오디오를 통합하는 AI 비디오 생성기

4.5 (4)
Free
MyShell interface preview
#19
MyShell

코드없이 AI 소비자 플랫폼을 사용하여 AI 앱을 빌드, 공유 및 소유하세요.

4.8 (5)
Freemium
LiveKit Agents interface preview
#20
LiveKit Agents

실시간 멀티모달 음성 및 비디오 AI 에이전트를 구축하기 위한 오픈 소스 프레임워크입니다.

4.5 (6)
Freemium
Aivah interface preview
#21
Aivah

반응형 AI 애바타 에이전트를 활용해 시끌벅적한 디지털 경험을 만드세요

4.8 (4)
Freemium
Voice-gen.ai interface preview
#22
Voice-gen.ai

일체형 플랫폼 AI Voice-오버, 이미지, 비디오 생성

4.8 (4)
Free
WebVoyager interface preview
#23
WebVoyager

LMM-power드에 의해 제어되는 웹 에이전트가 실제 세계의 웹사이트와 상호 작용하여 사용자 지시를 종단-to-end로 완료하는 것

5.0 (5)
Freemium
Jina AI interface preview
#24
Jina AI

다중 모드 검색의 기반이 되는 Embedding, Re-ranking 및 RAG 파이프라인을 위한 기반

4.2 (5)
Free
Seedance 1.5 Pro interface preview
#25
Seedance 1.5 Pro

텍스트 또는 이미지를 입력하면 동기화된 오디오와 비디오를 생성할 수 있는 AI 창작 플랫폼

4.8 (5)
Paid