#Multimodal
25 tools tagged “Multimodal”

엔드 투 엔드 데이터.Annotation 및 관리 플랫폼으로 AI 훈련 데이터 세트의 높은 품질을 보장하기 위한 솔루션입니다.

실시간 자연스러운 목소리 대화와 ChatGPT와의 대화

오픈 소스 VLM 에이전트를 통해 마우스/키보드 계획 및 실행을 통한 컴퓨터 GUI 제어.

xAI의 추론 기반 대화 봇에 대한 이미지를 생성하고 다중 입력 모드 지원

기기의 내부에서 작동하는 AI 런타임, 모바일, PC 및 엣지 하드웨어에 걸쳐 모델을 лок적으로 실행합니다.

실시간으로 세계를 볼 수, 들어볼 수, 그리고 이해할 수 있는 구글 딥마인드의 UNIVERSAL 인공지능 에이전트입니다.

온디바이스 및 엣지 AI 배포를 위한 단순한 시각-언어 모델

세계적인 AI 서비스를 위한 대규모 아랍어 LLM 구축을 위한 아랍에미리트의 지원을 받는 AI 회사입니다.

고해상도 이미지 생성 및 강력한 공간적 이해력, 정확한 텍스트 렌더링을 가진 멀티모달 AI 모델.

"AI 기계학습 분야에서의 선구적인 스타트업으로, 최첨단 생성 모델을 통한 이미지와 비디오 합성 분야에 전문화되어 있습니다.

호총려을 구좋일세요잫코 문음시 는싔범스 소습함세요

텍스트 또는 이미지에서 아트, 비디오, 오디오를 생성하는 창의적 인지 AI 플랫폼

멀티모달 입력과 140개 이상의 언어를 지원하는 오픈 소스 AI 모델,_single-GPU 성능 최적화

Z.ai의 오픈 소스 멀티 모달 GLM (4.6V) : 시각, 텍스트, 도구 호출을 통합한 장거리 사고, 검색, 코딩 및 UI-to-코드를 위한 멀티 모달 GLM

싱글 프롬프트에서 동기화된 오디오와 비디오를 생성하는 오픈 소스 모델

OpenAI가 개발한 텍스트, 코드, 이미지를 처리하는 멀티모달 언어 모델

open-source 이 있는 터미널 내에서 AI 가상 조언기가 코드를 읽고, 쓰고, 실행하는 멀티모달 입력을 지원합니다.

텍스트 입력, 이미지, 오디오를 통합하는 AI 비디오 생성기

코드없이 AI 소비자 플랫폼을 사용하여 AI 앱을 빌드, 공유 및 소유하세요.

실시간 멀티모달 음성 및 비디오 AI 에이전트를 구축하기 위한 오픈 소스 프레임워크입니다.

반응형 AI 애바타 에이전트를 활용해 시끌벅적한 디지털 경험을 만드세요

일체형 플랫폼 AI Voice-오버, 이미지, 비디오 생성

LMM-power드에 의해 제어되는 웹 에이전트가 실제 세계의 웹사이트와 상호 작용하여 사용자 지시를 종단-to-end로 완료하는 것

다중 모드 검색의 기반이 되는 Embedding, Re-ranking 및 RAG 파이프라인을 위한 기반

텍스트 또는 이미지를 입력하면 동기화된 오디오와 비디오를 생성할 수 있는 AI 창작 플랫폼