Korábbi csata · 2026-04-23 UTC
Multimodal AI Leszámolás — 2026. április 23.
A(z) Multimodal AI kategóriából. 44 jelölés elhelyezve 9 versenyző között. AssiPilot szerezte meg a koronát.
Végeredmény
A felállás
A versenyzők
Minden eszköz profilja, amely ebben a csatában versenyzett, a végső pontszámuk szerint rangsorolva.

AssiPilot
Mindenbe foglalt AI asszisztens a képek, videók, hangfelvételek és zene készítéséhez

AssiPilot egy mindenbe foglalt AI asszisztens, amely segít képek, videók, hangfelvételek és zene létrehozásában. A célja, hogy egyszerűsítse a kreatív folyamatot a felhasználók számára, chat-alapú felületet biztosítva, ahol leírhatják ötleteiket és a kívánt kimenetet kapják. Az platform a kreatív szakemberek és egyéni felhasználók számára készült, akik gyorsan és hatékonyan szeretnének magas színvonalú tartalmat előállítani. Az AssiPilot különböző AI modelleket egyesít, köztük a Flux-t a képekhez, a Kling-et a videókhoz és az ElevenLabs-ot a hanghoz, hogy a felhasználók széleskörű lehetőségeket kapjanak. A munkafolyamat három fő lépésből áll: beszélgetés az AssiPilot-tal a kívánt tartalom leírása, a megfelelő eszköz kiválasztása, és a kimenet generálása valamint finomítása. A felhasználók exportálhatják alkotásaikat high definition formátumban, és birtokosai lesznek a kereskedelmi jogoknak a saját tartalmaikra. Az AssiPilot funkciói közé tartozik AI kép generálás, AI videó létrehozás, Text-to-Speech hanggenerálás, AI zene komponálás. A platform támogatja a multi-model képességeket, lehetővé téve a felhasználók számára a legújabb technológia elérését. Emellett integrált munkafolyamat eszközöket, okos promptot és felhő alapú tárolást kínál. A platform szerint ezer kreatív már használja az AssiPilot-t, és több mint 1 millió eszközt generált. A felhasználók pozitív visszajelzéseket adnak, dicsérve a workflow gyorsítását és a magas színvonalú tartalom gyors előállítását.
Kritériumok szétosztása
- AI kép generálás
- AI videó létrehozás
- Text-to-Speech hanggenerálás
- AI zene komponálás
- Egységes alkotói irányítópult
- Prompt-alapú tartalomfolyamatok

EmbedAI
Felhúzható ChatGPT-szerű csevegőrobotok építése a saját adataikra és az ezeket akárhol elhelyezheti bárhová.

Az EmbedAI egy olyan platform, amelyen az AI-csevegőrobotok fejlesztésére olyan AI-tudományos modellszerkezetek segítségével, mint a ChatGPT használatával a felhasználó saját tartalmát dolgozó olyan platform, ahol a felhasználók okostömböket, weboldalakat vagy más adatszerverekhez kapcsolódnak, és ezen az információt olyan beszélgető asszisztens alapú platformba dolgozzák föl, amely nagy nyelvtudományos modellekből, mint például a ChatGPT. És egyeztetve a beszélgetőasszisztens egy webhelyre elhelyezhető egy rövid kódrészlet vagy másolható linkekként. Alapértelmezés szerint a leggyakrabban a személyes ügyfélszolgálatban, internális tudáskincskönyvtárakban, vezeték nélküli befektetési ügynökben és interaktív termék dokumentációk segítségével az egységesség csökkenti a ismétlődő kérdéseket és az információt gyorsabban átadja a csapataknak.
Kritériumok szétosztása
- Custom chatbot training on uploaded data - Felhasználó által feltöltött adatokra épülő custom csevegőbott-kiképzés
- Website and document ingestion - Weboldal és dokumentum feldolgozása
- Embeddable chat widget for any site - Bármely oldalra elhelyezhető csevegőwidget
- Shareable chatbot links - Megosztható csevegőrobot link
- ChatGPT-powered conversational responses - Beszélgetésalapon működő válaszok, melyeket a ChatGPT szolgáltatott
- Multi-source knowledge base support - Sokszereplős tudásalapú támogatás

Magentic One
Nyílt forráskódú, általános szakértői agensrendszer a komplex, többlépcsős feladatok megoldásához

A Magentic One egy kutatási célra kialakított, többügynöki keretrendszer, amelyet a Microsoft fejlesztett ki arra, hogy nyílten megfogalmazott, összetett feladatokat szállíthasson, amelyek a weben, a fájlokban és a kódban terjednek szét. A vezető Orchestrator ügynök tervezi meg, delegálja és követi nyomon végig a haladást, míg szakosodott ügynökök kezelik a webes böngészést, a fájlon belüli navigációt, a kódolást és a terminálvégrehajtást. Az AutoGen keretrendszeren alapuló Magentic One moduláris architektúrát kínál, amelyet kutatók és fejlesztők könnyen bővíthetnek vagy alkalmazhatnak saját területükön. Célja, hogy alapul szolgáljon a szerzett öntudatú számítógépes rendszerek tanulmányozásához ahelyett, mint hogy fogyasztói termékként polirja fel. A Magentic One termék befele egy értékelő szegmenszel (AutoGenBench) érkezik, amivel a csapatok a modell visszaalapokától vagy ügynök konfigurációktól függetlenül képesek szoftveres benchmarket véghez vinni, és különböző modell alapokat vagy ügynök konfigurációkat összehasonlítani.
Kritériumok szétosztása
- Tervezési és feladatnyomon követő vezérlői agent
- Websurfer agent webalapú tevékenységekhez
- Filerfer agent helyi fájlkezeléshez
- Kód és Computer Terminal agentek kódosítási feladatokhoz
- Az AutoGen multi-agens keretrendszeren alapul
- Az AutoGenBench integráció értékeléshez

Together AI
Egy felhőalapú platform, amely eszközöket kínál generatív AI-modellek létrehozására, finomhangolására és üzembe helyezésére fokozott teljesítménnyel és költséghatékonysággal.

A Together AI egy claudert kínál az építéshez, finomhangolásához és az alkalmazáshoz generatív AI modellekhez. A platform, amely hatékonyan bekapcsolja a kutatásokat, lehetővé teszi a felhasználóknak a terhelés-specifikus optimalizálással gyorsított prediktív végrehajtást, modellek kialakítását és pre-tréninget. A platform kulcsfontosságú vonalvezetőségi részei közé tartozik a szerver nélküli inverció, tömeges inverció, dedikált modell inverció, felgyorsított számítás, sandbox, és menedzselt tárhely. Továbbá, vannak olyan eszközök, amelyek lehetővé teszik a nyílt forrású modellek finomhangolását termelési terhelésekhez, a legújabb kutatási technikák használatával. A platform az AI-népszerű felhőalapú elképzelésen épül, amely lehetővé teszi a felhasználóknak, hogy hajtsák végre az AI fejlesztési útját az kísérletezéstől a nagyszámú méretekig. A Together AI képességei magasabb referencia teljesítményt, csökkentett költségeket és gyorsabb pré-trainelést tartalmaznak. A platform a kutatásból kiinduló, élvonalbeli kernel-okat és eszközöket tartalmaz fejlesztési ügynök, architektúra és finomhangolásért.
Kritériumok szétosztása
- Szerver nélküli következtetés
- Kötegelt következtetés
- Dedikált modellkövetkeztetés
- Dedikált tárolókövetkeztetés
- Gyorsított számítás
- Homokozó

Omniverse Audio2Face
NVIDIA azon AI-jelentőségű eszköze a valós idejű, hang-szinkronizált 3D arcánimáció generálásához

Az Omniverse Audio2Face egy NVIDIA alkalmazás, amely automatikusan generál 3D arcviszonylagos animációt egy audio forráshoz. Egy beaktaultatásos neuronális hálózat használatával elemzi a hangbemenetet, és irányítja az arckifejezést, a szájmozgást és az érzelmeket egy 3D szereplőben valós időben, nagyrészt megszünteti az animációs folyamatokban gyakran alkalmazott manuális kulcsszinkronizálások nagy részét. A eszköz a NVIDIA Omniverse-ben fut, támogatja az exportálást a standard DCC platformokra, mint például a Mayara, a Unreal Engine, a Blenderre az USD és a blendshape-formátumokon keresztül. Egy custom karakterhálót kezelő re-targeting folyamaton dolgozik, így hasznos a játékkészítőknek, animációs művészeknek, virtuális produkciós csapatoknak és alkotóknak, akik digitális embereket vagy interaktív avatarokat készítenek. Az Audio2Face támogatja az offline feldolgozást a filmes munkákhoz és élő streamelést az interaktív alkalmazásokhoz, különálló érzelemvezérléssel és több nyelv támogatásával a hanganyaghoz.
Kritériumok szétosztása
- A hang által is vezérelt arc kifejezései a mély tanulás használatával
- Real-time ajkaszinkronizáció és érzelem kontroll
- A karakterek kiosztása egyedi mesh-ekre
- Blendshape és USD export folyamatok
- Live streaming módszer az interakcióhoz szánt avatarok számára
- Több nyelvű hang bevitel támogatása

AGiXT
Nyílt forráskódú AI ügynökkeretrendszer adaptív memóriával és bővíthető pluginekkel a komplex feladatok automatizálására.

Az AGiXT egy nyílt forráskódú AI ügynökkeretrendszer, amely segítségével komplex feladatok automatizálhatók adaptív memóriával és bővíthető pluginekkel. A felhasználók egy úgynevezett AI ügynököt állíthatnak fel egy customizálható személyiségű, területterületet megadva, valamint memóriával. A keretrendszer támogat különféle dokumentumokat az edzéshez, beleértve a PDF-et, a Word-t, a Text-et, a Markdown-et, a CSV-t, a JSON-ot és az Excel-t is. A felhasználók chat interface-en keresztül kommunikálhatnak az ügynökkel, és az ügynök megtanulhat a biztosított dokumentumokról és URL-ekről. }
Kritériumok szétosztása
- Légrövidebb ideig fennálló memória
- Plugin- és a hozzáadási környezet
- Tökéletes LLM-támogatás több szolgáltatóval, beleértve a helyi modelleket is
- Custom prompt és lánckezelés
- Web UI és REST API
- Autonóm ügynökkel történő feladatautomatizálás

Blink AI: Your Instant Shopping Guide
Instant shopping útmutatóval rendelkezik: AI-szerkesztő ajánlataink és árösszehasonlítások.
A Blink AI egy mesterséges intelligencia-vezérelt bevásárlósegéd, amely azonnali termékleírásokat és árösszehasonlításokat nyújt a felhasználóknak. Célja, hogy egyszerűsítse az online vásárlás élményét azzal, hogy gyorsan releváns termékeket javasol a felhasználók bemeneti adatai vagy preferenciái alapján. Az eszközt olyan fogyasztók számára tervezték, akik hatékony és személyre szabott bolti segítséget keresnek. A Blink AI valószínűleg úgy működik, hogy feldolgozza a felhasználói lekérdezéseket, hozzáfér egy termékek adatbázisához, majd a megadott információk alapján ajánlja a találatokat. Egyik kiemelkedő képessége látszólag a termékmegjelenítés és az árösszehasonlítás sebessége és pontossága, noha a munkafolyamata és integrációi pontos részletei nem állnak rendelkezésre. A hagyományos vásárlási módszerekhez vagy más AI vásárlóeszközökhez képest a Blink AI az azonnaliságra és a felhasználó-specifikus ajánlásokra fókuszál.
Kritériumok szétosztása
- AI-felszerelt termékjavaslatok
- Sok eladó árösszehasonlítása azonnali
- Személyre szabott bolti segédlet
- Szintén gyors kerestetek általános kategóriákban
- Ügyfélalkudás felszínére hozása és értékesítési kedvezmények felleltje
- Soros vásárlási döntéshálózat átszervezése

Project Astra
A Google DeepMind által fejlesztett univerzális mesterséges intelligencia-agyunk, ami érzékeli, hallja, és a világot a valós időben értelmezi.

A Project Astra egy kísérleti, általános AI-asszisztens a Google DeepMindtől, amely segítségnyújtást nyújt az egyedüli napközismert feladatokhoz azáltal, hogy megérti a világot úgy, ahogyan az emberek teszik. Képeket, hangfelvételt, videót és szöveget feldolgozva egyszerre, lehetővé teszi a felhasználóknak, hogy egy kamerát mutassanak vagy természetesen beszéljenek, hogy érzékeny kontextusú válaszokat kapjanak. Az Astra a Google Gemini modeljei alapján készül, tervezett az alacsony késleltetésű, konverzacionális interakcióhoz biztosított tartós memóriával a nagyon közel körülemet tartó kontextusnak. Pozicionálják az algoritmusfejlesztési prototípusnak, ami megvizsgálja azt, hogyan lehetett volna egyáltalán általános célú ügynök futtatása is telefonok, okos napszemüvegek, egyéb szobai eszközökön egy idővel. Bár a terméket még nem kínálják közönségnek, a Project Astra jelzi, hogy a Google mely irányba halad az agilis AI-vel kapcsolatban, az lehetővé teszi a környezet figyelmében, az emlékezésre, amit láttunk, és olyan hasznos cselekedeteket tegyen egy felhasználó érdekében.
Kritériumok szétosztása
- Élő videó- és képrendszer
- Hangszerű beszélgetési interfész
- Tartós kontextuális emlékezet
- Az erősített érzékszervi észlelés az erősített multimodális észlelés központjában van
- Az összefogás a Gemini modell családdal
- Támogatás a smart glasses és phone eszközök számára

Wan 2.7
Egy AI-ken egyszerű videók és képek generáló platform a képesítések vagy képek gyors és kereskedelmileg készen álló vizuális tartalmává tételéhez.

A Wan 2.7 az AI videó és képregeneráló platform, amely a szülőplatformhoz képest feljavítja a vizuális minőséget, a hangot, a mozgást, a stilizmust és a következetességet. A platform öt kulcsfontosságú területen javítja a video generálást: vizuális minőség, hang, mozgási dinamika, stilizálás és következetesség. A Wan 2.7 új funkcionalitást hoz el, mint például a first-frame és last-frame generálás, a 9-sávos image-to-video, a subject plus hanghűség, a módszer alapú szerkesztés és a video származtatás. Támogatja az igazi személyek által generált képpel való bevitelt, a maximális 5 videotáskapcsolóval és a 2-15 másodperces tartamú video generálást 1080P minőségben, ezzel alkalmasvá téve a szakmai folyamatokra.A platform végső sorban a számtól a végzet videó megalkotására és szerkesztésére szolgál, a jobb ellenőrzés és minőség megadásával.
Kritériumok szétosztása
- First-frame és last-frame generálás
- 9-sávos image-to-video
- Subject plus hanghűség
- Mód alapú szerkesztés
- Video reprodukció
- Legfeljebb 5 videotáskapcsoló








