
Pixtral 12B 24.09Otevřený multimodalní model 12B s 128K kontextovým oknem pro zpracování rozebraných obrazů a textů.
Přehled
Klíčové funkce
- 12B parametrní model vizíon-langsou
- Rozebrané obraz a text vstupy
- 128K token kontextová délka
- Nativní podpora variabilních rozměrů obrazu
- Otevřený weight release
- Použitelnost pro OCR, VQA a kapce
Ceník
- Model
- Free
- Kategorie
- LLM
- Hodnocení
- 4.6 / 5 (5)
Případy užití
Multimodální Logika
Pixtral 12B je schopný chápat jak přírodní obrázky, tak dokumenty a dosahuje nejlepších výsledků na MMMU logické benchmark a překračuje větší modely.
Pokyny k provedení
Pixtral 12B exceluje v pokrocích provedení, zvláště v multimodální a textově pouze případech, s relativní 20% zlepšením v IF-Eval a MT-Bench oproti nejbližším otevřeným zdrojům.
Multimodální Otázky a Odpovědi
Pixtral 12B ukazuje dobré schopnosti v multimodální otázkách a odpovědích, včetně otázek a odpovědí na dokumenty a pochopením grafů a obrazů.
Pro a proti
Pro
- Otevřených weightů pro domácí nasazení
- Zvládá více obrázků na jeden prompt
- Větší 128K kontextové okno
- Flexibilní obrazové rozlišení a poměry stran
Proti
- Požaduje signifikantní zdroje GPU
- Menší než hranice zavřených modelů
- Omezená dostupnost nástrojů oproti propriedárním API
Rekord bitev
Ve 1 bitvě v Pantheonu.
Last battle
Recenze
Průměr z 5 hodnocení.
Přihlas se, abys mohl napsat recenzi.
Does the job
Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.
Does the job
Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.
Years in this space
I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Otázky
Kolik obrázků a kolik textu mohu zahrnout do jednoho promptu?
Pixtral podporuje kombinované vstupy obrázků a textu v rámci jednoho kontextu o délce 128 K tokenů, což umožňuje libovolný počet obrázků (v jejich přirozeném rozlišení) spolu s dlouhým textem v jednom promptu.
Asked by Lorenzo Bianchi · Nov 20, 2025
Je Pixtral 12B stále udržován a existují novější alternativy?
Pixtral 12B je zastaralý a již není udržován; Mistral AI doporučuje používat své novější a výkonnější modely vizuálně‑jazykových modelů, které Pixtral nahrazují pro produkční použití.
Asked by Carlos Mendoza · Nov 10, 2025
Jaký hardware je potřebný pro efektivní běh Pixtral 12B?
Model vyžaduje značnou GPU paměť kvůli svým 12 miliardám parametrů a 400 M‑parametrovému vizuálnímu enkóderu; typické nasazení používá vysoce výkonné GPU (např. A100 40 GB nebo ekvivalentní) pro zvládnutí 128 K tokenového kontextu a více obrázků.
Asked by Ivo Novotný · Nov 6, 2025
Mohu si Pixtral 12B hostovat sami a pod jakou licencí?
Ano, Pixtral 12B je vydán pod licencí Apache 2.0 s otevřeným zdrojem, což vám umožňuje stáhnout váhy a spustit model lokálně na vlastním hardwaru.
Asked by Priya Nair · Oct 12, 2025
Polož otázku
Alternativy k LLM

Napěťový bríf rozhraní LLM sjednocuje 1000+ modelů za jediný API.

Další generace AI modelu s důrazem na rozpoznání - DeepSeek R2

Otevřený mixture-of-experts model oferející GPT-4 úroveň rozumnosti za fraction ceny.

Konverzační AI od xAI navržená pro rozumnění, výzkum a reakce v reálném čase.

Metaův otevřený multijazyčný LLM optimalizován pro efektivní generaci kvalitní textové produkce.

Výkonný AI-převodník MP3 do textu pro přeměnu audio do čitelných přepisů.

Otevřený zdroj velkého jazykového modelu excelujícího v logických úlohách, matematice a kódování s MIT licencí pro bezplatné použití a modifikace.

OpenAIův model zaměřený na rozumné myšlení, navržený pro komplexní, multi-krokové problémy.
Trending now

Přesné domácí úkoly s vysvětlením

Inteligentní dokumentová API, které rozpoznává, rozděluje, převede na text a extrahuje strukturovaná data z komplexních dokumentů PDF, prezentací a-tabulkových formulářů.

Sponzorované odpovědi, platba za klik

Významná platforma pro agenty automatizace procesů, využívající samoúčelných AI agentů pro streamline procesů v různých odvětvích.
