Pixtral 12B 24.09 logo

Pixtral 12B 24.09Otevřený multimodalní model 12B s 128K kontextovým oknem pro zpracování rozebraných obrazů a textů.

4.6 (5)
Daniel NikulshynRecenzováno Daniel Nikulshyn·Aktualizováno červenec 2026

Přehled

Pixtral 12B 24.09 je multimodální model od společnosti Mistral AI, který zpracovává obrázky i text v jedné sekvenci a podporuje různé velikosti a poměry stran obrázků. Využívá 12miliardový jazykový dekodér spojený s vizuálním enkodérem, což umožňuje úlohy, jako je vizuální otázková odpověď, porozumění dokumentům, interpretace grafů a popis obrázků. Model přijímá kontext až 128K tokenů, což umožňuje prokládat více obrázků s dlouhým textem v jednom příkazu. Vydáno pod otevřenou licencí, lze jej nasadit lokálně nebo prostřednictvím poskytovatelů inference, což jej činí vhodným pro vývojáře budující aplikace pro zpracování obrazu a jazyka, výzkumné workflow a multimodální agenty.

Klíčové funkce

  • 12B parametrní model vizíon-langsou
  • Rozebrané obraz a text vstupy
  • 128K token kontextová délka
  • Nativní podpora variabilních rozměrů obrazu
  • Otevřený weight release
  • Použitelnost pro OCR, VQA a kapce

Ceník

Model
Free
Kategorie
LLM
Hodnocení
4.6 / 5 (5)

Případy užití

Multimodální Logika

Pixtral 12B je schopný chápat jak přírodní obrázky, tak dokumenty a dosahuje nejlepších výsledků na MMMU logické benchmark a překračuje větší modely.

Pokyny k provedení

Pixtral 12B exceluje v pokrocích provedení, zvláště v multimodální a textově pouze případech, s relativní 20% zlepšením v IF-Eval a MT-Bench oproti nejbližším otevřeným zdrojům.

Multimodální Otázky a Odpovědi

Pixtral 12B ukazuje dobré schopnosti v multimodální otázkách a odpovědích, včetně otázek a odpovědí na dokumenty a pochopením grafů a obrazů.

Pro a proti

Pro

  • Otevřených weightů pro domácí nasazení
  • Zvládá více obrázků na jeden prompt
  • Větší 128K kontextové okno
  • Flexibilní obrazové rozlišení a poměry stran

Proti

  • Požaduje signifikantní zdroje GPU
  • Menší než hranice zavřených modelů
  • Omezená dostupnost nástrojů oproti propriedárním API

Rekord bitev

Ve 1 bitvě v Pantheonu.

0
1.
1
2.
0
3.

Last battle

Recenze

4.6

Průměr z 5 hodnocení.

5
3
4
2
3
0
2
0
1
0

Přihlas se, abys mohl napsat recenzi.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Otázky

Kolik obrázků a kolik textu mohu zahrnout do jednoho promptu?

Pixtral podporuje kombinované vstupy obrázků a textu v rámci jednoho kontextu o délce 128 K tokenů, což umožňuje libovolný počet obrázků (v jejich přirozeném rozlišení) spolu s dlouhým textem v jednom promptu.

Asked by Lorenzo Bianchi · Nov 20, 2025

Je Pixtral 12B stále udržován a existují novější alternativy?

Pixtral 12B je zastaralý a již není udržován; Mistral AI doporučuje používat své novější a výkonnější modely vizuálně‑jazykových modelů, které Pixtral nahrazují pro produkční použití.

Asked by Carlos Mendoza · Nov 10, 2025

Jaký hardware je potřebný pro efektivní běh Pixtral 12B?

Model vyžaduje značnou GPU paměť kvůli svým 12 miliardám parametrů a 400 M‑parametrovému vizuálnímu enkóderu; typické nasazení používá vysoce výkonné GPU (např. A100 40 GB nebo ekvivalentní) pro zvládnutí 128 K tokenového kontextu a více obrázků.

Asked by Ivo Novotný · Nov 6, 2025

Mohu si Pixtral 12B hostovat sami a pod jakou licencí?

Ano, Pixtral 12B je vydán pod licencí Apache 2.0 s otevřeným zdrojem, což vám umožňuje stáhnout váhy a spustit model lokálně na vlastním hardwaru.

Asked by Priya Nair · Oct 12, 2025

Polož otázku

Alternativy k LLM