Pixtral 12B 24.09 logo

Pixtral 12B 24.09Odprti multimodalni 12B model, ki obravnava mešane slike in besedilo z oknom konteksta 128K.

4.6 (5)
Daniel NikulshynPregledal Daniel Nikulshyn·Posodobljeno julij 2026

Pregled

Pixtral 12B 24.09 je multimodalni model podjetja Mistral AI, ki znotraj enega zaporedja obdeluje tako slike kot besedilo, pri čemer podpira različne velikosti in razmerje stranic slik. Uporablja dekodirnik jezika z 12 milijardami parametrov, povezan z vizualnim enkoderjem, kar omogoča naloge, kot so vizualno odgovarjanje na vprašanja, razumevanje dokumentov, interpretacija grafov in opisovanje slik. Model sprejme kontekst do 128 K tokenov, kar omogoča, da se več slik prepletajo z dolgim tekstom v enem promptu. Izdan je pod odprto licenco, zato se lahko namešča lokalno ali preko ponudnikov inferencije, kar ga naredi primernega za razvijalce, ki gradijo vizualno-jezikovne aplikacije, raziskovalne delovne tokove in multimodalne agente.

Ključne funkcije

  • 12B parametriški vizualno-jezikovni model
  • Mešani vnos slik in besedila
  • 128K tokenov dolžine konteksta
  • Nativna podpora za spremenljiv velikost slike
  • Izdaja z odprtimi težami
  • Primeren za OCR, VQA in opisovanje slik.

Cene

Model
Free
Ocena
4.6 / 5 (5)

Primeri uporabe

Multimodalno sklepanje

Pixtral 12B je sposoben razumeti tako naravne slike kot dokumente, doseganje najboljših rezultatov na benchmarku MMMU in presega večje modele.

Sledenje navodilom

Pixtral 12B izstopa v sledenju navodilom, zlasti v multimodalnih in izključno besedilnih scenarijih, z 20% relativnim izboljšanjem v besedilni IF-Eval in MT-Bench v primerjavi z najbližjim odprto-izvorom modelom.

Multimodalno odgovarjanje na vprašanja

Pixtral 12B kaže močne sposobnosti v multimodalnem odgovarjanju na vprašanja, vključno z odgovarjanjem na vprašanja o dokumentih ter razumevanjem grafikonov in figur.

Prednosti in slabosti

Prednosti

  • Odprte težave za samostojno gostovanje
  • Obravnava več slik na zahtevo
  • Veliko okno konteksta 128K
  • Prilagodljive ločljivosti slik in razmerne proporcije.

Slabosti

  • Zahteva znatne GPU vire
  • Manjši od naprednih zaprtega modela
  • Omejena orodja v primerjavi s lastništvenimi API-ji.

Rekord bitk

V 1 bitki v Panteonu.

0
1.
1
2.
0
3.

Last battle

Ocene

4.6

Povprečje iz 5 ocen.

5
3
4
2
3
0
2
0
1
0

Prijavi se za oddajo ocene.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Vprašanja

Koliko slik in koliko besedila lahko vnesem v enotno pobudo?

Pixtral podpira vložene slikovne in besedilne vnosnosti znotraj enega 128 K konteksta, kar omogoča poljubno število slik (v njihovem naravnem razmerju) ob dolgih besedilnih pobudah v eni pobudi.

Asked by Lorenzo Bianchi · Nov 20, 2025

Ali je še vedno vedno vzdrževan in ali je tudi boljših alternativ?

Pixtral 12B je opuščen in že ne več podpiran; Mistral AI priporoča uporabo svojih novih, močnejših vidno jezikovnih modelov, ki nadgradnijo Pixtral za proizvajalske namene.

Asked by Carlos Mendoza · Nov 10, 2025

S katerimi napravami morat se uporabljati, da bi lahko Pixtral 12B deloval učinkovito?

Model zahteva velik spominski prostor v grafični karti zaradi njemu 12 milijard parametrov in 400 milijonov parametrov vidnega koda; pogostnost uporabe se začne s visokorazrednimi grafičnimi karticami (npr A100 40 GB ali podobno).

Asked by Ivo Novotný · Nov 6, 2025

Ali lahko samostojno gostujem Pixtral 12B, in pod katero licenco?

Da, Pixtral 12B je razvito pod licenco Apache 2.0 otvorene kodo in je dovoljeno, da si prejmeš težave in ga izvršuješ na lokalno napravo samega teba.

Asked by Priya Nair · Oct 12, 2025

Postavi vprašanje

Alternative za Modul za učenje odločitev v globinskem učenju (LLM)