Pixtral 12B 24.09 logo

Pixtral 12B 24.09Åpne multimodale 12B-modellen håndterer overlapped billed- og tekstinput med en kontekstvindu på 128K.

4.6 (5)
Daniel NikulshynAnmeldt av Daniel Nikulshyn·Oppdatert juli 2026

Oversikt

Pixtral 12B 24.09 er en multimodal modell fra Mistral AI som kan behandle både bilde og tekst innenfor en enkelt sekvens, støtter variabel størrelse og bildesiderat. Den bruker en 12 milliard-parameterners språkgjenger i kombinasjon med en visjonsdekoder, noe som gjør det mulig å utføre oppgaver som visuell spørresvar, dokumentforståelse, diagramanalyse og bildetekst. Modellen aksepterer opp til en kontekst på 128K tegn, noe som muliggjør å interlevere flere bilder med lang tekst i ett anrop. Den blir gitt ut under et åpent lisens, og kan deployes lokalt eller via infromasjonserleveranser, noe som gjør det egnet for utviklere som bygger visjons-lengses applikasjoner, forskningsflyt og multimodal agenter.

Nøkkelfunksjoner

  • 12B-parametrert visjons- og språkmodell
  • Overlapped billed- og tekstinput
  • 128K tegnet kontekstlengde
  • Innbygd støtte for variasjoner i bildesøringsstørrelse
  • Åpen vektutgivelse
  • Passende for OCR, VQA og kapitelframing

Priser

Modell
Free
Kategori
LLM
Vurdering
4.6 / 5 (5)

Brukstilfeller

Multimodalt rasjonering

Pixtral 12B er istandsatt til å forstå både naturlige bilder og dokumenter, og når et state-of-the-art resultat på MMMU-dominerende standard og overgår større modeller.

Instruksjonsutførelse

Pixtral 12B utmerker seg i instruksjonsutførelse, spesielt i multimodale og tekst-og-ene scenarier, med en 20% relativ forbedring i text-IF-Eval og MT-Bench over den nærmeste åpen-kilde modellen.

Multimodale spørresvar

Pixtral 12B viste sterke evner innen multimodale spørresvar, inkludert dokument spørresvar og grafiske forståelse og figur.

Fordeler og ulemper

Fordeler

  • Åpne vekter for selv-husning
  • Håndterer flere bilder per prompt
  • Stor kontekstvindu på 128K
  • Fleksible bildesøringsoppløsninger og forhold mellom bredder

Ulemper

  • Mangler signifikante GPU-resurser
  • Liten størrelse sammenlignet med fronter åpne modeller
  • Begrenset verktoy sammenlignet med proprietære APIs

Kamprekord

I 1 kamp i Panteon.

0
1.
1
2.
0
3.

Last battle

Anmeldelser

4.6

Gjennomsnitt fra 5 vurderinger.

5
3
4
2
3
0
2
0
1
0

Logg inn for å legge igjen en anmeldelse.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Spørsmål

Hvor mange bilder og hvor mye tekst kan jeg inkludere i en enkelt forespørsel?

Pixtral støtter vekselvis billed- og tekstinputt innenfor en enkelt 128 K token-kontekst, som tillater enhver antall bilder (i deres naturlige oppløsning) sammen med langformtekst i en forespørsel.

Asked by Lorenzo Bianchi · Nov 20, 2025

Er Pixtral 12B fortsatt vedlikeholdt, og er det nyere alternativer?

Pixtral 12B er avlegg og ikke lenger vedlikeholdt; Mistral AI anbefaler å bruke sine nyere, kraftigere visjon-språk-modeller som overtar Pixtral for produksjonsbruk.

Asked by Carlos Mendoza · Nov 10, 2025

Hva slags maskinvare er nødvendig for å kjøre Pixtral 12B effektivt?

Modellen krever betydelig GPU-minne på grunn av sine 12 milliarder parametre og 400 M-parameter visjon-encoder; typiske utrullinger bruker høyendelige GPU-er (f.eks. A100 40 GB eller sammenlignbare) for å håndtere 128 K token-kontekst og flere bilder.

Asked by Ivo Novotný · Nov 6, 2025

Kan jeg selv-værte Pixtral 12B, og under hvilken lisens?

Ja, Pixtral 12B er utgitt under Apache 2.0 åpen kilde-lisens, som lar deg laste ned vekter og kjøre modellen lokalt på din egen maskinvare.

Asked by Priya Nair · Oct 12, 2025

Still et spørsmål

Alternativer til LLM