Pixtral 12B 24.09 logo

Pixtral 12B 24.09Öppen multimodel med 12B parametrar som hanterar interleaved bilder och text med ett 128K kontextfönster.

4.6 (5)
Daniel NikulshynGranskat av Daniel Nikulshyn·Uppdaterad juli 2026

Översikt

Pixtral 12B 24.09 är en multimodal modell från Mistral AI som behandlar både bilder och text inom en enda sekvens, med stöd för variabel bildstorlek och bildformat. Den använder en 12-miljardspARAMETRAR-stor språkavkodare ihop med en synkoder, vilket möjliggör uppgifter som visuell fråga-svar, dokumentförståelse, diagramtolkning och bildbeskrivning. Modellen accepterar en kontext på upp till 128K token, vilket möjliggör att flera bilder kan interleavas med lång text i en enda fråga. Utgivet under en öppen licens kan det distribueras lokalt eller via inferensleverantörer, vilket gör det lämpligt för utvecklare som bygger syn- och språkbaserade tillämpningar, forskningsflöden och multimodala agenter.

Nyckelfunktioner

  • 12B parameter vision-language modell
  • Interleaved bild- och textinmatningar
  • 128K token kontextlängd
  • Native variabel bildstorlekstöd
  • Öppen viktrelease
  • Lämplig för OCR, VQA och captioning

Priser

Modell
Free
Betyg
4.6 / 5 (5)

Användningsfall

Multimodal resonemang

Pixtral 12B kan förstå både naturliga bilder och dokument, uppnå state-of-the-art prestanda på MMMU-reasoning-benchmarken och överträffa större modeller.

Instruktionsföljande

Pixtral 12B utmärker sig i instruktionsföljande, särskilt i multimodela och endast textscenarier, med en 20% relativ förbättring i text IF-Eval och MT-Bench jämfört med den närmaste öppen källkod-modellen.

Multimodal frågebesvarande

Pixtral 12B visar starka förmågor i multimodal frågebesvarande, inklusive dokumentfrågebesvarande och förståelse av diagram och figurer.

Fördelar och nackdelar

Fördelar

  • Öppna vikter för självhosting
  • Hanterar flera bilder per prompt
  • Stor 128K kontextfönster
  • Flexibla bildupplösningar och bildförhållanden

Nackdelar

  • Kräver betydande GPU-resurser
  • Mindre än frontier slutna modeller
  • Begränsat verktyg jämfört med proprietära API:er

Stridsrekord

I 1 strid i Pantheon.

0
1:a
1
2:a
0
3:e

Last battle

Recensioner

4.6

Genomsnitt från 5 betyg.

5
3
4
2
3
0
2
0
1
0

Logga in för att lämna en recension.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Frågor

Hur många bilder och hur mycket text kan jag inkludera i en enskild anrop?

Pixtral stöder flerfärgade bild och text-inmatningar inom ett enkelt 128 KB-token-hanterande sammanhang, vilket tillåter ett obegränsat antal bilder (på deras naturliga upplösning) tillsammans med långtext i ett enda anrop.

Asked by Lorenzo Bianchi · Nov 20, 2025

Finns Pixtral 12B fortfarande i drift och finns det nya alternativ?

Pixtral 12B är nedprioriterats och inte längre underhålls – vi rekommenderar Mistral AI:s nya vision-språksammar, som överträffar Pixtral för produktionsbruk.

Asked by Carlos Mendoza · Nov 10, 2025

Vad krävs det av anordningar för att köra Pixtral 12B effektivt?

Modellen kräver storskalig GPU-minneskapacitet beroende på sina 12 miljarder parametrar och 400 M-parametrar vision encoder; typiska distributionsanordningar använder högända GPUs (t.ex. A100 40 GB eller jämförbara) för att hantera ett 128 K-token sammanhang och flera bilder.

Asked by Ivo Novotný · Nov 6, 2025

Kan jag själv-värdspaket Pixtral 12B, och under vilken licens?

Ja, Pixtral 12B släpptes under Apache 2.0 licensen; det gör att du kan ladda ner vikt och köra modellen lokalt på din egen hårdvara.

Asked by Priya Nair · Oct 12, 2025

Ställ en fråga

Alternativ till Language Modell