
Pixtral 12B 24.09Open multimodaal 12B-model dat afgewisselde afbeeldingen en tekst met een 128K contextvenster verwerkt.
Overzicht
Belangrijkste functies
- 12B parameter visueel-taalmodel
- Afgewisselde afbeelding- en tekstenvoer
- 128K token contextlengte
- Native ondersteuning voor variabele afbeeldingsgrootte
- Open gewicht release
- Geschikt voor OCR, VQA en ondertiteling
Prijs
- Model
- Free
- Categorie
- LLM (Langueges Model)
- Beoordeling
- 4.6 / 5 (5)
Toepassingen
Multimodaal redeneren
Pixtral 12B is in staat om zowel natuurlijke afbeeldingen als documenten te begrijpen en behaalt state-of-the-art prestaties op de MMMU-redeneringsbenchmark en overtreft grotere modellen.
Instructie volgen
Pixtral 12B blinkt uit in instructievolging, vooral in multimodale en tekstloze scenario's, met een relatieve verbetering van 20% in tekst IF-Eval en MT-Bench ten opzichte van het dichtstbijzijnde open source-model.
Multimodale vraagbeantwoording
Pixtral 12B toont sterke capaciteiten in multimodale vraagbeantwoording, inclusief documentvraagbeantwoording en begrip van grafieken en figuren.
Pluspunten & minpunten
Pluspunten
- Open gewichten voor zelfhosting
- Behandelt meerdere afbeeldingen per prompt
- Groot 128K contextvenster
- Flexibele afbeeldingsresoluties en beeldverhoudingen
Minpunten
- Vereist aanzienlijke GPU-bronnen
- Kleiner dan gesloten grensmodellen
- Beperkte tooling in vergelijking met propriëtaire APIs
Strijdrecord
Over 1 strijd in het Pantheon.
Last battle
Recensies
Gemiddelde van 5 beoordelingen.
Log in om een review te schrijven.
Does the job
Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.
Does the job
Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.
Years in this space
I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Vragen
How many images and how much text can I include in a single prompt?
Pixtral supports interleaved image and text inputs within a single 128 K token context, allowing any number of images (at their natural resolution) alongside long‑form text in one prompt.
Asked by Lorenzo Bianchi · Nov 20, 2025
Is Pixtral 12B still maintained, and are there newer alternatives?
Pixtral 12B is deprecated and no longer maintained; Mistral AI recommends using its newer, more powerful vision‑language models that supersede Pixtral for production use.
Asked by Carlos Mendoza · Nov 10, 2025
What hardware is needed to run Pixtral 12B effectively?
The model requires substantial GPU memory due to its 12 billion parameters and 400 M‑parameter vision encoder; typical deployments use high‑end GPUs (e.g., A100 40 GB or comparable) to handle the 128 K token context and multiple images.
Asked by Ivo Novotný · Nov 6, 2025
Can I self‑host Pixtral 12B, and under what license?
Yes, Pixtral 12B is released under the Apache 2.0 open‑source license, allowing you to download the weights and run the model locally on your own hardware.
Asked by Priya Nair · Oct 12, 2025
Stel een vraag
Alternatieven voor LLM (Langueges Model)

High-performance LLM-gateway die 1000+ modellen verenigt achter één API.

Volgende generatie redeneergerichte AI-model van DeepSeek

Open-source mixture-of-experts-model dat GPT-4o-achtige redenering levert tegen een fractie van de kosten.

Conversational AI van xAI gebouwd voor redeneren, onderzoek en real-time antwoorden.

Meta's meertalige open-weight LLM, afgestemd voor efficiënte, hoogwaardige tekstgeneratie.

AI-aangedreven MP3 naar tekstconverter voor het omzetten van audio in schone, leesbare transcripties.

Een open-source groot taalmodel dat uitblinkt in redeneren, wiskunde en coderingstaken met MIT-licentie voor gratis gebruik en aanpassing.

OpenAI's redeneringsgericht model gebouwd voor complexe, meerstappige probleemoplossing.
Trending now

Nauwkeurige Huiswerkhulp met Volledige Uitleg

Document intelligence-API die pdf's, Presentaties en spreadsheets analyseert, splijt en extraheren van complexe gestructureerde gegevens.

Gesponsorde antwoorden, betaald per klik.

Een toonaangevend platform voor agentische procesautomatisering, dat zelflerende AI‑agents gebruikt om workflows in diverse sectoren te stroomlijnen.
