
Pixtral 12B 24.09Modello multimodale di 12B con finestra di contesto di 128K per l'elaborazione di immagini e testi intercalati.
Panoramica
Funzionalità chiave
- Modello di 12 milioni di parametri visione-linguaggio
- Irrealtamento di immagini e testi
- Finestra di contesto di 128K token
- Supporto nativo per dimensioni di immagine variabili
- Pubblicazione con pesi aperti
- Adatto per OCR, VQA e didascalie
Prezzi
- Modello
- Free
- Categoria
- Modelli Linguistici di Raffinamento
- Valutazione
- 4.6 / 5 (5)
Casi d’uso
Ragionamento Multimodale
Pixtral 12B è in grado di comprendere entrambe le immagini naturali e i documenti, raggiungendo i prestazioni state-of-the-art nel benchmark di ragionamento MMMU e superando i modelli più grandi.
Follow the Instructions
Pixtral 12B si distingue nel follow the instructions, in particolare in scenari multimodal e di testo solo, con un miglioramento di 20% di prestazioni relativamente a test IF-Eval e MT-Bench rispetto al modello open source più vicino.
Pregunte Multimodale
Pixtral 12B mostra abilità forti nella risposta alle domande multimodal, inclusa la risposta ai documenti e l'interpretazione di grafici e figure.
Pro & contro
Pro
- Pesi aperti per l'hosting self-servizio
- Gestisce più immagini per richiesta
- Grande finestra di contesto di 128K
- Risoluzione e rapporto di aspetto d'immagine flessibili
Contro
- Richiede risorse GPU significative
- Indietro rispetto ai modelli chiusi di frontiera
- Strumenti limitati rispetto a API proprietarie
Storico battaglie
Su 1 battaglia nel Pantheon.
Last battle
Recensioni
Media su 5 valutazioni.
Accedi per lasciare una recensione.
Does the job
Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.
Does the job
Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.
Years in this space
I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Domande e risposte
How many images and how much text can I include in a single prompt?
Pixtral supports interleaved image and text inputs within a single 128 K token context, allowing any number of images (at their natural resolution) alongside long‑form text in one prompt.
Asked by Lorenzo Bianchi · Nov 20, 2025
Is Pixtral 12B still maintained, and are there newer alternatives?
Pixtral 12B is deprecated and no longer maintained; Mistral AI recommends using its newer, more powerful vision‑language models that supersede Pixtral for production use.
Asked by Carlos Mendoza · Nov 10, 2025
What hardware is needed to run Pixtral 12B effectively?
The model requires substantial GPU memory due to its 12 billion parameters and 400 M‑parameter vision encoder; typical deployments use high‑end GPUs (e.g., A100 40 GB or comparable) to handle the 128 K token context and multiple images.
Asked by Ivo Novotný · Nov 6, 2025
Can I self‑host Pixtral 12B, and under what license?
Yes, Pixtral 12B is released under the Apache 2.0 open‑source license, allowing you to download the weights and run the model locally on your own hardware.
Asked by Priya Nair · Oct 12, 2025
Fai una domanda
Alternative a Modelli Linguistici di Raffinamento

Gateway LLM di alta prestazione che unifica 1000+ modelli dietro un unico API.

Modello di ragionamento di nuova generazione da parte di DeepSeek

Modello misto di esperti open-source offrendo ragionamento a livello GPT-4o a un costo infinitesimale.

L'IA conversazionale da xAI progettata per la ragione, la ricerca e le risposte in tempo reale.

LLM aperto multilingue di Meta ottimizzato per la generazione di testo efficiente e di alta qualità.

Convertitore MP3 a testo alimentato da IA per trasformare l'audio in trascrizioni leggibili e pulite.

Un modello linguistico open-source eccellente nelle attività di ragionamento, matematica e codifica, con licenza MIT per utilizzo e modifica gratuito.

Modello di ragionamento focalizzato di OpenAI progettato per la risoluzione di problemi complessi e multicrittico
Trending now

Aiuto di Alta Qualità per i Compiti con Spiegazioni Dettagliate

API di intelligenza dei documenti che elabora, suddivide, riconosce testi da immagine e estrae dati strutturati da PDFs complessi, diapositive e fogli elettronici

Risposte sponsorizzate, pagate per clic

Piattaforma di riferimento per l'automazione dei processi agente, che utilizza agenti di intelligence artificiale in apprendimento per semplificare i flussi di lavoro in diversi settori.
