
Pixtral 12B 24.09Modele multimodal 12B gérant des images et du texte interrompus avec une fenêtre de contexte de 128 K.
Aperçu
Fonctionnalités clés
- Modèle de vision-langage de 12 milliards de paramètres
- Entrées d'image et de texte interrompues
- Fenêtre de contexte de 128 K de jetons
- Support natif de tailles d'image variables
- Lecture des poids ouverts
- Adéquat pour l'OCR, la VQA et l'étiquetage d'images
Tarifs
- Modèle
- Free
- Catégorie
- Modèle de Langage Large
- Note
- 4.6 / 5 (5)
Cas d’usage
Raisonnement multimodal
Pixtral 12B est capable d'interpréter à la fois des images naturelles et des documents, atteignant des performances de pointe sur le benchmark de raisonnement MMMU et dépassant les modèles plus grands.
Suivi d'instructions
Pixtral 12B excelle dans le suivi d'instructions, en particulier dans les scénarios multimodaux et uniquement textuels, avec une amélioration relative de 20% en text IF-Eval et MT-Bench par rapport au modèle open-source le plus proche.
Question de réponse multimodale
Pixtral 12B démontre des capacités fortes en question de réponse multimodale, y compris la question de réponse dans les documents et la compréhension des diagrammes et figures.
Pour & contre
Pour
- Poids ouverts pour le self-hosting
- Gère plusieurs images par prompt
- Grandne fenêtre de contexte de 128 K
- Résolutions d'image flexibles et rapports d'aspect
Contre
- Exige des ressources GPU importantes
- Ses performances sont inférieures à celles des modèles fermés frontières
- Des outils limités par rapport aux APIs propriétaires
Palmarès des batailles
Sur 1 bataille dans le Panthéon.
Last battle
Avis
Moyenne sur 5 avis.
Connecte-toi pour laisser un avis.
Does the job
Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.
Does the job
Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.
Years in this space
I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Questions & réponses
Comment nombre d'images et de texte pouvez-vous inclure dans une seule prompt?
Pixtral prend en charge les entrées d'images et de texte intercalées à l'intérieur d'un contexte de jetons de 128 K dans une seule prompt, permettant tout nombre d'images (à leur résolution naturelle) avec des textes longs-forme dans une seule prompt.
Asked by Lorenzo Bianchi · Nov 20, 2025
Est-ce que Pixtral 12B continue à être maintenu, et existe-t-il des alternatives plus récentes?
Pixtral 12B est déprécié et ne le mène plus ; Mistral AI recommande d'utiliser ses nouveaux et plus puissants modèles vision-langage qui dépassent Pixtral pour l'utilisation en production.
Asked by Carlos Mendoza · Nov 10, 2025
Quel matériel est nécessaire pour exécuter Pixtral 12B efficacement ?
Le modèle nécessite une grande quantité de mémoire vive de la carte graphique en raison de ses 12 milliards de paramètres et de l'encodeur de vision à 400 M-params ; les déploiements typiques utilisent des cartes graphiques haut de gamme (par exemple, A100 40 GB ou équivalent) pour gérer le contexte de 128 K jetons et plusieurs images.
Asked by Ivo Novotný · Nov 6, 2025
Peut-on héberger Pixtral 12B localement, et sous quelles conditions ?
Oui, Pixtral 12B est publié sous la licence d'Apache 2.0 open-source, permettant de télécharger les poids et de l'exécuter localement sur votre propre matériel.
Asked by Priya Nair · Oct 12, 2025
Poser une question
Alternatives à Modèle de Langage Large

Passerelle LLM haute performance unifiant plus de 1000 modèles derrière une seule API.

Modèle d'IA de nouvelle génération axé sur le raisonnement de DeepSeek

Modèle open-source à base de mélanges d'experts offrant des capacités de raisonnement au niveau de GPT-4o, tout en faisant moins cher.

Intelligence conversationnelle de xAI conçue pour la raisonnement, la recherche et les réponses en temps réel.

LLM multilingue ouvert de Meta, ajusté pour une génération de texte efficiente et de haute qualité.

Convertisseur MP3 vers texte propulsé par IA pour transformer l'audio en transcriptions claires et lisibles.

Un modèle de langage large open-source faisant preuve d'une excellente capacité de raisonnement, de mathématiques et de tâches de programmation avec une licence MIT pour l'utilisation et la modification gratuites.

Le modèle d'OpenAI axé sur la réflexion, conçu pour résoudre des problèmes complexes en plusieurs étapes
Trending now

Aide aux devoirs précise avec explications complètes

API d'intelligence de document qui parse, divise, reconnait les chars et extrait les données structurées de complexes PDF, diapositives et tableurs.

Reponses sponsorises, payées par clic.

Plateforme leader pour l'automatisation des processus agentiques, utilisant des agents d'IA auto-apprenants pour optimiser les flux de travail dans divers secteurs.
