Pixtral 12B 24.09 logo

Pixtral 12B 24.09Modele multimodal 12B gérant des images et du texte interrompus avec une fenêtre de contexte de 128 K.

4.6 (5)
Daniel NikulshynÉvalué par Daniel Nikulshyn·Mis à jour juillet 2026

Aperçu

Pixtral 12B 24.09 est un modèle multimodal de Mistral AI qui traite à la fois les images et le texte dans une seule séquence, prenant en charge des tailles d'images et des ratios d'aspect variables. Il utilise un décodeur de langage à 12 milliards de paramètres associé à un encodeur de vision, permettant des tâches telles que la réponse à des questions visuelles, la compréhension de documents, l'interprétation de graphiques et la légendation d'images. Le modèle accepte un contexte de jusqu'à 128K tokens, permettant d'intercaler plusieurs images avec du texte long dans une seule invite. Publié sous une licence ouverte, il peut être déployé localement ou via des fournisseurs d'inférence, ce qui le rend adapté aux développeurs qui créent des applications de vision-langage, des flux de travail de recherche et des agents multimodaux.

Fonctionnalités clés

  • Modèle de vision-langage de 12 milliards de paramètres
  • Entrées d'image et de texte interrompues
  • Fenêtre de contexte de 128 K de jetons
  • Support natif de tailles d'image variables
  • Lecture des poids ouverts
  • Adéquat pour l'OCR, la VQA et l'étiquetage d'images

Tarifs

Modèle
Free
Note
4.6 / 5 (5)

Cas d’usage

Raisonnement multimodal

Pixtral 12B est capable d'interpréter à la fois des images naturelles et des documents, atteignant des performances de pointe sur le benchmark de raisonnement MMMU et dépassant les modèles plus grands.

Suivi d'instructions

Pixtral 12B excelle dans le suivi d'instructions, en particulier dans les scénarios multimodaux et uniquement textuels, avec une amélioration relative de 20% en text IF-Eval et MT-Bench par rapport au modèle open-source le plus proche.

Question de réponse multimodale

Pixtral 12B démontre des capacités fortes en question de réponse multimodale, y compris la question de réponse dans les documents et la compréhension des diagrammes et figures.

Pour & contre

Pour

  • Poids ouverts pour le self-hosting
  • Gère plusieurs images par prompt
  • Grandne fenêtre de contexte de 128 K
  • Résolutions d'image flexibles et rapports d'aspect

Contre

  • Exige des ressources GPU importantes
  • Ses performances sont inférieures à celles des modèles fermés frontières
  • Des outils limités par rapport aux APIs propriétaires

Palmarès des batailles

Sur 1 bataille dans le Panthéon.

0
1ᵉʳ
1
2ᵉ
0
3ᵉ

Last battle

Avis

4.6

Moyenne sur 5 avis.

5
3
4
2
3
0
2
0
1
0

Connecte-toi pour laisser un avis.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Questions & réponses

Comment nombre d'images et de texte pouvez-vous inclure dans une seule prompt?

Pixtral prend en charge les entrées d'images et de texte intercalées à l'intérieur d'un contexte de jetons de 128 K dans une seule prompt, permettant tout nombre d'images (à leur résolution naturelle) avec des textes longs-forme dans une seule prompt.

Asked by Lorenzo Bianchi · Nov 20, 2025

Est-ce que Pixtral 12B continue à être maintenu, et existe-t-il des alternatives plus récentes?

Pixtral 12B est déprécié et ne le mène plus ; Mistral AI recommande d'utiliser ses nouveaux et plus puissants modèles vision-langage qui dépassent Pixtral pour l'utilisation en production.

Asked by Carlos Mendoza · Nov 10, 2025

Quel matériel est nécessaire pour exécuter Pixtral 12B efficacement ?

Le modèle nécessite une grande quantité de mémoire vive de la carte graphique en raison de ses 12 milliards de paramètres et de l'encodeur de vision à 400 M-params ; les déploiements typiques utilisent des cartes graphiques haut de gamme (par exemple, A100 40 GB ou équivalent) pour gérer le contexte de 128 K jetons et plusieurs images.

Asked by Ivo Novotný · Nov 6, 2025

Peut-on héberger Pixtral 12B localement, et sous quelles conditions ?

Oui, Pixtral 12B est publié sous la licence d'Apache 2.0 open-source, permettant de télécharger les poids et de l'exécuter localement sur votre propre matériel.

Asked by Priya Nair · Oct 12, 2025

Poser une question

Alternatives à Modèle de Langage Large