Pixtral 12B 24.09 logo

Pixtral 12B 24.09Ανοιχτό πολυμορφικό μοντέλο 12B που χειρίζεται αλληλοεναλλασσόμενες εικόνες και κείμενο με παράθυρο συμφραζομένων 128K.

4.6 (5)
Daniel NikulshynΑξιολογήθηκε από Daniel Nikulshyn·Ενημερώθηκε Ιούλιος 2026

Επισκόπηση

Το Pixtral 12B 24.09 είναι ένα πολυμορφικό μοντέλο της Mistral AI που επεξεργάζεται τόσο εικόνες όσο και κείμενα μέσα σε μια ενιαία ακολουθία, υποστηρίζοντας μεταβλητά μεγέθη εικόνας και αναλογίες διαστάσεων. Χρησιμοποιεί έναν 12‑billion‑parameter language decoder σε συνδυασμό με έναν vision encoder, επιτρέποντας εργασίες όπως visual question answering, document understanding, chart interpretation και image captioning. Το μοντέλο υποστηρίζει έως 128K token context, επιτρέποντας τη διασπορά πολλαπλών εικόνων με μακρά κείμενα σε ένα prompt. Κυκλοφορεί υπό ανοιχτή άδεια και μπορεί να προσαρμοστεί τοπικά ή μέσω inference providers, καθιστώντας το κατάλληλο για προγραμματιστές που δημιουργούν vision‑language applications, research workflows και multimodal agents.

Βασικές λειτουργίες

  • Μοντέλο όρασης-γλώσσας με 12B παραμέτρους
  • Είσοδοι εικόνας και κειμένου αλληλοεναλλασσόμενα
  • Μήκος συμφραζομένων 128K token
  • Υποστήριξη μεταβλητού μεγέθους εικόνας
  • Διανομή ανοιχτού βάρους
  • Ικανοποιεί OCR, VQA και περιγραφή εικόνων

Τιμές

Μοντέλο
Free
Βαθμολογία
4.6 / 5 (5)

Περιπτώσεις χρήσης

Πολυμορφική Ανάλυση

Το Pixtral 12B μπορεί να κατανοεί τόσο φυσικές εικόνες όσο και έγγραφα, επιτυγχάνοντας κορυφαία απόδοση στο benchmark πολυμορφικής ανάλυσης MMMU και υπερβαίνοντας μεγαλύτερα μοντέλα.

Ακολουθία Εντολών

Το Pixtral 12B ξεχωρίζει στην εκτέλεση εντολών, ειδικά σε πολυμορφικές και μονοκείμενες περιπτώσεις, με βελτίωση 20% σχετικά στα κριτήρια IF-Eval κειμένου και MT-Bench σε σύγκριση με το πλησιέστερο μοντέλο ανοιχτού κώδικα.

Πολυμορφική Απάντηση Ερωτήσεων

Το Pixtral 12B επιδεικνύει ισχυρές δυνατότητες στην πολυμορφική απάντηση ερωτήσεων, συμπεριλαμβανομένης της απάντησης ερωτήσεων σε έγγραφα και της κατανόησης γραφημάτων και διαγραμμάτων.

Υπέρ και κατά

Υπέρ

  • Ανοιχτά βάρη για αυτόχρησιμοποίηση
  • Χειρίζεται πολλαπλές εικόνες ανά εντολή
  • Μεγάλο παράθυρο συμφραζομένων 128K
  • Ευέλικτες αναλύσεις και αναλογίες εικόνας

Κατά

  • Απαιτεί σημαντικούς πόρους GPU
  • Πιο μικρό από τα κορυφαία κλειστούς μοντέλα
  • Περιορισμένα εργαλεία σε σύγκριση με ιδιόκτητα API

Ρεκόρ μαχών

Σε 1 μάχη στο Πάνθεον.

0
1ος
1
2ος
0
3ος

Last battle

Κριτικές

4.6

Μέσος όρος από 5 βαθμολογίες.

5
3
4
2
3
0
2
0
1
0

Σύνδεση για κριτική.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Ερωτήσεις

How many images and how much text can I include in a single prompt?

Pixtral supports interleaved image and text inputs within a single 128 K token context, allowing any number of images (at their natural resolution) alongside long‑form text in one prompt.

Asked by Lorenzo Bianchi · Nov 20, 2025

Is Pixtral 12B still maintained, and are there newer alternatives?

Pixtral 12B is deprecated and no longer maintained; Mistral AI recommends using its newer, more powerful vision‑language models that supersede Pixtral for production use.

Asked by Carlos Mendoza · Nov 10, 2025

What hardware is needed to run Pixtral 12B effectively?

The model requires substantial GPU memory due to its 12 billion parameters and 400 M‑parameter vision encoder; typical deployments use high‑end GPUs (e.g., A100 40 GB or comparable) to handle the 128 K token context and multiple images.

Asked by Ivo Novotný · Nov 6, 2025

Can I self‑host Pixtral 12B, and under what license?

Yes, Pixtral 12B is released under the Apache 2.0 open‑source license, allowing you to download the weights and run the model locally on your own hardware.

Asked by Priya Nair · Oct 12, 2025

Κάνε μια ερώτηση

Εναλλακτικές για Μορφές Λόγου Υπολογιστή (LLM)

Bifrost interface preview
BifrostΜορφές Λόγου Υπολογιστή (LLM)

Ένα υψηλής απόδοσης κέντρον LLM που ενιαίνει hơn 1000模型 πίσω από μια ενιαία API.

5.0 (4)
Free
Latest DeepSeek R2 interface preview
Latest DeepSeek R2Μορφές Λόγου Υπολογιστή (LLM)

Το μοντέλο AI της επόμενης γενιάς με επίκεντρο την λογική από τη DeepSeek

4.8 (6)
Free
DeepSeek V3 interface preview
DeepSeek V3Μορφές Λόγου Υπολογιστή (LLM)

Μικτός ανοιχτός κώδικας από.experten πρότυπο που διασφαλίζει επεξέρτηση GPT-4 επιπέδου λογιστικού στην εξαίρεση του κόστους.

4.8 (6)
Free
Latest Grok 3 AI interface preview
Latest Grok 3 AIΜορφές Λόγου Υπολογιστή (LLM)

Conversational AI από το xAI, κατασκευασμένο για λογική, έρευνα και απαντήσεις σε πραγματικό χρόνο.

4.8 (5)
Free
Llama 3.3 interface preview
Llama 3.3Μορφές Λόγου Υπολογιστή (LLM)

Το Llama 3.3 της Meta είναι ένα πολυγλωσσικό, ανοιχτό-βάρος LLM, προσαρμοσμένο για αποδοτική, υψηλής ποιότητας δημιουργία κειμένου.

4.8 (5)
Free
Simple MP3 to Text interface preview
Simple MP3 to TextΜορφές Λόγου Υπολογιστή (LLM)

Μετατροπέας MP3 σε κείμενο με τεχνητή νοημοσύνη για τη μετατροπή ήχου σε καθαρά, ευανάγνωστα κείμενα.

4.8 (5)
Free
DeepSeek R1 interface preview
DeepSeek R1Μορφές Λόγου Υπολογιστή (LLM)

Μια ανοιχτή πηγαία γλώσσα μεγάλων μοντέλων, το οποίο ξεχωρίζει σε θέματα απόψεως, μαθηματικών υπολογισμών, και κώδικα με άδεια MIT για δωρεάν χρήση και τροποποίηση.

4.8 (4)
3Free
OpenAI o1 interface preview
OpenAI o1Μορφές Λόγου Υπολογιστή (LLM)

Το μοντέλο του OpenAI εστιασμένο στη λογική, σχεδιασμένο για σύνθετες, πολλήβήματικές λύσεις προβλημάτων.

4.8 (4)
Free