
Pixtral 12B 24.09Otwarte, multimodalne model 12B obsługujący przeplatanie obrazów i tekstu przy 128K oknie kontekstowym
Przegląd
Kluczowe funkcje
- model językowo-wizualny z 12 miliardami parametrów
- wejścia z przeplatającymi się obrazami i tekstem
- długość kontekstu 128K tokenów
- obsługa zmiennych rozmiarów obrazów natywnie
- wydanie z otwartymi wagami
- odpowiedni do OCR, VQA i podpisów obrazów
Cennik
- Model
- Free
- Ocena
- 4.6 / 5 (5)
Zastosowania
Rozumienie multimodalne
Pixtral 12B potrafi rozumieć zarówno naturalne obrazy, jak i dokumenty, osiągając najlepsze wyniki w benchmarku MMMU i przewyższając większe modele.
Śledzenie instrukcji
Pixtral 12B wyróżnia się w śledzeniu instrukcji, zwłaszcza w scenariuszach multimodalnych i wyłącznie tekstowych, z 20% względną poprawą w IF-Eval i MT-Bench w porównaniu z najbliższym otwartym modelem.
Odpowiadanie na pytania multimodalne
Pixtral 12B wykazuje silne umiejętności w odpowiadaniu na pytania multimodalne, w tym na pytania z dokumentów oraz interpretację wykresów i figur.
Plusy i minusy
Plusy
- otwarte wagi umożliwiające samodzielne hostowanie
- obsługa wielu obrazów na jedno zapytanie
- duże okno kontekstowe 128K
- elastyczne rozdzielczości i proporcje obrazów
Minusy
- wymaga znacznych zasobów GPU
- mniejszy niż najnowocześniejsze zamknięte modele
- ograniczone narzędzia w porównaniu z API własnościowymi
Wynik bitew
W 1 bitwie w Panteonie.
Last battle
Recenzje
Średnia z 5 ocen.
Zaloguj się, aby zostawić recenzję.
Does the job
Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.
Does the job
Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.
Years in this space
I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Solid for our team
We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.
Years in this space
I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.
Pytania i odpowiedzi
How many images and how much text can I include in a single prompt?
Pixtral supports interleaved image and text inputs within a single 128 K token context, allowing any number of images (at their natural resolution) alongside long‑form text in one prompt.
Asked by Lorenzo Bianchi · Nov 20, 2025
Is Pixtral 12B still maintained, and are there newer alternatives?
Pixtral 12B is deprecated and no longer maintained; Mistral AI recommends using its newer, more powerful vision‑language models that supersede Pixtral for production use.
Asked by Carlos Mendoza · Nov 10, 2025
What hardware is needed to run Pixtral 12B effectively?
The model requires substantial GPU memory due to its 12 billion parameters and 400 M‑parameter vision encoder; typical deployments use high‑end GPUs (e.g., A100 40 GB or comparable) to handle the 128 K token context and multiple images.
Asked by Ivo Novotný · Nov 6, 2025
Can I self‑host Pixtral 12B, and under what license?
Yes, Pixtral 12B is released under the Apache 2.0 open‑source license, allowing you to download the weights and run the model locally on your own hardware.
Asked by Priya Nair · Oct 12, 2025
Zadaj pytanie
Alternatywy dla Model Lekki Modyfikacji Maszyny Wielorzędnego

Wysokowydajny bramkowy system LLM łączący ponad 1000 modeli pod jednym API.

Następnej generacji model AI skoncentrowany na wnioskowaniu od DeepSeek

Model Mixture-of-Experts o otwartym kodzie, oferujący rozumowanie na poziomie GPT‑4o przy ułamek kosztów.

Konwersacyjna AI od xAI stworzona do wnioskowania, badań i odpowiedzi w czasie rzeczywistym.

Wielojęzyczny model LLM o otwartych wagach Meta, dostosowany do efektywnej i wysokiej jakości generacji tekstu.

AI‑oparty konwerter MP3 na tekst, zamieniający dźwięk w czyste, czytelne transkrypcje.

Otwartoźródłowy model językowy dużej skali, wyróżniający się w zadaniach rozumowania, matematyki i programowania, z licencją MIT umożliwiającą darmowe użycie i modyfikację.

Model OpenAI skoncentrowany na rozumowaniu, zbudowany dla rozwiązywania złożonych problemów wymagających wielu kroków.
Trending now

Precyzyjna pomoc z zadaniami domowymi z pełnymi wyjaśnieniami

API inteligencji dokumentowej, które analizuje, dzieli, wykonuje OCR i wyodrębnia strukturalne dane z złożonych PDF-ów, slajdów i arkuszy kalkulacyjnych.

Sponsorowane odpowiedzi, płatne za kliknięcie.

Przewodnia platforma do automatyzacji procesów agentycznych, wykorzystująca samouczy sięjące agenty AI do usprawnienia przepływów pracy w różnych branżach.
