Pixtral 12B 24.09 logo

Pixtral 12B 24.09Model multimodal deschis de 12B care gestionează imagini și text întrețesute cu o fereastră de context de 128K.

4.6 (5)
Daniel NikulshynRecenzat de Daniel Nikulshyn·Actualizat iulie 2026

Prezentare

Pixtral 12B 24.09 este un model multimodal din Mistral AI care procesează atât imagini, cât și texte într-o singură secvență, susținând dimensiuni și raporturi imagistice variabile. Se utilizează un deocodificator de limbaj cu 12 miliarde de parametri, asociat cu un codificator de vizualizare, ceea ce permite sarcini ca răspunsul la întrebări vizuale, interpretarea documentelor, analizarea diagramei și crearea caption-urilor de imagine. Modelul acceptă până la un context de 128K de tokeni, permitemând intercalarea mai multor imagini cu texte de lungă formă într-o singură prompt. Lansat sub o licență deschisă, poate fi implementat local sau prin intermediari de inferență, făcându-l adecvat dezvoltorilor care construiesc aplicații de vedere-limbaj, fluxuri de lucru de cercetare și agenți multimodali.

Funcții cheie

  • Model de viziune și limbaj cu 12B parametri
  • Intrări de imagini și text întrețesute
  • Lungimea contextului de 128K tokeni
  • Suport nativ pentru dimensiuni variabile ale imaginii
  • Lansare cu greutate deschisă
  • Potrivit pentru OCR, VQA și etichetare

Prețuri

Model
Free
Evaluare
4.6 / 5 (5)

Cazuri de utilizare

Raționament multimodal

Pixtral 12B este capabil să înțeleagă atât imagini naturale cât și documente, atingând performanțe de ultimă generație pe benchmark-ul de raționament MMMU și depășind modele mai mari.

Urmărirea instrucțiunilor

Pixtral 12B excelează în urmărirea instrucțiunilor, în special în scenarii multimodale și numai text, cu o îmbunătățire relativă de 20% în text IF-Eval și MT-Bench față de cel mai apropiat model open-source.

Răspunsul la întrebări multimodale

Pixtral 12B demonstrează abilități puternice în răspunsul la întrebări multimodale, inclusiv răspunsul la întrebări despre documente și înțelegerea diagramelor și figurilor.

Pro și contra

Pro

  • Greutăți deschise pentru auto-găzduire
  • Gestionează mai multe imagini pe prompt
  • Fereastră de context mare de 128K
  • Rezoluții și rapoarte de aspect flexibile ale imaginii

Contra

  • Necesită resurse GPU semnificative
  • Mai mic decât modelele închise de frontieră
  • Instrumente limitate în comparație cu API-urile proprietare

Record de bătălii

În 1 bătălie din Panteon.

0
locul 1
1
locul 2
0
locul 3

Last battle

Recenzii

4.6

Medie din 5 evaluări.

5
3
4
2
3
0
2
0
1
0

Conectează-te pentru a lăsa o recenzie.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Întrebări

Cum pot include imagini și cât text pot include într-un singur prompt?

Pixtral suportă introduceri intercalate de imagini și text într-un singur context de 128 K de tokenuri, permitească orice număr de imagini (la rezoluție naturală) alături de texte lungi într-un prompt.

Asked by Lorenzo Bianchi · Nov 20, 2025

Este încă susținut Pixtral 12B și există alternativă nouă?

Pixtral 12B nu mai este susținut și nu mai este menținută; recomandăm folosirea modelului de viziune-vocațională mai puternic și mai nou al firmei Mistral AI, care înlocuiește Pixtral pentru utilizarea producției.

Asked by Carlos Mendoza · Nov 10, 2025

Acest hardware este necesar pentru a rula eficient Pixtral 12B?

Modelul necesită o memorie de GPU mare ca urmare a parametrilor sai în număr de 12 miliarde și 400 de milioane de parametri vizați; implementările tipice folosesc GPU-uri de top (de exemplu, A100 40 GB sau corespunzătoare) pentru a gestiona contextul de 128 K token și multe imagini.

Asked by Ivo Novotný · Nov 6, 2025

Mă pot găzdui automat Pixtral 12B, și sub ce licență?

Da, Pixtral 12B este lansat sub licența Apache 2.0 deschisă, ceea ce vă permite să descărcați greutățile și să rulați modelul pe dispozitivele de rețea propriile pe hardware-ul propriu.

Asked by Priya Nair · Oct 12, 2025

Pune o întrebare

Alternative la Modelul de Limbaj din Amonte LLL