Pixtral 12B 24.09 logo

Pixtral 12B 24.09Avoin multimodaalinen 12B-malli, joka käsittelee lomitetut kuvat ja teksti 128K:n kontekstin ikkunalla.

4.6 (5)
Daniel NikulshynArvostellut Daniel Nikulshyn·Päivitetty heinäkuu 2026

Yleiskatsaus

Pixtral 12B 24.09 on Mistral AI:n kehittämä multimodaalinen malli, joka käsittelee kuvia ja tekstiä samassa sekvenssissä, tukee erikokoisia kuvia ja eri kuvasuhteita. Se hyödyntää 12‑miljardia parametria sisältävää kielidekooderia yhdessä näköenkooderin kanssa, mahdollistaen tehtäviä kuten visuaalinen kysymysvastaus, asiakirjojen ymmärtäminen, kaavioiden tulkinta ja kuvatekstien luominen. Malli hyväksyy jopa 128 K tokenin kontekstin, jolloin useita kuvia voidaan vuorotella pitkän tekstin kanssa yhdessä kehotteessa. Julkaistu avoimen lisenssin alla, sen voi ottaa käyttöön paikallisesti tai inferenssipalveluntarjoajien kautta, mikä tekee siitä sopivan kehittäjille, jotka rakentavat vision-language -sovelluksia, tutkimustyönkulkuja ja monimodaalisia agenteja.

Pääominaisuudet

  • 12B-parametrinen näkö‑kielimalli
  • Lomitetut kuva‑ ja tekstisyötteet
  • 128K tokenin kontekstipituus
  • Sisäänrakennettu tuki vaihtuville kuvakokoille
  • Avoin painot julkaisussa
  • Sopiva OCR:ään, VQA:han ja kuvatekstien luomiseen

Hinnat

Malli
Free
Kategoria
LLM
Arvio
4.6 / 5 (5)

Käyttötapaukset

Multimodaalinen päättely

Pixtral 12B kykenee ymmärtämään sekä luonnollisia kuvia että asiakirjoja, saavuttaen huipputason suorituskyvyn MMMU-päättelyvertailussa ja ylittäen suuremmat mallit.

Ohjeiden noudattaminen

Pixtral 12B erottuu ohjeiden noudattamisessa, erityisesti multimodaalisissa ja pelkästään tekstipohjaisissa tilanteissa, saavuttaen 20 % suhteellisen parannuksen tekstissä IF‑Evalissä ja MT‑Benchissä lähimpään avoimeen malliin verrattuna.

Multimodaalinen kysymys‑vastaus

Pixtral 12B osoittaa vahvat kyvyt multimodaaliseen kysymys‑vastaamiseen, mukaan lukien asiakirjakysymykset sekä kaavioiden ja kuvioiden ymmärtäminen.

Plussat ja miinukset

Plussat

  • Avoimet painot omalle isännöinnille
  • Käsittelee useita kuvia per kehotus
  • Suuri 128K kontekstin ikkuna
  • Joustavat kuvien resoluutiot ja kuvasuhteet

Miinukset

  • Vaatii merkittäviä GPU-resursseja
  • Pienempi kuin huipputason suljetut mallit
  • Rajoitetut työkalut verrattuna kaupallisiin API:in

Taisteluennätys

1 taistelussa Panteonissa.

0
1.
1
2.
0
3.

Last battle

Arvostelut

4.6

Keskiarvo 5 arviosta.

5
3
4
2
3
0
2
0
1
0

Kirjaudu sisään jättääksesi arvostelun.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Kysymykset

Kuinka monta kuvaa ja kuinka paljon tekstiä voin sisällyttää yhteen pyyntöön?

Pixtral tukee vuoroteltuja kuva- ja tekstisyötteitä yhdessä 128 K tokenin kontekstissa, jolloin voit liittää mihin tahansa määrään kuvia (niiden luonnollisessa resoluutiossa) pitkän muotoisen tekstin ohella yhdessä pyynnössä.

Asked by Lorenzo Bianchi · Nov 20, 2025

Onko Pixtral 12B edelleen ylläpidetty, ja onko olemassa uudempia vaihtoehtoja?

Pixtral 12B on vanhentunut eikä sitä enää ylläpidetä; Mistral AI suosittelee sen sijaan käyttämään uudempia, tehokkaampia vision‑language -malleja, jotka korvaavat Pixtralin tuotantokäytössä.

Asked by Carlos Mendoza · Nov 10, 2025

Mitä laitteistoa tarvitaan Pixtral 12B:n tehokkaaseen suorittamiseen?

Malli vaatii merkittävän GPU-muistin 12 miljardin parametrin ja 400 M‑parametrin näköenkooderin vuoksi; tyypilliset käyttöönotot hyödyntävät huippuluokan GPU:ita (esim. A100 40 GB tai vastaava) käsittelemään 128 K tokenin kontekstia ja useita kuvia.

Asked by Ivo Novotný · Nov 6, 2025

Voinko itse isännöidä Pixtral 12B:ta, ja millaisella lisenssillä?

Kyllä, Pixtral 12B on julkaistu Apache 2.0 -avointen lähdekoodien lisenssillä, mikä mahdollistaa painojen lataamisen ja mallin ajamisen paikallisesti omalla laitteistollasi.

Asked by Priya Nair · Oct 12, 2025

Kysy kysymys

LLM vaihtoehdot