Pixtral 12B 24.09 logo

Pixtral 12B 24.09ღია მრავალმოდალური 12B მოდელი, რომელიც ერთდროულად მოიცავს სურათებსა და ტექსტებს 128K კონტექსტური ფანჯარაში.

4.6 (5)
Daniel Nikulshynშეფასებული Daniel Nikulshyn·განახლდა ივლისი, 2026

მიმოხილვა

Pixtral 12B 24.09 არის Mistral AI‑ის მრავალმოდული მოდელი, რომელიც ერთეულში პროცესებს როგორც სურათებს, ისე ტექსტს, მხარი დაუჭირებს ცვლადი ზომებსა და ასპექტურებს. ის იყენებს 12 ასლობით პარამეტრის ენის დეკოდერს ვიზუალური ენკოდერთან, რაც საშუალებას აძლევს ვიზუალური კითხვებზე პასუხის მიწოდება, დოკუმენტების გაგება, გრაფიკების ინტერპრეტაცია და სურათების სათაურების გენერირება. მოდელი მხარდაჭერას მოიცავს 128 K token context-თან, რაც საშუალებას იძლევა მრავალი გამოსახულება და გრძელი ტექსტი ერთ prompt‑ში შერწყმა. ღია ლიცენზიით გამოჩენილი, იგი შეიძლება განლაგება იყოს ლოკალურად ან inference providers‑ით, რაც იდეალურია developers‑ისთვის vision‑language აპლიკაციების, კვლევითი სამუშაო ნაკადების და multimodal agents‑ის შესაქმნელად.

ძირითადი ფუნქციები

  • 12B პარამეტრებით ხედ-ენერული მოდელი
  • შერწყმული სურათი და ტექსტის შეყვანები
  • 128K ტოკენის კონტექსტის ხანგრძლივობა
  • ნატიული ცვლადი სურათის ზომის მხარდაჭერა
  • ღია წონების გამოშვება
  • შესაბამისია OCR, VQA და სათაურებისთვის

ფასები

მოდელი
Free
შეფასება
4.6 / 5 (5)

გამოყენების შემთხვევები

მრავალმოდალური აზროვნება

Pixtral 12B-ს შეუძლია გაიცნოს როგორც ბუნებრივი სურათები, ისე დოკუმენტები, მიღწეული მდგომარეობის-პატარონის შესრულება MMMU აზროვნება ბენჩმარკზე და გადაჭარბება უფრო დიდი მოდელებს.

ბრძანებების შესრულება

Pixtral 12B გამოირჩევა ბრძანებების შესრულებაში, განსაკუთრებით მრავალმოდალური და მხოლოდ-ტექსტურ სიტუაციებში, 20% ზრდის მიღწევის ტექსტის IF-Eval და MT-Bench-ზე, შედარებით უახლოეს ღია წყარო მოდელს.

მრავალმოდალური შეკითხვების პასუხები

Pixtral 12B-ს აქვს ძლიერი შესაძლებლობები მრავალმოდალურ შეკითხვებს პასუხისაცემაში, მათ შორის დოკუმენტური შეკითხვებისა და ცხრილების და გრაფიკების გაგებაში.

დადებითი და უარყოფითი

დადებითი

  • ღია წონები თვითჰოსტისათვის
  • მონათავსებს რამდენიმე სურათს თითოეული მოთხოვნაში
  • დიდი 128K კონტექსტის ფანჯარა
  • მორგებადი სურათის რეზოლუციები და ასპექტული نسبتები

უარყოფითი

  • მოითხოვს მნიშვნელოვანი GPU რესურსებს
  • უფრო პატარა, ვიდრე ფრონტიერ დახურული მოდელები
  • შეზღუდული ინსტრუმენტები, შედარებით საკუთრების APIs

ბრძოლების რეკორდი

1 ბრძოლაში პანთეონში.

0
1-ლი
1
მე-2
0
მე-3

Last battle

შეფასებები

4.6

საშუალო 5 შეფასებიდან.

5
3
4
2
3
0
2
0
1
0

შედი ანგარიშზე შეფასების დასატოვებლად.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

კითხვები

რამდენი სურათი და რამდენი ტექსტი შემიძლია ერთ მოთხოვნაში ჩასვათ?

Pixtral‑მა მხარს უჭერს შერწყმულ სურათ-ტექსტის შეყვანას ერთ 128 K ტოკენის კონტექსტში, რაც ნიშნავს, რომ შეგიძლიათ დაამატოთ ნებისმიერი რაოდენობის სურათი (მთავარი რეზოლუციით) alongside გრძელი ტექსტი ერთ მოთხოვნაში.

Asked by Lorenzo Bianchi · Nov 20, 2025

Pixtral 12B ჯერ კიდევ ცენია, თუ არსებობს უფრო ახალი ალტერნატივები?

Pixtral 12B დეპრეკატირებულია და აღარ ცენდება; Mistral AI გირჩევთ უფრო ახალი, უფრო ძლიერი Vision‑Language მოდელებზე, რომლებიც Pixtral-ს გადადიან პროდუქტიულ გამოყენებაში.

Asked by Carlos Mendoza · Nov 10, 2025

რომელი აპარატურა საჭიროა Pixtral 12B-ს ეფექტურ მუშაობისთვის?

მოდელს საჭიროა დიდი GPU მეხსიერება 12 მილიარდის პარამეტრისა და 400 მილიარდის‑პარამეტრიანი Vision‑encoder-ის გამო; ჩვეულებრივ იყენება მაღალი დონით GPU-ები (მაგალითად A100 40 GB ან ბრადის ტოლ) 128 K ტოკენის კონტექსტისა და რამდენიმე სურათის დამუშავებისთვის.

Asked by Ivo Novotný · Nov 6, 2025

შეიძლება Pixtral 12B-ს თვით‑ჰოსტი, და რა ლიცენზია აქვს?

დიახ, Pixtral 12B გამოუქვეყნებულია Apache 2.0 ღია წყაროს ლიცენზიის ქვეშ, რაც საშუალებას გაძლევთ გადმოწეროთ ვეზები და გაშვოთ მოდელი ლოკალურად თქვენს ჰარდვერაზე.

Asked by Priya Nair · Oct 12, 2025

დასვი კითხვა

ციფრული ლოჯისტიკური მოდელი (LLM)-ის ალტერნატივები

Bifrost interface preview
Bifrostციფრული ლოჯისტიკური მოდელი (LLM)

მაღალი წარმადობის LLM‑გადამზიდე, რომელიც 1000+ მოდელს ერთ API‑ით აერთიანებს

5.0 (4)
Free
Latest DeepSeek R2 interface preview
Latest DeepSeek R2ციფრული ლოჯისტიკური მოდელი (LLM)

DeepSeek-ის მომავალი თაობის, მტკიცებულებაზე ორიენტირებული AI მოდელი

4.8 (6)
Free
DeepSeek V3 interface preview
DeepSeek V3ციფრული ლოჯისტიკური მოდელი (LLM)

ღია წყაროს ‘Mixture‑of‑Experts’ მოდელი, რომელიც GPT‑4o‑ს მსგავსი reasoning‑ის და მათემატიკის დონეს, თუმცა მინიმალურ ღირებულებით, უზრუნველყოფს.

4.8 (6)
Free
Latest Grok 3 AI interface preview
Latest Grok 3 AIციფრული ლოჯისტიკური მოდელი (LLM)

საუბარი AI, შექმნილი xAI‑დან, რომელიც განკუთვნილია გათვლებისთვის, კვლევისთვის და რეალურ-დრო პასუხებისთვის.

4.8 (5)
Free
Llama 3.3 interface preview
Llama 3.3ციფრული ლოჯისტიკური მოდელი (LLM)

Meta-ს მრავალენოვანი ღია წონის LLM, რომელიც მორგებულია ეფექტურ, მაღალი ხარისხიანი ტექსტური გენერაციისთვის.

4.8 (5)
Free
Simple MP3 to Text interface preview
Simple MP3 to Textციფრული ლოჯისტიკური მოდელი (LLM)

აიმაღლებლიანი MP3-ს ვერსია ტექსტად, ტექსტდა ციფრულ, წინადადებითდ საჩივარად აუდიოში.

4.8 (5)
Free
DeepSeek R1 interface preview
DeepSeek R1ციფრული ლოჯისტიკური მოდელი (LLM)

ღია წყაროს დიდი ენის მოდელი, რომელიც გამოირჩევა ლოგიკით, მათემატიკით და პროგრამირებაში, MIT ლიცენზიით უფასო გამოყენებით და მოდიფიცირებით.

4.8 (4)
3Free
OpenAI o1 interface preview
OpenAI o1ციფრული ლოჯისტიკური მოდელი (LLM)

OpenAI-ს გადმოსახედვისკენ მიმართული მოდელი, რომელიც შეიქმნილია რთული, მრავალ-ნაბიჯიანი პრობლემების გადაჭრისთვის.

4.8 (4)
Free