Pixtral 12B 24.09 logo

Pixtral 12B 24.09Відкрита багатомодальна модель 12B, що обробляє перемішані зображення та текст з контекстним вікном 128K токенів.

4.6 (5)
Daniel NikulshynПеревірено Daniel Nikulshyn·Оновлено липень 2026 р.

Огляд

Pixtral 12B 24.09 - багатомодельна модель від компанії Mistral AI, яка обробляє обидві зображення та текст у єдиному блок-схемі та підтримує різну розмірність та співвідношення сторін зображень. Вона використовує декодер мови з параметрами 12 мільярдів у поєднанні із візуальним декодером, що забезпечує виконання завдань, наприклад візуальний запит на відповіді, розуміння документів, інтерпретацію діаграм та генерування підписів до зображень. Модель приймає до контексту на розмір 128K токену, що дозволяє поєднують кілька зображень із довгими тексту в одне запрошення. Випущено під відкритою ліцензією, можна розгортати на місці або через провайдерів інференції, тому воно підходить для розробників візійних мовних додатків, дослідницьких потоків роботи та багомодальних агентів.

Ключові функції

  • Модель візійно-мовної взаємодії з 12B параметрами
  • Вхідні дані з перемішаними зображеннями та текстом
  • Довжина контексту 128K токенів
  • Вбудована підтримка змінних розмірів зображень
  • Випуск з відкритими вагами
  • Підходить для OCR, VQA та підписів

Ціни

Модель
Free
Рейтинг
4.6 / 5 (5)

Кейси використання

Багатомодальне Розуміння

Pixtral 12B здатна розуміти як природні зображення, так і документи, досягаючи найкращих результатів на бенчмарку MMMU Reasoning і перевершуючи більші моделі.

Слідування Інструкціям

Pixtral 12B виділяється у слідуванні інструкціям, особливо у багатомодальних та текстових сценаріях, з 20% відносним покращенням на текстовому IF-Eval та MT-Bench порівняно з найближчою відкритою моделлю.

Багатомодальне Відповідання на Запитання

Pixtral 12B демонструє сильні здібності у багатомодальному відповідях на запитання, включаючи відповідь на запитання по документах та розуміння графіків і діаграм.

Плюси і мінуси

Плюси

  • Відкриті ваги для самостійного розгортання
  • Обробляє кілька зображень у одному запиті
  • Велике контекстне вікно 128K
  • Гнучкі роздільності зображень і співвідношення сторін

Мінуси

  • Потребує значних ресурсів GPU
  • Менша, ніж передові закриті моделі
  • Обмежений набір інструментів порівняно із пропрієтарними API

Бойовий рекорд

У 1 битві у Пантеоні.

0
1-е
1
2-е
0
3-є

Last battle

Відгуки

4.6

Середнє з 5 оцінок.

5
3
4
2
3
0
2
0
1
0

Увійди, щоб залишити відгук.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Питання

How many images and how much text can I include in a single prompt?

Pixtral supports interleaved image and text inputs within a single 128 K token context, allowing any number of images (at their natural resolution) alongside long‑form text in one prompt.

Asked by Lorenzo Bianchi · Nov 20, 2025

Is Pixtral 12B still maintained, and are there newer alternatives?

Pixtral 12B is deprecated and no longer maintained; Mistral AI recommends using its newer, more powerful vision‑language models that supersede Pixtral for production use.

Asked by Carlos Mendoza · Nov 10, 2025

What hardware is needed to run Pixtral 12B effectively?

The model requires substantial GPU memory due to its 12 billion parameters and 400 M‑parameter vision encoder; typical deployments use high‑end GPUs (e.g., A100 40 GB or comparable) to handle the 128 K token context and multiple images.

Asked by Ivo Novotný · Nov 6, 2025

Can I self‑host Pixtral 12B, and under what license?

Yes, Pixtral 12B is released under the Apache 2.0 open‑source license, allowing you to download the weights and run the model locally on your own hardware.

Asked by Priya Nair · Oct 12, 2025

Постав питання

Альтернативи ЛМК (Модель Мислення Лінійної Зв'язковості)

Bifrost interface preview
BifrostЛМК (Модель Мислення Лінійної Зв'язковості)

High-performance LLM gateway that unifies 1000+ models behind a single API.

5.0 (4)
Free
Latest DeepSeek R2 interface preview
Latest DeepSeek R2ЛМК (Модель Мислення Лінійної Зв'язковості)

Наступнена генерація розумної AI- моделі із серії Діпсік R2

4.8 (6)
Free
DeepSeek V3 interface preview
DeepSeek V3ЛМК (Модель Мислення Лінійної Зв'язковості)

Відкритий відкритий мікс експертів, який пропонує рівень обґрунтування на рівні GPT-4o кошти в кілька разів менше.

4.8 (6)
Free
Latest Grok 3 AI interface preview
Latest Grok 3 AIЛМК (Модель Мислення Лінійної Зв'язковості)

Інтерактивний ІІ від xAI для логічного висновку, досліджень та живої відповіді.

4.8 (5)
Free
Llama 3.3 interface preview
Llama 3.3ЛМК (Модель Мислення Лінійної Зв'язковості)

Відкритий багатожмовий LLM Meta, налаштований для ефективного і високої якості генерування тексту.

4.8 (5)
Free
Simple MP3 to Text interface preview
Simple MP3 to TextЛМК (Модель Мислення Лінійної Зв'язковості)

AI-підтримуваний конвертер MP3 у текст для перетворення аудіо в чисті, читабельні транскрипти.

4.8 (5)
Free
DeepSeek R1 interface preview
DeepSeek R1ЛМК (Модель Мислення Лінійної Зв'язковості)

Відкритий джерелний великий модель мови, що відрізняється здатністю до логічного мислення, математичних розрахунків та виконання завдань зі програмуванням на умовах ліцензії MIT безкоштовно та зі змінами

4.8 (4)
3Free
OpenAI o1 interface preview
OpenAI o1ЛМК (Модель Мислення Лінійної Зв'язковості)

Модель OpenAI, орієнтована на розумові процеси, створена для вирішення складних, багатоступеневих задач.

4.8 (4)
Free