Pixtral 12B 24.09 logo

Pixtral 12B 24.09Премахваме границите между картините и съдържанието им, обхващайки в голяма размерност многообразни картинки и текстове в рамки на окото на масив от 128K на съответстващия модели.

4.6 (5)
Daniel NikulshynПрегледано от Daniel Nikulshyn·Актуализирано юли 2026 г.

Преглед

Pixtral 12B 24.09 е полимоделен модел от ИК Mistral, който обработва както снимки, така и съдържание в рамките на една последователност, поддържащи променлив размер и процент на снимките. Въвежда 12-милиардното-параметърен декодер на езиковата липса, комбинирания с визуален процесор, което прави възможни задачи като визуално запитване и ответ, разбиране на документите, интерпретация на диаграмите и обозначаване на снимките. Моделът приема до контекст от 128K токена, което позволява на множество изображения да бъдат вмъкнати в дълъг текстен пътник в една команди. Издаден под лиценз от отворен код, той може да бъде разположен локално или чрез провайзъри за инференция, което го прави подходящ за разработчиците, строители на приложения за зрително-языкови програми, лабораторни протоколи и мултимодални агенти.

Ключови функции

  • 12Б параметърен модел за зрение-язык
  • Приема съответстващи картинки и текстове
  • Съответстващ размер на контекста от 128K
  • Нативна поддръжка за различни размери на картините
  • Откритите тежести са публични
  • Подходи за OCR, VQA и подзаглавие

Цени

Модел
Free
Оценка
4.6 / 5 (5)

Случаи на употреба

Многозначно изследване

Pixtral 12B може да разбира както природни снимки така и документи, постигайки класическо наука с изследванията на MMMU в резултата и надминавайки по-големите модели.

Изпълнение на инструкции

Pixtral 12B изпълва добре инструкциите, по-особено при изследванията, докато също включва текста в класическата инормация.

Въпроси и отговори със множество съдържания

Pixtral 12B изпълва добре съдържание със съдържание със множество снимки и документи.

Плюсове и минуси

Плюсове

  • Открити тежести за самохостинг
  • Обхваща множество картинки заедно с prompt
  • Голям съответстващ размер от 128K
  • Многообразни размери и сечения на картините
  • API-то е със съгласни
  • SDK-то е със съгласни
  • LLM-то е със съгласни

Минуси

  • Нуждаем доста ресурси в GPU
  • Малко по-малко от фронтовите затворени модели
  • Много по-малко тулкария в сравнение с проперитарените API-то

Рекорд от битки

В 1 битка в Пантеона.

0
1-во
1
2-ро
0
3-то

Last battle

Отзиви

4.6

Средно от 5 оценки.

5
3
4
2
3
0
2
0
1
0

Влез, за да оставиш отзив.

SG

Sanjay Gupta

Jan 7, 2026

Does the job

Pretty happy overall. Open-weight release just works and large 128K context window. but no dealbreakers — I'd recommend it to a friend without hesitating.

Fatima Zahra

Fatima Zahra

Nov 26, 2025

Does the job

Pretty happy overall. Open-weight release just works and handles multiple images per prompt. but no dealbreakers — I'd recommend it to a friend without hesitating.

Naomi Suzuki

Naomi Suzuki

Oct 12, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is interleaved image and text inputs — handled better than most — and handles multiple images per prompt. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

TA

Tariq Aziz

Oct 7, 2025

Solid for our team

We rolled this out across the team last quarter and open weights for self-hosting. Open-weight release fits neatly into how we already work, and interleaved image and text inputs removed a step we used to do by hand. Smaller than frontier closed models, which is the main caveat, but it has held up under daily use.

Aaliyah Johnson

Aaliyah Johnson

Aug 30, 2025

Years in this space

I've evaluated a lot of these over the years. What stands out here is 12B parameter vision-language model — handled better than most — and open weights for self-hosting. Smaller than frontier closed models is my one real gripe. Worth the time if this is your use case.

Въпроси

Колко изображения и колко текст мога да включа в един единствен промпт?

Pixtral поддържа смесени входове от изображения и текст в един контекст от 128 K токена, като позволява неограничен брой изображения (в тяхната естествена резолюция) заедно с дълъг текст в един промпт.

Asked by Lorenzo Bianchi · Nov 20, 2025

Продължава ли да се поддържа Pixtral 12B и има ли по-нови алтернативи?

Pixtral 12B е обезвреждан и вече не се поддържа; Mistral AI препоръчва използването на по-новите, по-мощни vision‑language модели, които заменят Pixtral за продукционни цели.

Asked by Carlos Mendoza · Nov 10, 2025

Какъв хардуер е необходим, за да се изпълнява Pixtral 12B ефективно?

Моделът изисква значителна GPU памет поради 12 млрд параметъра и 400 млн параметъра визуален енкодер; типичните внедрения използват висококласови GPU (например A100 с 40 GB или еквивалент) за обработка на 128 K токен контекст и множество изображения.

Asked by Ivo Novotný · Nov 6, 2025

Мога ли да хоствам Pixtral 12B самостоятелно и под какъв лиценз?

Да, Pixtral 12B е публикуван под Apache 2.0 лиценз с отворен код, което ви позволява да изтеглите тежестите и да стартирате модела локално на собствената си хардуерна инфраструктура.

Asked by Priya Nair · Oct 12, 2025

Задай въпрос

Алтернативи на Лабилнова систем данних

Bifrost interface preview
BifrostЛабилнова систем данних

Високопроизводителен вход за LLM, обединяващ 1000+ модели зад един API.

5.0 (4)
Free
Latest DeepSeek R2 interface preview
Latest DeepSeek R2Лабилнова систем данних

Настоящата-генерация разумни AI модел с фокус върху съжденията на DeepSeek

4.8 (6)
Free
DeepSeek V3 interface preview
DeepSeek V3Лабилнова систем данних

Отворено-соурсова смесена експертна модель, предлагаща GPT-4o-ни ниво на анализи при една десета от стойността.

4.8 (6)
Free
Latest Grok 3 AI interface preview
Latest Grok 3 AIЛабилнова систем данних

Конверсионален АИ от xAI, създаден за изводи, изследвания и реално време отговори.

4.8 (5)
Free
Llama 3.3 interface preview
Llama 3.3Лабилнова систем данних

Офертата на Мета на многоезична, отворена-вета LLM подобрена за ефективно и висококачествено създаване на текстове.

4.8 (5)
Free
Simple MP3 to Text interface preview
Simple MP3 to TextЛабилнова систем данних

ЕОЛ-поцелен MP3 до текст конвертор за превръщане на аудио в четими и четими препратки.

4.8 (5)
Free
DeepSeek R1 interface preview
DeepSeek R1Лабилнова систем данних

Отворен-кодова голема модел за език, обещаваща много добри резултати в задачи за мислене, математика и програмиране с лиценза MIT за свободен използване и модификация.

4.8 (4)
3Free
OpenAI o1 interface preview
OpenAI o1Лабилнова систем данних

Програмата на OpenAI е съзdana с фокус върху рационалното мислене и е предназначена за сложни, многовиплевно заявки за избор на решение.

4.8 (4)
Free