Минала битка · 2026-02-20 UTC
LLM Двубой — 20 февруари 2026 г.
От категория LLM. 14 гласове поставени сред 3 бойци. DeepSeek R1 грабна короната.
Финално класиране
Съставът
Бойците
Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

DeepSeek R1
Отворен-кодова голема модел за език, обещаваща много добри резултати в задачи за мислене, математика и програмиране с лиценза MIT за свободен използване и модификация.

DeepSeek R1 е отворен-коден голям модел на езика, който извършва съмнителни, математически и програмиращи задачи извършва съмнителни, математически и програмиращи задачи с висок съоръжение. Използва Мрежа на експерти (MoE) архитектура с 37 милиарда активни параметри и 671 милиард параметри възитки, поддържащ 128K контекстна дължина. Моделът включва напреднали техники на учене на подкрепа за постигане на самозагрижен верифициране, многошаговото отражение и хармонизирана с обществено мнение рационалност на способности. DeepSeek R1 е постигнал бившата точка на сърцето изпълнителни изследвания и различни бенчмаркни тестове, включващи 97,3% точност на МATH-500, 79,8% изпълнителен резултат на АИМЕ 2024 и извикване на 96,3% на участници в Codeforces. Моделът е достъпен в множество варианти, варирани от 1,5 милиарда до 70 милиарда параметри, и е лицензиран под MIT за безплатно използване и модифициране. DeepSeek R1 може да бъде използван онлайн, безплатно, и версията с поддръжка на WebGPU-ускорител заради извършването може да се изпълни локално в браузъра. Моделът е проектиран за сложно решаване на проблеми, за понеждинско разбиране на многуезичните текстове и генериране на производствено качество код. Предимствата му включват изключителен математически рационализъм, генериране на код и умения за понеждинно разбиране на естествените езици. С други думи, като модел, който се разпространява под лиценза GNU, може да изисква техническа експертиза за деплоймента и линейно окачване за определени случаи на употреба. Действащият DeepSeek R1 се класифицира сред най-добрите AI модели в световен мащаб, със сравними способности със световно водещите проприетарни решения. Отвореният му характер позволява за общностно насърчаване на разработките и непрекъснати обновявания, включително планиратите полимодални функции, подобряване на конверсациите и оптимизация на разпределените инференции. Моделът има чисто развитие чрез учене с подкрепление, което му permetва да постига математическия перформенс на GPT-4 във значимо по-малък размер. Възможността за визуализиране на веригата за мисленето се отнася до изтощения на AI "чорът кутия" и посредством това дава възможност за прозрения из модела на процесуане за мислено мислене. Дъбийският DeepSeek R1 API предоставя отворен API-ендпойнт, съвместим с OpenAI, за інтеграция, на който се натоваря $0.14 за милион токени. Весове на модела са отворени за комерсиална употреба и модификация.
Разбивка на критериите
- Свръзка на експерди
- Усовемени техники за обучение посредством награда
- Аутовърификация и капацитета за многократно отразяване на мисълта
- Човешки усмихнат мислене
- Поддръжка на 128K дължина за контекст
- Адрес за API, съвместим с OpenAI

Pixtral 12B 24.09
Премахваме границите между картините и съдържанието им, обхващайки в голяма размерност многообразни картинки и текстове в рамки на окото на масив от 128K на съответстващия модели.

Pixtral 12B 24.09 е полимоделен модел от ИК Mistral, който обработва както снимки, така и съдържание в рамките на една последователност, поддържащи променлив размер и процент на снимките. Въвежда 12-милиардното-параметърен декодер на езиковата липса, комбинирания с визуален процесор, което прави възможни задачи като визуално запитване и ответ, разбиране на документите, интерпретация на диаграмите и обозначаване на снимките. Моделът приема до контекст от 128K токена, което позволява на множество изображения да бъдат вмъкнати в дълъг текстен пътник в една команди. Издаден под лиценз от отворен код, той може да бъде разположен локално или чрез провайзъри за инференция, което го прави подходящ за разработчиците, строители на приложения за зрително-языкови програми, лабораторни протоколи и мултимодални агенти.
Разбивка на критериите
- 12Б параметърен модел за зрение-язык
- Приема съответстващи картинки и текстове
- Съответстващ размер на контекста от 128K
- Нативна поддръжка за различни размери на картините
- Откритите тежести са публични
- Подходи за OCR, VQA и подзаглавие

DeepSeek V3
Отворено-соурсова смесена експертна модель, предлагаща GPT-4o-ни ниво на анализи при една десета от стойността.

"DeepSeek V3 e голяма шкала комбинация-на-специалисти (MoE) езикови модел, развита от DeepSeek AI. Активира само подмножество от общо-бройните му параметри на token, като така му позволя да осигури силна ефективност в изчислителните задачи, математиката и програмиранията, докато съхранява разходите за инференция значително по-високите от съвместими гъсто-напълнени модели." Излезна с отворени тежести, DeepSeek V3 става популярна избор за разработчици и изследователи, които се нуждаят от мощна базов модел за самодържане, настройване или свързване чрез API. Бenchmark-ите поставят в състезание на високо ниво против водещите комерциални модели като GPT-4о, особено при оценки за математически и логически анализ. Моделът е добре пригоден за технически асистенти, потоци за генериране на код, обичаи на изследователската работа, както и всеки апликација, в която важат качеството на доказите и ефективността на бюджетът.
Разбивка на критериите
- Смесена експертна архитектура
- Съперение аналитични и математически бенчмъркса
- Отворените важности на модела за скачване по желание
- Достъп чрез API на платформата DeepSeek
- Поддръжка на широк контекст
- Колеблив за отточване


