Минала битка · 2026-02-20 UTC

LLM Двубой — 20 февруари 2026 г.

От категория LLM. 14 гласове поставени сред 3 бойци. DeepSeek R1 грабна короната.

Финално класиране

Съставът

Бойците

Профили на всеки инструмент, който се състезава в тази битка, класирани по техния финален резултат.

1DeepSeek R1 logo

DeepSeek R1

Отворен-кодова голема модел за език, обещаваща много добри резултати в задачи за мислене, математика и програмиране с лиценза MIT за свободен използване и модификация.

4.8 (4)
Безплатно
Снимка на DeepSeek R1

DeepSeek R1 е отворен-коден голям модел на езика, който извършва съмнителни, математически и програмиращи задачи извършва съмнителни, математически и програмиращи задачи с висок съоръжение. Използва Мрежа на експерти (MoE) архитектура с 37 милиарда активни параметри и 671 милиард параметри възитки, поддържащ 128K контекстна дължина. Моделът включва напреднали техники на учене на подкрепа за постигане на самозагрижен верифициране, многошаговото отражение и хармонизирана с обществено мнение рационалност на способности. DeepSeek R1 е постигнал бившата точка на сърцето изпълнителни изследвания и различни бенчмаркни тестове, включващи 97,3% точност на МATH-500, 79,8% изпълнителен резултат на АИМЕ 2024 и извикване на 96,3% на участници в Codeforces. Моделът е достъпен в множество варианти, варирани от 1,5 милиарда до 70 милиарда параметри, и е лицензиран под MIT за безплатно използване и модифициране. DeepSeek R1 може да бъде използван онлайн, безплатно, и версията с поддръжка на WebGPU-ускорител заради извършването може да се изпълни локално в браузъра. Моделът е проектиран за сложно решаване на проблеми, за понеждинско разбиране на многуезичните текстове и генериране на производствено качество код. Предимствата му включват изключителен математически рационализъм, генериране на код и умения за понеждинно разбиране на естествените езици. С други думи, като модел, който се разпространява под лиценза GNU, може да изисква техническа експертиза за деплоймента и линейно окачване за определени случаи на употреба. Действащият DeepSeek R1 се класифицира сред най-добрите AI модели в световен мащаб, със сравними способности със световно водещите проприетарни решения. Отвореният му характер позволява за общностно насърчаване на разработките и непрекъснати обновявания, включително планиратите полимодални функции, подобряване на конверсациите и оптимизация на разпределените инференции. Моделът има чисто развитие чрез учене с подкрепление, което му permetва да постига математическия перформенс на GPT-4 във значимо по-малък размер. Възможността за визуализиране на веригата за мисленето се отнася до изтощения на AI "чорът кутия" и посредством това дава възможност за прозрения из модела на процесуане за мислено мислене. Дъбийският DeepSeek R1 API предоставя отворен API-ендпойнт, съвместим с OpenAI, за інтеграция, на който се натоваря $0.14 за милион токени. Весове на модела са отворени за комерсиална употреба и модификация.

Разбивка на критериите

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Свръзка на експерди
  • Усовемени техники за обучение посредством награда
  • Аутовърификация и капацитета за многократно отразяване на мисълта
  • Човешки усмихнат мислене
  • Поддръжка на 128K дължина за контекст
  • Адрес за API, съвместим с OpenAI
2Pixtral 12B 24.09 logo

Pixtral 12B 24.09

Премахваме границите между картините и съдържанието им, обхващайки в голяма размерност многообразни картинки и текстове в рамки на окото на масив от 128K на съответстващия модели.

4.6 (5)
Безплатно
Снимка на Pixtral 12B 24.09

Pixtral 12B 24.09 е полимоделен модел от ИК Mistral, който обработва както снимки, така и съдържание в рамките на една последователност, поддържащи променлив размер и процент на снимките. Въвежда 12-милиардното-параметърен декодер на езиковата липса, комбинирания с визуален процесор, което прави възможни задачи като визуално запитване и ответ, разбиране на документите, интерпретация на диаграмите и обозначаване на снимките. Моделът приема до контекст от 128K токена, което позволява на множество изображения да бъдат вмъкнати в дълъг текстен пътник в една команди. Издаден под лиценз от отворен код, той може да бъде разположен локално или чрез провайзъри за инференция, което го прави подходящ за разработчиците, строители на приложения за зрително-языкови програми, лабораторни протоколи и мултимодални агенти.

Разбивка на критериите

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability1
  • 12Б параметърен модел за зрение-язык
  • Приема съответстващи картинки и текстове
  • Съответстващ размер на контекста от 128K
  • Нативна поддръжка за различни размери на картините
  • Откритите тежести са публични
  • Подходи за OCR, VQA и подзаглавие
3DeepSeek V3 logo

DeepSeek V3

Отворено-соурсова смесена експертна модель, предлагаща GPT-4o-ни ниво на анализи при една десета от стойността.

4.8 (6)
Безплатно
Снимка на DeepSeek V3

"DeepSeek V3 e голяма шкала комбинация-на-специалисти (MoE) езикови модел, развита от DeepSeek AI. Активира само подмножество от общо-бройните му параметри на token, като така му позволя да осигури силна ефективност в изчислителните задачи, математиката и програмиранията, докато съхранява разходите за инференция значително по-високите от съвместими гъсто-напълнени модели." Излезна с отворени тежести, DeepSeek V3 става популярна избор за разработчици и изследователи, които се нуждаят от мощна базов модел за самодържане, настройване или свързване чрез API. Бenchmark-ите поставят в състезание на високо ниво против водещите комерциални модели като GPT-4о, особено при оценки за математически и логически анализ. Моделът е добре пригоден за технически асистенти, потоци за генериране на код, обичаи на изследователската работа, както и всеки апликација, в която важат качеството на доказите и ефективността на бюджетът.

Разбивка на критериите

Ease of use0
Value for money0
Features & power0
Integrations1
Support & docs1
Reliability1
  • Смесена експертна архитектура
  • Съперение аналитични и математически бенчмъркса
  • Отворените важности на модела за скачване по желание
  • Достъп чрез API на платформата DeepSeek
  • Поддръжка на широк контекст
  • Колеблив за отточване