Минула битва · 2025-08-08 UTC

LLM Протистояння — 8 серпня 2025 р.

З категорії LLM. 28 позначок поставлено серед 6 бійців. DeepSeek V3 здобув корону.

Підсумкові результати

Учасники

Бійці

Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

1DeepSeek V3 logo

DeepSeek V3

Відкритий відкритий мікс експертів, який пропонує рівень обґрунтування на рівні GPT-4o кошти в кілька разів менше.

4.8 (6)
Безкоштовно
Знімок екрана DeepSeek V3

DeepSeek V3 є масштабним мовним моделлю з змішуванням експертів (MoE), розроблений для DeepSeek AI. Він активує лише підмножину своїх загальних параметрів на відміну від інших токенів, що дозволяє йому забезпечувати високі результати у задачах розуміння, математики та створення програми, одночасно знижуючи операційні витрати на обчислення порівняно із схожими щільними моделями. Вже зі відкритими вагами, DeepSeek V3 здобула популярність серед розробників та дослідників, які шукають здатну модель, яку вони можуть самостійно розміститися, вишколювати чи інтегрувати за допомогою API. Результати порівнянь поміщають її на один рівень з провідними комерційними моделями, подібними до GPT-4o, особливо за оцінки математичних та логічних рішень. Модель підходить добре для технічних помічників, pipeline-ів код-геронації, потоків досліджень та будь-якої програми, де якість аргументації та ефективність бюджету мають важливе значення.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Архітектура мікс експертів
  • Суперництво розуміння та математичних бенчмарків
  • Відкриті вагові дані
  • Доступ до API через платформу DeepSeek
  • Підтримка широкого вікна контексту
  • Дружня до налаштування fine-tuning
2Janus pro logo

Janus pro

Багатомодальне відкритого глибинне моделювання для створення зображень та розуміння візуальної інформації в одній сполученій архітектурі

4.8 (4)
Безкоштовно
Знімок екрана Janus pro

Janus Pro - відкритий multimodalний модель AI від DeepSeek, доступна в версіях 1 мільярда і 7 мільярдів параметрів. Вона об'єднує візуальне розуміння та створення зображень в одному фреймворку шляхом розділення візуальних шляхів кодової інформації, що дозволяє моделі інтерпретувати зображення та створювати їх на підставі текстових prompt. Variант 7B забезпечує конкурентоспроможні результати на бенчмарках для створення тексту у вигляді зображення та відповідей на візуальні питання, зазвичай перевершуючи або відповідати великим спеціалізованим моделям. Існуюча під ліцензією MIT, Janus Pro можна самостійно господарювати, тонкувати і інтегрувати в дослідницькі або продукційні канали без обмежень щодо використання. Для розробників, дослідників та хобістрів, яким потрібна гнучка багатомодальна модель фонду для експериментів, прототипування чи створення застосунків, які поєднують створення зображень з розумінням зображень.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Генерування зображень із текстових промахів
  • Відповіді на візуальні питання та аналіз зображень
  • Знову створені трансформовані архітектури
  • Параметричні варіанти у розмірі 1 мільярда та 7 мільярдів
  • Відкриті важелі під ліцензією MIT
  • Підтримка багатомодальних введень та виходів
3DeepSeek R1 logo

DeepSeek R1

Відкритий джерелний великий модель мови, що відрізняється здатністю до логічного мислення, математичних розрахунків та виконання завдань зі програмуванням на умовах ліцензії MIT безкоштовно та зі змінами

4.8 (4)
Безкоштовно
Знімок екрана DeepSeek R1

DeepSeek R1 - відкрите джерело великомасштабний мовний модуль, що перевершує інших у сфері математичних завдань, логічних міркувань та написання коду. Він використовує архітектуру розподілу експертів (Mixture of Experts, MoE) із 37 мільярдів активних параметрів та 671 мільярдом загальних параметрів, підтримуючи довжину контексту 128 тисяча символів. У моделі застосовані розвинені техніки навченого за допомогою зміщення (advanced reinforcement learning), що дозволяють йому виконувати самовідповідальну перевірку, багаторазову зміну думки та людськосумістку міркування. DeepSeek R1 досяг високого рівня виконавчих можливостей у багатьох бенчмарках, як-от 97,3% точність на MATH-500, 79,8% рівень пройдених завдань на AIME 2024 та перевершенням близько 96,3% учасників Codeforces. Модель надається у декілька варіантів, що варіюються від 1,5 мільярда до 70 мільярдів параметрів, й розповсюджується вільно за ліцензією MIT. DeepSeek R1 можна використовувати онлайн безкоштовно, а версія, збагачена засобами WebGPU, здатна працювати локально у спеціалізованих вікнах веб-проксі. Даний модель розроблений для вирішення складних проблем, багатожовтвової розуміння мови та генерації продукції для створення коду. Його перевагами є вражаючі математичні міркування, генерація коду та можливості розуміння natürlich мов. Однак, у якості відкритого джерела моделі, їй може потребувати технічної експертизи для розгортання та шліфування на конкретні випадки використання. DeepSeek R1 знаходиться у числі найкращих на той час моделей AI у світі, з можливостями, порівнюваними з найкращими власницькими рішеннями. Явна відкритість її складу дозволяє здійснювати спільно-відповідальні дії та постійні оновлення, зокрема запляновано підтримку багатомодальної обробки, покращення розмовної взаємодії та оптимізацію розподілених розрахунків інференції. Ресурс має чистий розвиток за принципами навчання за відміною винагород, що дозволяє йому досягти рівня математичної здатності, що еквівалентна GPT-4, при значно нижчих витратах. Вміст візуалізації процесу мислення за допомогою ланцюгів мислення допомагає розглядати складності AI, пов'язані з проблемами «чорної скриньки», надаючи уявлення про процесу міркцювання ресурсу. Анілізатор DeepSeek R1 пропонує відкритий API із кінцевим точкою, сумісною із OpenAI для інтеграції, яке коштує 0,14 доларів за мільйон токенів. Ваги моделі знаходяться під відкритою ліцензією, що дозволяє використовувати їх комерційно та змінювати свої властивості.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability0
  • архітектура Mixture of Experts (MoE)
  • розроблені просочені навчальні техніки
  • сама-верифікація та багатовхідна відображена взаємодія
  • чоловік-зорієнтований процес мислення
  • підтримка довжини контексту 128 тисяч
  • відкритий кінцевий точка інтерфейсу API за умовами OpenAI
4ASI:One logo

ASI:One

Мініятурна AI-асистетка, яка координує автономні агенти для виконання багатокрокових завдань.

4.5 (4)
Безкоштовно
Знімок екрана ASI:One

ASI:One - це інтелектуальне агентство, розраховане на ідею агентної інтелектуальності. Так, інтерфейс для спілкування може відправляти та координувати спеціалізовані незалежні агентства для обробки складних запитів. Замість повернення лише тексту воно може планувати, викликати інструменти та виконувати потоки робочих завдань на користь користувача. Rozробований в екосистемі Альянсу мистецтва суперінтелектуальних об’єктів, він позиціонується як особистий агент AI, який інтегрується зі мережами розподілені агентів. Уżyкі можуть спілкуватися з ним у звичайні питання або виробляти завдання триваліші такі як дослідження, порівняння, графіку та пошуки даних на підключених послугах.

Розподіл критеріїв

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • Імпульсно-чату інтерфейс
  • Організація автономних агентів
  • Планування та виконання багатокрокових завдань
  • Під'єднання зовнішніх агентів та послуг
  • Помічник особистого стилі пам'яті та контексту
  • Збудовано на стовпі агента ASI-Alliance
5Latest DeepSeek R2 logo

Latest DeepSeek R2

Наступнена генерація розумної AI- моделі із серії Діпсік R2

4.8 (6)
Безкоштовно
Знімок екрана Latest DeepSeek R2

Найновіший DeepSeek R2 є продовжувачем логічних моделей DeepSeek R1, розроблений з метою забезпечення більш міцної крок за кроком вирішення проблем у математиці, програмуванні та аналітичних завданнях. Він спрямований на розширення відкритої дослідницької підходу, який зробив попередні випуски DeepSeek популярними серед фахівців та дослідників. За своїми можливостями модель спрямована на поліпшення чутливості, обробку більшої кількості тексту та ефективніше виконання порівняно з попередницею. Тому вона особливо підходить для технічних виконавців, агентних потоків обробки та інтеграції з індивідуальними застосунками. Доступність та конкретні характеристики будуть залежати від офіційних зворотних каналів випуску DeepSeek. Користувачеві часто доступний модель через API, чат-interfejs або шляхом запуску відкритих ваг (де доступні), що забезпечує максимальну згладжуваність між індивідуальним експериментуванням та експлуатаційним розгортанням.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability1
  • Просунуте ланцюгове міркування
  • Розширена вікно контексту
  • Підтримка генерації та відладки програми
  • Мультілінгвістична розуміння
  • Доступ через API та інтерфейс чата,
  • Придатність для агентного застосування
6Pronoia logo

Pronoia

Арабсько‑орієнтована велика мовна модель, підлаштована під розуміння і генерацію на рівні рідної мови.

4.7 (6)
Безкоштовно

Pronoia — велика мовна модель особливо приготувана для арабської мови, яка спрямована на надання більш точного розуміння, генерації та аргументації в цій мові, ніж загальне цілісне багатоземне мовне моделювання. Вона позиціюється як провідне мовне мовне моделювання з акцентом на арабській мові, з оптимізацією діалектів, класичних форм та сучасної стандартої арабської мови. Модель може бути використана для виконання завдань, таких як створення вмісту, підсумування, переклад, підтримка клієнтів та розмовний AI у регіонах, де розмовляють по-арабськи. Зосереджуючи навчання на арабських даних, Pronoia визначає особливості арабської мови, такі як морфологія, діакритики та культурний контекст, які більш широкі моделі часто виконують не завжди однаково.

Розподіл критеріїв

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • Мовна модель, оптимізована для арабської
  • Генерація тексту та резюме
  • Підтримка перекладу
  • Користування діалогами і чат-ботами
  • Підходить для корпоративного NLP арабської
  • Покриття МСА та діалектів