Минула битва · 2024-01-17 UTC

LLM Протистояння — 17 січня 2024 р.

З категорії LLM. 37 позначок поставлено серед 8 бійців. ASI:One здобув корону.

Підсумкові результати

Учасники

Бійці

Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

1ASI:One logo

ASI:One

Мініятурна AI-асистетка, яка координує автономні агенти для виконання багатокрокових завдань.

4.5 (4)
Безкоштовно
Знімок екрана ASI:One

ASI:One - це інтелектуальне агентство, розраховане на ідею агентної інтелектуальності. Так, інтерфейс для спілкування може відправляти та координувати спеціалізовані незалежні агентства для обробки складних запитів. Замість повернення лише тексту воно може планувати, викликати інструменти та виконувати потоки робочих завдань на користь користувача. Rozробований в екосистемі Альянсу мистецтва суперінтелектуальних об’єктів, він позиціонується як особистий агент AI, який інтегрується зі мережами розподілені агентів. Уżyкі можуть спілкуватися з ним у звичайні питання або виробляти завдання триваліші такі як дослідження, порівняння, графіку та пошуки даних на підключених послугах.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Імпульсно-чату інтерфейс
  • Організація автономних агентів
  • Планування та виконання багатокрокових завдань
  • Під'єднання зовнішніх агентів та послуг
  • Помічник особистого стилі пам'яті та контексту
  • Збудовано на стовпі агента ASI-Alliance
2Gemini 2.0 Flash logo

Gemini 2.0 Flash

Найбільший швидкий багатомодальний ІА-модель Google розроблений для операцій в режимі прямої дії зі вікном контексту 1 мільйон токенів.

4.6 (5)
Безкоштовно
Знімок екрана Gemini 2.0 Flash

Gemini 2.0 Флаш є наступною загальнонаселенною версією Google DeepMind, оптимізованою для швидкості, масштабу та багатомодальної логіки. Вона приймає текст, зображення, аудіо та відео як вхідні дані і може генерувати текст, зображення і аудіо як виходу, що робить її придатною для багатофункціональних інтерактивних застосунків. Проєкт розроблений з урахуванням агентних потоків праці, тому модель підтримує використання інструментів згідно їх призначення, виклик функцій та вікно контексту розміром до 1 мільйона токенів для обробки великих документів, основ програми або довгочасних сесій. Низька латентність робить його практичним вибором для помічників, реального часу аналізу та розгортання згідно технічним вимогам в промисловому масштабі. Для розробників програми доступ до Gemini 2.0 Flash надається за допомогою інтерфейсу програмування прикладного рівня Gemini, Google AI Studio та Vertex AI, а для головних мов доступні бібліотеки розробників.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Вікно контексту 1 мільйон токенів
  • Багатомодальне входження: текст, зображення, аудіо і відео
  • Кодова виконавча функція та виконання з використанням внутрішніх інструментів
  • Реальна часу потікова реакція на питання
  • Вироблення зображень та аудіо
  • Доступний за допомогою Gemini API та Vertex AI
3Mistral Small 3 logo

Mistral Small 3

Компактна модель LLM з відкритим вихідним кодом, що забезпечує конкурентну продуктивність із нижчими вимогами до обчислень.

4.5 (4)
Безкоштовно
Знімок екрана Mistral Small 3

Mistral Small 3 — легковажна велика мовна модель від Mistral AI, розроблена для забезпечення потужних можливостей міркування та генерації, працюючи ефективно на скромному обладнанні. Вона орієнтована на розробників та організації, які хочуть мати надійний ШІ без витрат на інфраструктуру, пов'язаних із моделями рівня передових розробок. Випущена під відкритою ліцензією, модель може бути самостійно розміщена, тонко налагоджена та інтегрована у комерційні програми. Її баланс швидкості, точності та ефективності використання ресурсів робить її придатною для чат-асistentів, генерації контенту, завдань кодування та локальних розгортань, де важливі затримка або конфіденційність.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Відкрита модель із відкритими вагами
  • Оптимізовано для ефективних обчислень
  • Конкурентні результати бенчмаркінгу
  • Підтримує тонку настройку та налаштування
  • Придатна для локального розгортання
  • Багатомовна генерація тексту
4OpenAI o3 logo

OpenAI o3

Покращена модель розумового оброблення OpenAI для складних багатоступеневих задач

4.0 (4)
Безкоштовно
Знімок екрана OpenAI o3

OpenAI o3 — це передова модель розумового оброблення, розроблена для вирішення задач, що потребують уважного, послідовного мислення. Вона ґрунтується на підході o-series, де під час виконання моделюється більший обчислювальний ресурс для планування, перевірки та уточнення відповідей, що робить її ідеальною для задач у математиці, програмуванні, науці та логічному аналізі. У порівнянні з універсальними чат‑моделями, o3 акцентує увагу на глибини замість швидкості. Вона може розкладати неоднозначні запити, оцінювати кілька підходів та надавати більш надійні результати у тестах, які оцінюють розуміння та використання інструментів. Розробники можуть отримати доступ до неї через OpenAI API та ChatGPT, де вона інтегрується з інструментами, такими як веб‑перегляд, Python та аналіз файлів. Модель призначена для дослідників, інженерів та досвідчених користувачів, які потребують більшої точності в складних задачах і готові пожертвувати деякою затримкою та витратами заради кращих результатів.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Розширене ланцюгове мислення
  • Використання інструментів, включаючи код, веб та введення файлів
  • Велике вікно контексту для довгих документів
  • Доступність через API та ChatGPT
  • Покращена точність у STEM‑тестах
  • Підтримує складні агентні робочі процеси
5DeepSeek R1 logo

DeepSeek R1

Відкритий джерелний великий модель мови, що відрізняється здатністю до логічного мислення, математичних розрахунків та виконання завдань зі програмуванням на умовах ліцензії MIT безкоштовно та зі змінами

4.8 (4)
Безкоштовно
Знімок екрана DeepSeek R1

DeepSeek R1 - відкрите джерело великомасштабний мовний модуль, що перевершує інших у сфері математичних завдань, логічних міркувань та написання коду. Він використовує архітектуру розподілу експертів (Mixture of Experts, MoE) із 37 мільярдів активних параметрів та 671 мільярдом загальних параметрів, підтримуючи довжину контексту 128 тисяча символів. У моделі застосовані розвинені техніки навченого за допомогою зміщення (advanced reinforcement learning), що дозволяють йому виконувати самовідповідальну перевірку, багаторазову зміну думки та людськосумістку міркування. DeepSeek R1 досяг високого рівня виконавчих можливостей у багатьох бенчмарках, як-от 97,3% точність на MATH-500, 79,8% рівень пройдених завдань на AIME 2024 та перевершенням близько 96,3% учасників Codeforces. Модель надається у декілька варіантів, що варіюються від 1,5 мільярда до 70 мільярдів параметрів, й розповсюджується вільно за ліцензією MIT. DeepSeek R1 можна використовувати онлайн безкоштовно, а версія, збагачена засобами WebGPU, здатна працювати локально у спеціалізованих вікнах веб-проксі. Даний модель розроблений для вирішення складних проблем, багатожовтвової розуміння мови та генерації продукції для створення коду. Його перевагами є вражаючі математичні міркування, генерація коду та можливості розуміння natürlich мов. Однак, у якості відкритого джерела моделі, їй може потребувати технічної експертизи для розгортання та шліфування на конкретні випадки використання. DeepSeek R1 знаходиться у числі найкращих на той час моделей AI у світі, з можливостями, порівнюваними з найкращими власницькими рішеннями. Явна відкритість її складу дозволяє здійснювати спільно-відповідальні дії та постійні оновлення, зокрема запляновано підтримку багатомодальної обробки, покращення розмовної взаємодії та оптимізацію розподілених розрахунків інференції. Ресурс має чистий розвиток за принципами навчання за відміною винагород, що дозволяє йому досягти рівня математичної здатності, що еквівалентна GPT-4, при значно нижчих витратах. Вміст візуалізації процесу мислення за допомогою ланцюгів мислення допомагає розглядати складності AI, пов'язані з проблемами «чорної скриньки», надаючи уявлення про процесу міркцювання ресурсу. Анілізатор DeepSeek R1 пропонує відкритий API із кінцевим точкою, сумісною із OpenAI для інтеграції, яке коштує 0,14 доларів за мільйон токенів. Ваги моделі знаходяться під відкритою ліцензією, що дозволяє використовувати їх комерційно та змінювати свої властивості.

Розподіл критеріїв

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • архітектура Mixture of Experts (MoE)
  • розроблені просочені навчальні техніки
  • сама-верифікація та багатовхідна відображена взаємодія
  • чоловік-зорієнтований процес мислення
  • підтримка довжини контексту 128 тисяч
  • відкритий кінцевий точка інтерфейсу API за умовами OpenAI
6DeepSeek V3 logo

DeepSeek V3

Відкритий відкритий мікс експертів, який пропонує рівень обґрунтування на рівні GPT-4o кошти в кілька разів менше.

4.8 (6)
Безкоштовно
Знімок екрана DeepSeek V3

DeepSeek V3 є масштабним мовним моделлю з змішуванням експертів (MoE), розроблений для DeepSeek AI. Він активує лише підмножину своїх загальних параметрів на відміну від інших токенів, що дозволяє йому забезпечувати високі результати у задачах розуміння, математики та створення програми, одночасно знижуючи операційні витрати на обчислення порівняно із схожими щільними моделями. Вже зі відкритими вагами, DeepSeek V3 здобула популярність серед розробників та дослідників, які шукають здатну модель, яку вони можуть самостійно розміститися, вишколювати чи інтегрувати за допомогою API. Результати порівнянь поміщають її на один рівень з провідними комерційними моделями, подібними до GPT-4o, особливо за оцінки математичних та логічних рішень. Модель підходить добре для технічних помічників, pipeline-ів код-геронації, потоків досліджень та будь-якої програми, де якість аргументації та ефективність бюджету мають важливе значення.

Розподіл критеріїв

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs1
Reliability0
  • Архітектура мікс експертів
  • Суперництво розуміння та математичних бенчмарків
  • Відкриті вагові дані
  • Доступ до API через платформу DeepSeek
  • Підтримка широкого вікна контексту
  • Дружня до налаштування fine-tuning
7Llama 3.3 logo

Llama 3.3

Відкритий багатожмовий LLM Meta, налаштований для ефективного і високої якості генерування тексту.

4.8 (5)
Безкоштовно
Знімок екрана Llama 3.3

Llama 3.3 – велика мова natural languages від Meta, розроблена для забезпечення міцної логіки, програмування й багатомовної здатності при більшій ефективності роботи, ніж попередньо випущені високопробігові моделі. Вона підтримує широкий спектр мов й підходить для роботи асистентів бесіди, генерації вмісту, підсумків й розробчих інструментів. Випущено відкритими вагами, воно може бути розгорнуто на місці або за допомогою головних облакових та провайдерів inference, надаючи командам розрізнення щодо витрат, затримок та обробки даних. Його варіант підлаштований згідно інструкції оптимізований для точної реалізації заповідів та створення корисної, спілкуваннях відповідей. Інженери широко використовують Llama 3.3 як базові даних для підвищення якості спеціалізованих додатків, систем генерування даних для вивчення та агентних потоків управління.

Розподіл критеріїв

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability0
  • Мовику текстового генерування
  • Інструкційно-налаштована версія чата
  • підтримка довгого контексту
  • Можливості кодування та логіки
  • Відкриті ваги для додаткової оптимізації
  • Загальні інструменти для основних інференційної системи
8Pronoia logo

Pronoia

Арабсько‑орієнтована велика мовна модель, підлаштована під розуміння і генерацію на рівні рідної мови.

4.7 (6)
Безкоштовно

Pronoia — велика мовна модель особливо приготувана для арабської мови, яка спрямована на надання більш точного розуміння, генерації та аргументації в цій мові, ніж загальне цілісне багатоземне мовне моделювання. Вона позиціюється як провідне мовне мовне моделювання з акцентом на арабській мові, з оптимізацією діалектів, класичних форм та сучасної стандартої арабської мови. Модель може бути використана для виконання завдань, таких як створення вмісту, підсумування, переклад, підтримка клієнтів та розмовний AI у регіонах, де розмовляють по-арабськи. Зосереджуючи навчання на арабських даних, Pronoia визначає особливості арабської мови, такі як морфологія, діакритики та культурний контекст, які більш широкі моделі часто виконують не завжди однаково.

Розподіл критеріїв

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability0
  • Мовна модель, оптимізована для арабської
  • Генерація тексту та резюме
  • Підтримка перекладу
  • Користування діалогами і чат-ботами
  • Підходить для корпоративного NLP арабської
  • Покриття МСА та діалектів