Минула битва · 2024-01-17 UTC
LLM Протистояння — 17 січня 2024 р.
З категорії LLM. 37 позначок поставлено серед 8 бійців. ASI:One здобув корону.
Підсумкові результати
Учасники
Бійці
Профілі кожного інструмента, який змагався в цій битві, ранжовані за підсумковим балом.

ASI:One
Мініятурна AI-асистетка, яка координує автономні агенти для виконання багатокрокових завдань.

ASI:One - це інтелектуальне агентство, розраховане на ідею агентної інтелектуальності. Так, інтерфейс для спілкування може відправляти та координувати спеціалізовані незалежні агентства для обробки складних запитів. Замість повернення лише тексту воно може планувати, викликати інструменти та виконувати потоки робочих завдань на користь користувача. Rozробований в екосистемі Альянсу мистецтва суперінтелектуальних об’єктів, він позиціонується як особистий агент AI, який інтегрується зі мережами розподілені агентів. Уżyкі можуть спілкуватися з ним у звичайні питання або виробляти завдання триваліші такі як дослідження, порівняння, графіку та пошуки даних на підключених послугах.
Розподіл критеріїв
- Імпульсно-чату інтерфейс
- Організація автономних агентів
- Планування та виконання багатокрокових завдань
- Під'єднання зовнішніх агентів та послуг
- Помічник особистого стилі пам'яті та контексту
- Збудовано на стовпі агента ASI-Alliance

Gemini 2.0 Flash
Найбільший швидкий багатомодальний ІА-модель Google розроблений для операцій в режимі прямої дії зі вікном контексту 1 мільйон токенів.

Gemini 2.0 Флаш є наступною загальнонаселенною версією Google DeepMind, оптимізованою для швидкості, масштабу та багатомодальної логіки. Вона приймає текст, зображення, аудіо та відео як вхідні дані і може генерувати текст, зображення і аудіо як виходу, що робить її придатною для багатофункціональних інтерактивних застосунків. Проєкт розроблений з урахуванням агентних потоків праці, тому модель підтримує використання інструментів згідно їх призначення, виклик функцій та вікно контексту розміром до 1 мільйона токенів для обробки великих документів, основ програми або довгочасних сесій. Низька латентність робить його практичним вибором для помічників, реального часу аналізу та розгортання згідно технічним вимогам в промисловому масштабі. Для розробників програми доступ до Gemini 2.0 Flash надається за допомогою інтерфейсу програмування прикладного рівня Gemini, Google AI Studio та Vertex AI, а для головних мов доступні бібліотеки розробників.
Розподіл критеріїв
- Вікно контексту 1 мільйон токенів
- Багатомодальне входження: текст, зображення, аудіо і відео
- Кодова виконавча функція та виконання з використанням внутрішніх інструментів
- Реальна часу потікова реакція на питання
- Вироблення зображень та аудіо
- Доступний за допомогою Gemini API та Vertex AI

Mistral Small 3
Компактна модель LLM з відкритим вихідним кодом, що забезпечує конкурентну продуктивність із нижчими вимогами до обчислень.

Mistral Small 3 — легковажна велика мовна модель від Mistral AI, розроблена для забезпечення потужних можливостей міркування та генерації, працюючи ефективно на скромному обладнанні. Вона орієнтована на розробників та організації, які хочуть мати надійний ШІ без витрат на інфраструктуру, пов'язаних із моделями рівня передових розробок. Випущена під відкритою ліцензією, модель може бути самостійно розміщена, тонко налагоджена та інтегрована у комерційні програми. Її баланс швидкості, точності та ефективності використання ресурсів робить її придатною для чат-асistentів, генерації контенту, завдань кодування та локальних розгортань, де важливі затримка або конфіденційність.
Розподіл критеріїв
- Відкрита модель із відкритими вагами
- Оптимізовано для ефективних обчислень
- Конкурентні результати бенчмаркінгу
- Підтримує тонку настройку та налаштування
- Придатна для локального розгортання
- Багатомовна генерація тексту

OpenAI o3
Покращена модель розумового оброблення OpenAI для складних багатоступеневих задач

OpenAI o3 — це передова модель розумового оброблення, розроблена для вирішення задач, що потребують уважного, послідовного мислення. Вона ґрунтується на підході o-series, де під час виконання моделюється більший обчислювальний ресурс для планування, перевірки та уточнення відповідей, що робить її ідеальною для задач у математиці, програмуванні, науці та логічному аналізі. У порівнянні з універсальними чат‑моделями, o3 акцентує увагу на глибини замість швидкості. Вона може розкладати неоднозначні запити, оцінювати кілька підходів та надавати більш надійні результати у тестах, які оцінюють розуміння та використання інструментів. Розробники можуть отримати доступ до неї через OpenAI API та ChatGPT, де вона інтегрується з інструментами, такими як веб‑перегляд, Python та аналіз файлів. Модель призначена для дослідників, інженерів та досвідчених користувачів, які потребують більшої точності в складних задачах і готові пожертвувати деякою затримкою та витратами заради кращих результатів.
Розподіл критеріїв
- Розширене ланцюгове мислення
- Використання інструментів, включаючи код, веб та введення файлів
- Велике вікно контексту для довгих документів
- Доступність через API та ChatGPT
- Покращена точність у STEM‑тестах
- Підтримує складні агентні робочі процеси

DeepSeek R1
Відкритий джерелний великий модель мови, що відрізняється здатністю до логічного мислення, математичних розрахунків та виконання завдань зі програмуванням на умовах ліцензії MIT безкоштовно та зі змінами

DeepSeek R1 - відкрите джерело великомасштабний мовний модуль, що перевершує інших у сфері математичних завдань, логічних міркувань та написання коду. Він використовує архітектуру розподілу експертів (Mixture of Experts, MoE) із 37 мільярдів активних параметрів та 671 мільярдом загальних параметрів, підтримуючи довжину контексту 128 тисяча символів. У моделі застосовані розвинені техніки навченого за допомогою зміщення (advanced reinforcement learning), що дозволяють йому виконувати самовідповідальну перевірку, багаторазову зміну думки та людськосумістку міркування. DeepSeek R1 досяг високого рівня виконавчих можливостей у багатьох бенчмарках, як-от 97,3% точність на MATH-500, 79,8% рівень пройдених завдань на AIME 2024 та перевершенням близько 96,3% учасників Codeforces. Модель надається у декілька варіантів, що варіюються від 1,5 мільярда до 70 мільярдів параметрів, й розповсюджується вільно за ліцензією MIT. DeepSeek R1 можна використовувати онлайн безкоштовно, а версія, збагачена засобами WebGPU, здатна працювати локально у спеціалізованих вікнах веб-проксі. Даний модель розроблений для вирішення складних проблем, багатожовтвової розуміння мови та генерації продукції для створення коду. Його перевагами є вражаючі математичні міркування, генерація коду та можливості розуміння natürlich мов. Однак, у якості відкритого джерела моделі, їй може потребувати технічної експертизи для розгортання та шліфування на конкретні випадки використання. DeepSeek R1 знаходиться у числі найкращих на той час моделей AI у світі, з можливостями, порівнюваними з найкращими власницькими рішеннями. Явна відкритість її складу дозволяє здійснювати спільно-відповідальні дії та постійні оновлення, зокрема запляновано підтримку багатомодальної обробки, покращення розмовної взаємодії та оптимізацію розподілених розрахунків інференції. Ресурс має чистий розвиток за принципами навчання за відміною винагород, що дозволяє йому досягти рівня математичної здатності, що еквівалентна GPT-4, при значно нижчих витратах. Вміст візуалізації процесу мислення за допомогою ланцюгів мислення допомагає розглядати складності AI, пов'язані з проблемами «чорної скриньки», надаючи уявлення про процесу міркцювання ресурсу. Анілізатор DeepSeek R1 пропонує відкритий API із кінцевим точкою, сумісною із OpenAI для інтеграції, яке коштує 0,14 доларів за мільйон токенів. Ваги моделі знаходяться під відкритою ліцензією, що дозволяє використовувати їх комерційно та змінювати свої властивості.
Розподіл критеріїв
- архітектура Mixture of Experts (MoE)
- розроблені просочені навчальні техніки
- сама-верифікація та багатовхідна відображена взаємодія
- чоловік-зорієнтований процес мислення
- підтримка довжини контексту 128 тисяч
- відкритий кінцевий точка інтерфейсу API за умовами OpenAI

DeepSeek V3
Відкритий відкритий мікс експертів, який пропонує рівень обґрунтування на рівні GPT-4o кошти в кілька разів менше.

DeepSeek V3 є масштабним мовним моделлю з змішуванням експертів (MoE), розроблений для DeepSeek AI. Він активує лише підмножину своїх загальних параметрів на відміну від інших токенів, що дозволяє йому забезпечувати високі результати у задачах розуміння, математики та створення програми, одночасно знижуючи операційні витрати на обчислення порівняно із схожими щільними моделями. Вже зі відкритими вагами, DeepSeek V3 здобула популярність серед розробників та дослідників, які шукають здатну модель, яку вони можуть самостійно розміститися, вишколювати чи інтегрувати за допомогою API. Результати порівнянь поміщають її на один рівень з провідними комерційними моделями, подібними до GPT-4o, особливо за оцінки математичних та логічних рішень. Модель підходить добре для технічних помічників, pipeline-ів код-геронації, потоків досліджень та будь-якої програми, де якість аргументації та ефективність бюджету мають важливе значення.
Розподіл критеріїв
- Архітектура мікс експертів
- Суперництво розуміння та математичних бенчмарків
- Відкриті вагові дані
- Доступ до API через платформу DeepSeek
- Підтримка широкого вікна контексту
- Дружня до налаштування fine-tuning
Llama 3.3
Відкритий багатожмовий LLM Meta, налаштований для ефективного і високої якості генерування тексту.

Llama 3.3 – велика мова natural languages від Meta, розроблена для забезпечення міцної логіки, програмування й багатомовної здатності при більшій ефективності роботи, ніж попередньо випущені високопробігові моделі. Вона підтримує широкий спектр мов й підходить для роботи асистентів бесіди, генерації вмісту, підсумків й розробчих інструментів. Випущено відкритими вагами, воно може бути розгорнуто на місці або за допомогою головних облакових та провайдерів inference, надаючи командам розрізнення щодо витрат, затримок та обробки даних. Його варіант підлаштований згідно інструкції оптимізований для точної реалізації заповідів та створення корисної, спілкуваннях відповідей. Інженери широко використовують Llama 3.3 як базові даних для підвищення якості спеціалізованих додатків, систем генерування даних для вивчення та агентних потоків управління.
Розподіл критеріїв
- Мовику текстового генерування
- Інструкційно-налаштована версія чата
- підтримка довгого контексту
- Можливості кодування та логіки
- Відкриті ваги для додаткової оптимізації
- Загальні інструменти для основних інференційної системи
Pronoia
Арабсько‑орієнтована велика мовна модель, підлаштована під розуміння і генерацію на рівні рідної мови.
Pronoia — велика мовна модель особливо приготувана для арабської мови, яка спрямована на надання більш точного розуміння, генерації та аргументації в цій мові, ніж загальне цілісне багатоземне мовне моделювання. Вона позиціюється як провідне мовне мовне моделювання з акцентом на арабській мові, з оптимізацією діалектів, класичних форм та сучасної стандартої арабської мови. Модель може бути використана для виконання завдань, таких як створення вмісту, підсумування, переклад, підтримка клієнтів та розмовний AI у регіонах, де розмовляють по-арабськи. Зосереджуючи навчання на арабських даних, Pronoia визначає особливості арабської мови, такі як морфологія, діакритики та культурний контекст, які більш широкі моделі часто виконують не завжди однаково.
Розподіл критеріїв
- Мовна модель, оптимізована для арабської
- Генерація тексту та резюме
- Підтримка перекладу
- Користування діалогами і чат-ботами
- Підходить для корпоративного NLP арабської
- Покриття МСА та діалектів





