წარსული ბრძოლა · 2024-01-17 UTC
LLM შერკინება — 17 იანვარი, 2024
LLM კატეგორიიდან. 37 ნიშნები განთავსებული 8 მებრძოლზე. ASI:One-მა აიღო გვირგვინი.
საბოლოო შედეგები
შემადგენლობა
მებრძოლები
ამ ბრძოლაში მონაწილე ყველა ხელსაწყოს პროფილი, დალაგებული მათი საბოლოო ქულის მიხედვით.

ASI:One
Agentic AI ასისტენტი, რომელიც აერთიანებს თვითმმართველი აგენტებს, რათა შეასრულოს მრავალნაბიჯიანი დავალებები.

ASI:One არის AI დამხმარე, რომელიც აგებულია აგენტური ინტელიგენციაზე დაფუძნებული იდეაზე: კონვერსაციული ინტერფეისმა სპეციალიზებული ავტონომიური აგენტები გამოიძახება და მართება, რათა დაამუშაოს კომპლექსური მოთხოვნები. მხოლოდ ტექსტის დაბრუნების მაგიერ ის გეგმავს, ხელსაწყოების ზახებას და სამუშაო ნაკადების შესრულებას მომხმარებლის სახელით. Artificial Superintelligence Alliance ეკოსისტემაში შეიქმნილი, ის განთავსებულია პირადი AI აგენტად, რომელიც ინტეგრირებულია დეცენტრალიზებული აგენტების ქსელებთან. მომხმარებლები შეუძლიათ ისთან ჩატიონ ყოველდღიური კითხვებისთვის ან გადაეცეს უფრო გრძელი დავალებები, როგორიცაა კვლევა, შედარებები, გეგმის მორგება და მონაცემების ძებნა დაკავშირებული მომსახურებების ქსელებში.
კრიტერიუმების დაყოფა
- კონვერსაციული ჩატ-ინტერფეისი
- ავტონომიური აგენტების ორკესტრირება
- მრავალნაბიჯიანი დავალებების დაგეგმვა და შესრულება
- გარე აგენტებსა და მომსახურებებსთან მიერთება
- პერსონალური ასისტენტის მსგავსი მეხსიერება და კონტექსტი
- ASI Alliance აგენტის სტეკზე აშენებულია

Gemini 2.0 Flash
Google-ის სწრაფი, მრავალმოდალური AI მოდელი, შექმნილი რეალურ‑დროის აგენტური დავალებებისთვის 1M‑ტოკენის კონტექსტის ფანჯრით.

Gemini 2.0 Flash არის Google DeepMind-ის შემდეგი თაობის მოდელი, რომელიც ოპტიმიზებულია სიჩქარეს, მასშტაბზე და მრავალმოდალურ აზროვნებაზე. იგი იღებს ტექსტს, სურათებს, აუდიოსა და ვიდეოს შეყვანის სახით და შეუძლია გენერირება ტექსტის, სურათის და აუ�დიოს გამოსავალის სახით, რაც მას შესაფერისს ხდის მდიდრულ ინტერაქტიურ აპლიკაციებში. მოდელი, რომელიც განკუთვნილია აგენტური სამუშაო ნაკადებების გათვალისწინებით, იძლევა ადგილობრივ ინსტრუმენტებთან სამუშაოს, ფუნქციის გამოძახების და 1M-token კონტექსტის ფანჯარის მხარდაჭერას დიდი დოკუმენტების, კოდბაზის ან გრძელვადიან სესიის დამუშავებისთვის. დაბალი ლატენცია მას ქმნის პრაქტიკულ არჩევანს ასისტენტებისთვის, რეალურ‑დროში ანალიტიკისა და production‑scale deployments‑ისთვის. დეველოპერებს შეუძლიათ მიიღოთ Gemini 2.0 Flash Gemini API-ის, Google AI Studio-ის და Vertex AI-ის საშუალებით, SDK‑ები კი ხელმისაწვდომია ძირითად ენებში.
კრიტერიუმების დაყოფა
- 1M‑ტოკენის კონტექსტის ფანჯარა
- მრავალმოდალური შეყვანა: ტექსტი, სურათი, აუდიო, ვიდეო
- ნატურალური ინსტრუმენტების გამოძახება და კოდის შესრულება
- რეალურ დროში ნაკადისგან პასუხები
- სურათის და აუდიოს გენერაცია
- ხელმისაწვდომია Gemini API და Vertex AI-ის საშუალებით

Mistral Small 3
კომპაქტური ღია წყაროს LLM, რომელიც უზრუნველყოფს კონკურენტული შესრულებას დაბალი გამოთვლითი მოთხოვნებით.

მიწრალი Small 3 არის მსუბუქი დიდი ენის მოდელი Mistral AI‑სგან, რომელიც შექმნილია მძლავრი აზროვნებისა და გენერაციის შესაძლებლობების შესთავაზებლად, ხოლო ეფექტურად მუშაობს დაბალი დონის აპარატურაზე. ის მიზნად ისახავს დეველოპერებს და ორგანიზაციებს, რომლებიც გნებავთ ძლიერი AI, მაგრამ არ გნებავთ ფრონტირის მასშტაბიანი მოდელების ინფრასტრუქტურული ხარჯები. ღია ლიცენზიის ქვეშ გამოცემული, მოდელი შეიძლება თვითჰოსტირებადი, დეტალური მორგება და კომერციულ აპლიკაციებში ინტეგრირება. მისი სიჩქარის, ზუსტობის და რესურსების ეფექტურობის ბალანსი მას ხდის შესაფერისად ჩატ‑ასისტენტებისთვის, კონტენტის გენერირებისთვის, კოდის ამოცანებისთვის და on‑premise განთავსებებისთვის, სადაც ლატენსია ან კონფიდენციალობა მნიშვნელოვანია.
კრიტერიუმების დაყოფა
- ღია წონის მოდელის გამოქვეყნება
- ეფექტური inference‑ისთვის ოპტიმიზირებულია
- კონკურენტული benchmark შედეგები
- მხρίζει fine‑tuning და პერსონალიზაცია
- შესაბამისია on‑premise განლაგებისთვის
- მულტილინგუალური ტექსტის გენერირება

OpenAI o3
OpenAI-ს მოწინავე რეზონირების მოდელი კომპლექსური, მრავალნაბიჯიანი პრობლემების გადასაჭრელად

OpenAI o3 არის წინაპული აზროვნება მოდელი, რომელიც შექმნილია იმ პრობლემების მოსაგვარებლად, რომლებიც მოითხოვენ ზუსტი, ნაბიჯ-ნაბიჯ აზროვნებას. იგი ააშენებულია o-serial მიდგომის საფუძველზე, რომელიც inference დროს მეტი გამოთვლების დახარჯვას გულისხმობს, რათა დაგეგმოთ, შეამოწმოთ და გააუმჯობესოთ პასუხები, რაც მას შესაფერისს ხდის მათემატიკის, კოდის, მეცნიერებისა და ლოგიკური ანალიზის დავალებებისთვის. საერთო მიზნების ჩატ მოდელებთან შედარებით, o3 პრიორიტეტს აძლევს ღრმა შემუშავებას, არა სწრაფობას. ის შეუძლია გაუზუსტებულ მოთხოვნებს დეტალებად გადაყვანა, სხვადასხვა მიდგომის შეფასება და უფრო საიმედო შედეგების წარმოქმნა ბენჩმარკებზე, რომლებიც გამოირჩევა აზროვნების და ხელსაწყოების გამოყენებით. დეველოპერებს შეუძლიათ ისთან წვდომა OpenAI API და ChatGPT-ის მეშვეობით, სადაც ის ინტეგრირდება ვებ-ბრაუზინგ, Python და ფაილის ანალიზის მსგავსი ხელსაწყოებთან. მოდელი მიზნად ისახავს კვლევაზე, ინჟინერული და ძლიერი მომხმარებელთა ჯგუფს, რომლებიც საჭიროებენ უფრო ძლიერი ზუსტობას რთულ პრობლემებზე და მზად არიან გარკვეული ლატენსია და ხარჯები გადაეცეს უფრო მაღალი ხარისხის შედეგებისთვის.
კრიტერიუმების დაყოფა
- გაფართობილი 'chain-of-thought' reasoning
- ხელსაწყოების გამოყენება, მათ შორის კოდის, ვებსაიტებისა და ფაილის შეყვანა
- დიდი კონტექსტური ფანჯარა გრძელ დოკუმენტებისთვის
- API და ChatGPT ხელმისაწვდომობა
- STEM benchmarks-ზე გაუმჯობესებული სიზუსტე
- მხρίζει კომპლექსური აგენტური სამუშაო ნაკადები

DeepSeek R1
ღია წყაროს დიდი ენის მოდელი, რომელიც გამოირჩევა ლოგიკით, მათემატიკით და პროგრამირებაში, MIT ლიცენზიით უფასო გამოყენებით და მოდიფიცირებით.

DeepSeek R1 არის ღია-წყაროს დიდი ენის მოდელი, რომელიც განსაკუთრებულად excels reasoning, math, coding tasks‑ში. იგი იყენებს Mixture of Experts (MoE) არქიტექტურას, რომლის 37B აქტიური პარამეტრები და 671B საერთო პარამეტრები 128K კონტექსტის სიგრძეს მხარს უჭერს. მოდელი მოიცავს მოწინავე reinforcement learning ტექნიკებს, რათა მიიღოს self-verification, multi-step reflection და ადამიანის-შესაბამის reasoning შესაძლებლობები. DeepSeek R1 მოიპოვა state-of-the-art შესრულება სხვადასხვა benchmarks‑ში, მათ შორის 97.3% accuracy MATH-500‑ზე, 79.8% pass rate AIME 2024‑ზე, და 96.3% Codeforces მონაწილეებს გადააჭარბა. მოდელი ხელმისაწვდომია მრავალფეროვანი ვარიანტებით, 1.5B‑დან 70B პარამეტრამდე, და MIT ლიცენზიით თავისუფლად გამოსაყენებლად და მოდიფიცირებისთვის. DeepSeek R1 შეგიძლიათใช้ฟรี ონლაინ, ხოლო WebGPU‑accelerated ვერსია ლოკალურად ბრაუზერში გაშვება. მოდელი შექმნილია კომპლექსური პრობლემების გადაჭრის, მრავალენოვანი გაგებისა და წარმოების ხარისხის კოდის გენერაციისთვის. მისი სიძლიერეები მოიცავს შესანიშნავ მათემატიკურ აზროვნებას, კოდის გენერაციას და ბუნებრივი ენის გაგების შესაძლებლობებს. თუმცა, როგორც ღია წყაროს მოდელი, მისი დანერგვა და კონკრეტული გამოყენების შემთხვევებისთვის მორგება ტექნიკური ექსპერტობის მოთხოვნის გამო შეიძლება საჭირო იყოს. DeepSeek R1 მდებარეობს AI მოდელებში მსოფლიო მასშტაბით უმაღლესი დონის შესრულებით, რომლის შესაძლებლობებიც შედარებადია წამყვან კერძო გადაწყვეტილებებთან. მისი ღია წყაროს ბუნება აძლევს საშუალებას საზოგადოებით დაფუძნებულ განვითარებას და უწყვეტი განახლებებს, მათ შორის დაგეგმილი მრავალმოდული მხარდაჭერა, საუბრის გაუმჯობესება და განაწილებული inference‑ის ოპტიმიზაცია. მოდელს აქვს სრულად გაძლიერებული სწავლების (reinforcement learning) განვითარება, რაც მას საშუალებას აძლევს GPT‑4‑ის დონეზე მათემატიკური წარმადობის მიღწევას მნიშვნელოვნად ნაკლებ ღირებულებით. chain-of-thought visualization შესაძლებლობა აჩენს AI‑ს 'black box' გამოწვევებს, მიგვაწოდებს მოდელის აზროვნების პროცესის ხედვებს. DeepSeek R1-ის API OpenAI‑თან თავსებადი endpoint‑ი უზრუნველყოფს ინტეგრაციისთვის, რომლის ფასი 0,14$ თითო მილიონ token‑ზე. მოდელის წონები open-source‑ია, რაც იძლევა კომერციულ გამოყენებისა და მოდიფიკაციის შესაძლებლობას.
კრიტერიუმების დაყოფა
- მონაცემთა ექსპერტების შერწყმის (MoE) არქიტექტურა
- მაღალ დონის განმეორებითი სწავლების ტექნიკა
- თვითდამოწმება და მრავალფაზიანი შეხედვის შესაძლებლობები
- ადამიანის შესაბამისი ლოგიკა
- 128K კონტექსტის სიგრძის მხარდაჭერა
- OpenAI‑თან თავსებადი API‑ის ბოლო წერტილი

DeepSeek V3
ღია წყაროს ‘Mixture‑of‑Experts’ მოდელი, რომელიც GPT‑4o‑ს მსგავსი reasoning‑ის და მათემატიკის დონეს, თუმცა მინიმალურ ღირებულებით, უზრუნველყოფს.

DeepSeek V3 არის დიდი მასშტაბის მქონე mixture‑of‑experts (MoE) ენის მოდელი, რომელიც შეიქმნა DeepSeek AI-ის მიერ. ის თითოეული ტოკენისთვის გააქტიურებს მხოლოდ მისი სრული პარამეტრების ქვესეტს, რაც საშუალებას მისცემს მიაწოდოს ძლიერი წარმადობა შეჯამების, მათემატიკისა და კოდირების დავალებებში, ხოლო inference‑ის ხარჯები მნიშვნელოვნად დაბალი შედარებით მსგავსი სიმჭიდრული მოდელებისგან. ღია წვლით გამოქვეყნებული DeepSeek V3 გახდა პოპულარული არჩევანი დეველოპერებისთვის და კვლევებისთვის, რომელთაც სჭირდებათ მძლავრი ბაზისური მოდელი, რომელსაც ისინი შეძლებენ თვითჰოსტად, მორფვაში ან API‑ით ინტეგრაციაში. ბენჩმარკები მისი კონკურენტულად განთავსებს ძირითად საკუთრების მოდელებთან, როგორიცაა GPT‑4o, განსაკუთრებით მათემატიკური და ლოგიკური დასაბუთების შეფასებებში. ამ მოდელი შესაფერისია ტექნიკური ასისტენტებისთვის, კოდის გენერაციის ნაკადებისთვის, კვლევითი სამუშაო ნაკადებისთვის და ნებისმიერ აპლიკაციაში, სადაც მოსაზრების ხარისხი და ბიუჯეტის ეფექტურობა ორივე მნიშვნელოვანია.
კრიტერიუმების დაყოფა
- Mixture‑of‑Experts არქიტექტურა
- კონკურენტული reasoning‑ის და მათემატიკის benchmark-ები
- ღია წყაროს მოდელის წონები
- API წვდომა DeepSeek პლატფორმის მეშვეობით
- გრძელი კონტექსტის ფანჯრის მხარდაჭერა
- მარტივი fine‑tuning
Llama 3.3
Meta-ს მრავალენოვანი ღია წონის LLM, რომელიც მორგებულია ეფექტურ, მაღალი ხარისხიანი ტექსტური გენერაციისთვის.

Llama 3.3 არის დიდი ენის მოდელი Meta-სგან, რომელიც განკუთვნილია ძლიერი ლოგიკური, კოდის დაწერის და მრავალენოვანი შესაძლებლობების მიწოდებისთვის, ხოლო უფრო ეფექტურად მუშაობს, ვიდრე წინაპრების flagship მოდელები. ის მხარს უჭერს მრავალ ენას და შესაფერისია ჩატ-ასისტენტებისთვის, შინაარსის გენერაციისთვის, შეჯამებისთვის და დეველოპერის ხელსაწყოებისათვის. გამოშვების დროს ღია წონებით, ის შეიძლება განთავსდეს ლოკალურად ან ძირითადი ღრუბლის და ინფერენსის მომწოდებლებზე, რაც გუნდებს აძლიერებს მოქნილობას ხარჯების, ლატენსიისა და მონაცემთა დამუშავების მხრივ. მისი ინსტრუქციით მორგებული ვარიანტი ოპტიმიზებულია პრომპტების ზუსტი შესრულებისა და სასარგებლო, დიალოგური პასუხების წარმოებისთვის. პროგრამისტები ხშირად იყენებენ Llama 3.3-ს საბაზისოდ, რათა domain‑specific აპლიკაციების, retrieval‑augmented გენერაციის სისტემებისა და agentic workflows‑ის მორგება.
კრიტერიუმების დაყოფა
- მრავალენოვანი ტექსტური გენერაცია
- ინსტრუქციებზე მორგებული ჩატის ვარიანტი
- დიდი კონტექსტის მხარდაჭერა
- კოდირების და დასაბუთების შესაძლებლობები
- ღია წონები მორგებისთვის
- მთავარი ინეფერენსის ჩარჩოებთან თავსებადია
Pronoia
არაბული ენისთვის განკუთვნილი დიდი ენობრივი მოდელი ბუნებრივი გაგებისთვის და გენერაციისთვის დახვეწილი.
Pronoia არის დიდი ენობრივი მოდელი, რომელიც სპეციფიკურად არაბული ენისთვისაა შესწავლილი, რათა არაბულ ენაზე უფრო ზუსტი გაგება, გენერაცია და ლოგიკური მსჯელობა შესაძლებელი იყოს, ვიდრე საერთო-მიზანობრივი მრავალენოვანი მოდელები. ის არის წინამძღოლი არაბულენოვანი LLM, რომელსაც გააჩნია ოპტიმიზაცია დიალექტების, კლასიკური ფორმებისა და თანამედროვე სტანდარტული არაბული ენისთვის. მოდელი გამოიყენება სახელმძღვანელო შემცველობის შექმნაში, რეზიუმეში, თარგმანში, კლიენტთა მხარდაჭერასა და საუბარი AI-ში არაბულ ბაზარზე. საწვრთნელი მონაცემების არაბულ მონაცემებზე კონცენტრირებით, Pronoia სამიზნე ნიუანსებს, როგორიცაა მორფოლოგია, დიაკრიტიკული ნიშნები და კულტურული კონტექსტი, რომლებსაც უფრო ფართო მოდელები ხშირად არათანხმედი სახით განიხილავენ.
კრიტერიუმების დაყოფა
- არაბული ენისთვის ოპტიმიზირებული ენობრივი მოდელი
- ტექსტის გენერაცია და რეზიუმე
- თარგმანის მხარდაჭერა
- საკონვერსაციო და ჩატბოტ შესაძლებლობები
- საწარმოო არაბული NLP-ისთვის შესაფერისი
- MSA-სა და დიალექტების დაფარვა





