წარსული ბრძოლა · 2026-08-01 UTC
LLM შერკინება — 1 აგვისტო, 2026
LLM კატეგორიიდან. 14 ნიშნები განთავსებული 5 მებრძოლზე. DeepSeek R1-მა აიღო გვირგვინი.
საბოლოო შედეგები
შემადგენლობა
მებრძოლები
ამ ბრძოლაში მონაწილე ყველა ხელსაწყოს პროფილი, დალაგებული მათი საბოლოო ქულის მიხედვით.

DeepSeek R1
ღია წყაროს დიდი ენის მოდელი, რომელიც გამოირჩევა ლოგიკით, მათემატიკით და პროგრამირებაში, MIT ლიცენზიით უფასო გამოყენებით და მოდიფიცირებით.

DeepSeek R1 არის ღია-წყაროს დიდი ენის მოდელი, რომელიც განსაკუთრებულად excels reasoning, math, coding tasks‑ში. იგი იყენებს Mixture of Experts (MoE) არქიტექტურას, რომლის 37B აქტიური პარამეტრები და 671B საერთო პარამეტრები 128K კონტექსტის სიგრძეს მხარს უჭერს. მოდელი მოიცავს მოწინავე reinforcement learning ტექნიკებს, რათა მიიღოს self-verification, multi-step reflection და ადამიანის-შესაბამის reasoning შესაძლებლობები. DeepSeek R1 მოიპოვა state-of-the-art შესრულება სხვადასხვა benchmarks‑ში, მათ შორის 97.3% accuracy MATH-500‑ზე, 79.8% pass rate AIME 2024‑ზე, და 96.3% Codeforces მონაწილეებს გადააჭარბა. მოდელი ხელმისაწვდომია მრავალფეროვანი ვარიანტებით, 1.5B‑დან 70B პარამეტრამდე, და MIT ლიცენზიით თავისუფლად გამოსაყენებლად და მოდიფიცირებისთვის. DeepSeek R1 შეგიძლიათใช้ฟรี ონლაინ, ხოლო WebGPU‑accelerated ვერსია ლოკალურად ბრაუზერში გაშვება. მოდელი შექმნილია კომპლექსური პრობლემების გადაჭრის, მრავალენოვანი გაგებისა და წარმოების ხარისხის კოდის გენერაციისთვის. მისი სიძლიერეები მოიცავს შესანიშნავ მათემატიკურ აზროვნებას, კოდის გენერაციას და ბუნებრივი ენის გაგების შესაძლებლობებს. თუმცა, როგორც ღია წყაროს მოდელი, მისი დანერგვა და კონკრეტული გამოყენების შემთხვევებისთვის მორგება ტექნიკური ექსპერტობის მოთხოვნის გამო შეიძლება საჭირო იყოს. DeepSeek R1 მდებარეობს AI მოდელებში მსოფლიო მასშტაბით უმაღლესი დონის შესრულებით, რომლის შესაძლებლობებიც შედარებადია წამყვან კერძო გადაწყვეტილებებთან. მისი ღია წყაროს ბუნება აძლევს საშუალებას საზოგადოებით დაფუძნებულ განვითარებას და უწყვეტი განახლებებს, მათ შორის დაგეგმილი მრავალმოდული მხარდაჭერა, საუბრის გაუმჯობესება და განაწილებული inference‑ის ოპტიმიზაცია. მოდელს აქვს სრულად გაძლიერებული სწავლების (reinforcement learning) განვითარება, რაც მას საშუალებას აძლევს GPT‑4‑ის დონეზე მათემატიკური წარმადობის მიღწევას მნიშვნელოვნად ნაკლებ ღირებულებით. chain-of-thought visualization შესაძლებლობა აჩენს AI‑ს 'black box' გამოწვევებს, მიგვაწოდებს მოდელის აზროვნების პროცესის ხედვებს. DeepSeek R1-ის API OpenAI‑თან თავსებადი endpoint‑ი უზრუნველყოფს ინტეგრაციისთვის, რომლის ფასი 0,14$ თითო მილიონ token‑ზე. მოდელის წონები open-source‑ია, რაც იძლევა კომერციულ გამოყენებისა და მოდიფიკაციის შესაძლებლობას.
კრიტერიუმების დაყოფა
- მონაცემთა ექსპერტების შერწყმის (MoE) არქიტექტურა
- მაღალ დონის განმეორებითი სწავლების ტექნიკა
- თვითდამოწმება და მრავალფაზიანი შეხედვის შესაძლებლობები
- ადამიანის შესაბამისი ლოგიკა
- 128K კონტექსტის სიგრძის მხარდაჭერა
- OpenAI‑თან თავსებადი API‑ის ბოლო წერტილი

Eye2.AI
შედარეთ საუკეთესო AI მოდელების პასუხები ერთ გვერდზე ერთი პრომტის საშუალებით — უფასოდ, რეგისტრაციის გარეშე.

Eye2.AI არის მრავალმოდელური AI შედარების ხელსაწყო, რომელიც მომხმარებლებს აძლიერებს შესაძლებლობას, ერთი პრომპტ გაუგზავნონ რამდენიმე წამყვანი large language model-ს და მათი პასუხები გვერდით გვერდით ნახონ. ტონის, სიზუსტის, სიღრმის და ლოგიკური აზროვნების განსხვავებების გამოჩინებით, იგი ეხმარება მომხმარებლებს გადაწყვიტონ, რომელი მოდელი საუკეთესოა მითითებული დავალებისთვის, მრავალჯერადი აბონამენტის გადახდის გარეშე. სერვისი უფასოდაა და ანგარიშის შექმნის საჭიროება არ გაქვთ, რაც ხელს უწყობს არასამთავრობო ექსპერიმენტირებას, კვლევას და სწრაფ ფაქტ‑შეამოწმებას მოდელებს შორის. იგი განსაკუთრებით გამოსადეგია მწერელებს, დეველოპერებს, სტუდენტებს და ყველას, ვინაც დაინტერესებულია, როგორ მიდის სხვადასხვა AI სისტემა ერთსა და იმავე კითხვაზე.
კრიტერიუმების დაყოფა
- ერთად პრომტით, მრავალმოდელური მოთხოვნა
- გვერდით-გვერდით პასუხის განლაგება
- ტოპ AI მოდელებზე წვდომა ერთ ადგილში
- ანგარიში ან შესვლა საჭირო არ არის
- უფასოდ
- სწრაფი პრომტის ექსპერიმენტული სამუშაო ნაკადი

OpenAI o3
OpenAI-ს მოწინავე რეზონირების მოდელი კომპლექსური, მრავალნაბიჯიანი პრობლემების გადასაჭრელად

OpenAI o3 არის წინაპული აზროვნება მოდელი, რომელიც შექმნილია იმ პრობლემების მოსაგვარებლად, რომლებიც მოითხოვენ ზუსტი, ნაბიჯ-ნაბიჯ აზროვნებას. იგი ააშენებულია o-serial მიდგომის საფუძველზე, რომელიც inference დროს მეტი გამოთვლების დახარჯვას გულისხმობს, რათა დაგეგმოთ, შეამოწმოთ და გააუმჯობესოთ პასუხები, რაც მას შესაფერისს ხდის მათემატიკის, კოდის, მეცნიერებისა და ლოგიკური ანალიზის დავალებებისთვის. საერთო მიზნების ჩატ მოდელებთან შედარებით, o3 პრიორიტეტს აძლევს ღრმა შემუშავებას, არა სწრაფობას. ის შეუძლია გაუზუსტებულ მოთხოვნებს დეტალებად გადაყვანა, სხვადასხვა მიდგომის შეფასება და უფრო საიმედო შედეგების წარმოქმნა ბენჩმარკებზე, რომლებიც გამოირჩევა აზროვნების და ხელსაწყოების გამოყენებით. დეველოპერებს შეუძლიათ ისთან წვდომა OpenAI API და ChatGPT-ის მეშვეობით, სადაც ის ინტეგრირდება ვებ-ბრაუზინგ, Python და ფაილის ანალიზის მსგავსი ხელსაწყოებთან. მოდელი მიზნად ისახავს კვლევაზე, ინჟინერული და ძლიერი მომხმარებელთა ჯგუფს, რომლებიც საჭიროებენ უფრო ძლიერი ზუსტობას რთულ პრობლემებზე და მზად არიან გარკვეული ლატენსია და ხარჯები გადაეცეს უფრო მაღალი ხარისხის შედეგებისთვის.
კრიტერიუმების დაყოფა
- გაფართობილი 'chain-of-thought' reasoning
- ხელსაწყოების გამოყენება, მათ შორის კოდის, ვებსაიტებისა და ფაილის შეყვანა
- დიდი კონტექსტური ფანჯარა გრძელ დოკუმენტებისთვის
- API და ChatGPT ხელმისაწვდომობა
- STEM benchmarks-ზე გაუმჯობესებული სიზუსტე
- მხρίζει კომპლექსური აგენტური სამუშაო ნაკადები
Pronoia
არაბული ენისთვის განკუთვნილი დიდი ენობრივი მოდელი ბუნებრივი გაგებისთვის და გენერაციისთვის დახვეწილი.
Pronoia არის დიდი ენობრივი მოდელი, რომელიც სპეციფიკურად არაბული ენისთვისაა შესწავლილი, რათა არაბულ ენაზე უფრო ზუსტი გაგება, გენერაცია და ლოგიკური მსჯელობა შესაძლებელი იყოს, ვიდრე საერთო-მიზანობრივი მრავალენოვანი მოდელები. ის არის წინამძღოლი არაბულენოვანი LLM, რომელსაც გააჩნია ოპტიმიზაცია დიალექტების, კლასიკური ფორმებისა და თანამედროვე სტანდარტული არაბული ენისთვის. მოდელი გამოიყენება სახელმძღვანელო შემცველობის შექმნაში, რეზიუმეში, თარგმანში, კლიენტთა მხარდაჭერასა და საუბარი AI-ში არაბულ ბაზარზე. საწვრთნელი მონაცემების არაბულ მონაცემებზე კონცენტრირებით, Pronoia სამიზნე ნიუანსებს, როგორიცაა მორფოლოგია, დიაკრიტიკული ნიშნები და კულტურული კონტექსტი, რომლებსაც უფრო ფართო მოდელები ხშირად არათანხმედი სახით განიხილავენ.
კრიტერიუმების დაყოფა
- არაბული ენისთვის ოპტიმიზირებული ენობრივი მოდელი
- ტექსტის გენერაცია და რეზიუმე
- თარგმანის მხარდაჭერა
- საკონვერსაციო და ჩატბოტ შესაძლებლობები
- საწარმოო არაბული NLP-ისთვის შესაფერისი
- MSA-სა და დიალექტების დაფარვა

Gemini 2.0 Flash
Google-ის სწრაფი, მრავალმოდალური AI მოდელი, შექმნილი რეალურ‑დროის აგენტური დავალებებისთვის 1M‑ტოკენის კონტექსტის ფანჯრით.

Gemini 2.0 Flash არის Google DeepMind-ის შემდეგი თაობის მოდელი, რომელიც ოპტიმიზებულია სიჩქარეს, მასშტაბზე და მრავალმოდალურ აზროვნებაზე. იგი იღებს ტექსტს, სურათებს, აუდიოსა და ვიდეოს შეყვანის სახით და შეუძლია გენერირება ტექსტის, სურათის და აუ�დიოს გამოსავალის სახით, რაც მას შესაფერისს ხდის მდიდრულ ინტერაქტიურ აპლიკაციებში. მოდელი, რომელიც განკუთვნილია აგენტური სამუშაო ნაკადებების გათვალისწინებით, იძლევა ადგილობრივ ინსტრუმენტებთან სამუშაოს, ფუნქციის გამოძახების და 1M-token კონტექსტის ფანჯარის მხარდაჭერას დიდი დოკუმენტების, კოდბაზის ან გრძელვადიან სესიის დამუშავებისთვის. დაბალი ლატენცია მას ქმნის პრაქტიკულ არჩევანს ასისტენტებისთვის, რეალურ‑დროში ანალიტიკისა და production‑scale deployments‑ისთვის. დეველოპერებს შეუძლიათ მიიღოთ Gemini 2.0 Flash Gemini API-ის, Google AI Studio-ის და Vertex AI-ის საშუალებით, SDK‑ები კი ხელმისაწვდომია ძირითად ენებში.
კრიტერიუმების დაყოფა
- 1M‑ტოკენის კონტექსტის ფანჯარა
- მრავალმოდალური შეყვანა: ტექსტი, სურათი, აუდიო, ვიდეო
- ნატურალური ინსტრუმენტების გამოძახება და კოდის შესრულება
- რეალურ დროში ნაკადისგან პასუხები
- სურათის და აუდიოს გენერაცია
- ხელმისაწვდომია Gemini API და Vertex AI-ის საშუალებით



