קרב קודם · 2024-01-17 UTC
LLM התמודדות — 17 בינואר 2024
מקטגוריית LLM. 37 סימונים הוצבו על פני 8 לוחמים. ASI:One זכה בכתר.
הדירוג הסופי
ההרכב
הלוחמים
פרופילים של כל כלי שהשתתף בקרב הזה, ממוין לפי הציון הסופי.


ASI:One הוא עוזר בינה מלאכותית שנבנה סביב רעיון של אינטליגנציה אגנטית, שבו ממשק שיחה יכול לשלוח ולתאם סוכנים אוטונומיים מיומנים לטיפול בבקשות מורכבות. במקום להחזיר רק טקסט, הוא יכול לתכנן, לקרוא כלים ולבצע תהליכי עבודה בשם המשתמש. פותח בתוך אקוסיסטם של Artificial Superintelligence Alliance, הוא מציג עצמו כ‑סוכן אישי מבוסס AI שמתחבר לרשתות סוכנים מבוזרות. משתמשים יכולים לשוחח איתו לשאלות יומיומיות או להקצות לו משימות ארוכות יותר כגון מחקר, השוואות, תיאום לוחות זמנים והסתכלות על נתונים בין שירותים מחוברים.
חלוקת קריטריונים
- אינטרפייס צ'אט שיחתי
- ניהול סוכנים אוטונומיים
- תכנון וביצוע משימות במספר שלבים
- חיבור לסוכנים ושירותים חיצוניים
- זיכרון והקשר בסגנון עוזר אישי
- בנוי על ערימת הסוכנים של ASI Alliance

Gemini 2.0 Flash
המודל המונדלי המהיר של Google, שנבנה למשימות סוכנים בזמן אמת עם חלון הקשר של 1 מיליון אסימונים.

Gemini 2.0 Flash הוא המודל מהדור הבא של Google DeepMind, מותאם למהירות, קנה מידה והיסק רב‑מודלי. הוא מקבל טקסט, תמונות, אודיו ו‑ווידאו כקלט ויכול לייצר טקסט, תמונות ופלט אודיו, מה שהופך אותו למתאים ליישומים אינטראקטיביים עשירים. עוצב במחשבה על זרימות עבודה אג'נטיות, המודל תומך בשימוש בכלים באופן טבעי, בקריאת פונקציות, ובחלון קונטקסט של עד מיליון טוקנים לטיפול במסמכים גדולים, בסיסי קוד או מושבים ממושכים. השהייה הנמוכה הופכת אותו לבחירה פרקטית עבור אסיסטנטים, ניתוח בזמן אמת ופריסות בקנה מידה תעשייתי. מפתחים יכולים לגשת ל‑Gemini 2.0 Flash דרך Gemini API, Google AI Studio ו‑Vertex AI, כאשר SDKs זמינים במגוון שפות עיקריות.
חלוקת קריטריונים
- חלון הקשר של 1 מיליון אסימונים
- קלט מרובה-מודים: טקסט, תמונה, שמע, וידאו
- קריאות כלים מקוריים והפעלת קוד
- תגובות זרימה בזמן אמת
- יצירת תמונות ושמע
- זמין באמצעות Gemini API ו-Vertex AI

Mistral Small 3
מודל תיאור־לשון קטן, פתוח ומאובטח, המאפשר תרחיקות אשראי ומחירי חישוב נמוכים.

Mistral Small 3 הוא מודל שפה גדול קל משקל מבית Mistral AI, שנועד להציע יכולות היסק חזקות ויצירתיות תוך פעילות יעילה על חומרה מתונה. הוא מיועד למפתחים ולארגונים שמעוניינים ב‑AI חזק מבלי לשאת בעלויות תשתית של מודלים בקנה מידה קצה. משוחרר ברישיון פתוח, המודל ניתן לאירוח עצמי, לכוונון עדין ולהטמעה ביישומים מסחריים. השילוב שלו של מהירות, דיוק ויעילות משאבים הופך אותו למתאים לעוזרי צ'אט, יצירת תוכן, משימות קוד ולפריסות מקומיות שבהן חשובה ההשהייה או הפרטיות.
חלוקת קריטריונים
- שחרור מודל גלי-משקל
- מאופטימי להסתברות יכולת
- תחרותי המדדי תרחיקות
- שמורת-מותן לפשיט-הצבה ומלאכותית-שינוי
- ראשית טעינה-מומחה
- תמיכה-רווח בטעינה-ל-אזור


OpenAI o3 הוא מודל היסק חדשני שנועד להתמודד עם בעיות הדורשות חשיבה זהירה ושלבית. הוא בונה על גישה של סדרת o, שלוקחת יותר משאבי חישוב בזמן היסק כדי לתכנן, לאמת ולשפר תשובות, מה שהופך אותו למ 적합 עבור משימות במתמטיקה, קידוד, מדע וניתוח לוגי. בהשוואה למודלי צ'אט למטרות כלליות, o3 מדגיש עומק על פני מהירות. הוא יכול לפרק הנחיות מעורפלות, להעריך מספר גישות וליצור פלטים אמינים יותר בנצחונות שמדגישים היגיון ושימוש בכלים. מפתחים יכולים לגשת אליו דרך ה-OpenAI API ו-ChatGPT, שם הוא משתלב עם כלים כמו גלישה באינטרנט, Python וניתוח קבצים. הדגם מיועד לחוקרים, מהנדסים ומשתמשים מתקדמים הזקוקים לדיוק גבוה יותר בפתרון בעיות קשות והם מוכנים להתפשר על קצת השהיה ועלות עבור תוצאות באיכות גבוהה יותר.
חלוקת קריטריונים
- תאר-שרשר, רציונלי-של-חשב
- לא-חשב-מד-ך, web, file inputs
- Large context window for long documents
- API ו- ChatGPT availability
- Improved accuracy on STEM benchmarks
- Supports complex agentic workflows

DeepSeek R1
מודל שפה גדול בקוד פתוח המתמחה במשימות היגיון, מתמטיקה ותכנות עם רישיון MIT לשימוש ושינוי בחינם.

DeepSeek R1 הוא מודל שפה גדול בקוד פתוח המצטיין בהיסק, במתמטיקה ובמשימות קידוד. הוא משתמש בארכיטקטורת Mixture of Experts (MoE) עם 37 מיליארד פרמטרים פעילים ו‑671 מיליארד פרמטרים סה"כ, ותומך באורך הקשר של 128K. המודל משלב טכניקות למידת חיזוק מתקדמות כדי להשיג אימות עצמי, חשיבה מרובת שלבים והיסק תואם אנושית. DeepSeek R1 השיג ביצועים ברמת‑ה‑אמנות במבחנים שונים, כולל דיוק של 97.3% ב‑MATH‑500, שיעור מעבר של 79.8% ב‑AIME 2024, ועולה על 96.3% ממשתתפי Codeforces. המודל זמין במספר גרסאות, בטווח של 1.5B עד 70B פרמטרים, ורישיון MIT מאפשר שימוש חופשי ושינוי. ניתן להשתמש ב‑DeepSeek R1 אונליין בחינם, וגרסה מואצת ב‑WebGPU יכולה לרוץ באופן מקומי בדפדפן. המודל תוכנן לפתרון בעיות מורכבות, הבנה מרובת שפות וייצור קוד ברמת ייצור. חוזקיו כוללים חשיבה מתמטית יוצאת דופן, יצירת קוד והבנת שפה טבעית. עם זאת, כמודל קוד פתוח, ייתכן ויידרש ידע טכני כדי לפרוס ולכוון אותו למקרים ספציפיים. DeepSeek R1 ממוקמת בין המודלים המובילים בביצועים בעולם, עם יכולות השוות לפתרונות הקנייניים המובילים. האופי open-source שלה מאפשר פיתוח קהילתי מתמשך ושדרוגים רציפים, כולל תמיכה מתוכננת במודוליות multimodal, חיזוק conversational, ואופטימיזציית distributed inference. המודל עבר פיתוח בטה של reinforcement learning, מה שמאפשר לו להגיע לביצועי מתמטיקה ברמת GPT-4 בעלות משמעותית נמוכה יותר. יכולת ה‑visualization של chain-of-thought מתמודדת עם אתגרי ה‑black box של AI, ומספקת תובנות על תהליך ההיסק של המודל. API של DeepSeek R1 מציע נקודת קצה תואמת ל‑OpenAI לשילוב, במחיר של 0.14 $ לכל מיליון טוקנים. משקלי המודל זמינים בקוד פתוח, מה שמאפשר שימוש מסחרי ושינוי.
חלוקת קריטריונים
- ארכיטקטורת Mixture of Experts (MoE)
- טכניקות למידה חיזוק מתקדמות
- יכולות אימות עצמי והיסטוריה רב-שלבית
- היגיון מיושר לאדם
- תמיכה באורך הקשר של 128K
- נקודת קצה API תואמת OpenAI

DeepSeek V3
דגם בקוד פתוח עם ארכיטקטורת תערובת-מומחים, המציע יכולות היסק ברמת GPT-4o במחיר נמוך משמעותית.

DeepSeek V3 הוא מודל שפה בקנה מידה גדול מסוג mixture-of-experts (MoE) שפותח על ידי DeepSeek AI. המודל מפעיל רק תת‑קבוצה של הפרמטרים הכוללים שלו לכל טוקן, מה שמאפשר לו לספק ביצועים חזקים בהיסק, במתמטיקה ובמשימות קידוד תוך שמירה על עלויות אינפרנס משמעותית נמוכות לעומת מודלים צפופים דומים. עם משקלים פתוחים, DeepSeek V3 הפכה לבחירה פופולרית בקרב מפתחים וחוקרים שזקוקים למודל יסוד חזק שניתן לארח בעצמם, לבצע עליו התאמה מדויקת, או לשלב אותו דרך API. המדדים מציבים אותה בתחרות עם מודלים קנייניים מובילים כגון GPT-4o, במיוחד במבחני מתמטיקה והסקת מסקנות לוגיות. המודל מתאים היטב לעוזרים טכניים, צינורות ליצירת קוד, זרימות עבודה מחקריות, ולכל יישום שבו חשובים גם איכות ההיסק וגם יעילות התקציב.
חלוקת קריטריונים
- ארכיטקטורת תערובת-מומחים
- מדדי היסק ומתמטיקה תחרותיים
- משקולות דגם בקוד פתוח
- גישה ל- API דרך פלטפורמת DeepSeek
- תמיכה בחלון הקשר ארוך
- ידידותי לכוונון עדין

Llama 3.3 הוא מודל שפה גדול מבית Meta שנבנה כדי לספק יכולות רציונליות, תכנות ושפות מרובות באופן חזק, תוך היותו יעיל יותר מהמודלים הפלאג'ים הקודמים. הוא תומך במגוון רחב של שפות ומתאים לסיוע בשיחה, יצירת תוכן, סיכום וכלי פיתוח. שוחרר עם משקל פתוח, ניתן לפרוש אותו על מקומות פנימיים או דרך ספקי ענן והפקה עיקריים, מה שמעניק לצוותים גמישות עלות, השהיה וטיפול בנתונים. הגרסה המכוונת הוראות מותאמת למעקב אחרי קווי הנחיה מדויק ולייצור תגובות מועילות ודיאלוגיות. מפתחים משתמשים בדרך כלל ב‑Llama 3.3 כבסיס לשיפור יישומים ממוקדים, מערכות שידרוג באמצעות מחפש וזרימות עבודה אייג'נטיות
חלוקת קריטריונים
- יצירת טקסט רב-לשוני
- גרסה מותאמת לשיחה לפי הוראות
- תמיכה בקשר ארוך
- יכולות תכנות וניתוח
- משקל פתוח לאימון מחדש
- תואם עם מסגרות הפעלה עיקריות
Pronoia
למודל שפה גדול, המתאים שוב ושוב, עם מומצא ייחודי, להבנה ולהפקת איכות רציפה, של מבטא ארצישראלי-ערבי.
פronoia היא מודל שפה גדול המותאם במיוחד לערבית, במטרה לספק הבנה, יצירה והנמקה מדויקים יותר בשפה מאשר מודלים רב-לשוניים למטרות כלליות. הוא ממוקם כמודל LLM מוביל בערבית, עם אופטימיזציות לניבים, צורות קלאסיות וערבית סטנדרטית מודרנית. ניתן להשתמש במודל עבור משימות כגון יצירת תוכן, סיכום, תרגום, תמיכת לקוחות ובינה מלאכותית שיחתית בשווקים דוברי ערבית. על ידי ריכוז האימון שלו על נתונים ערביים, מכוון למינוחים כמו מורפולוגיה, ניקוד והקשר תרבותי שלעתים קרובות מודלים רחבים יותר מטפלים באופן לא עקבי.
חלוקת קריטריונים
- מודל שפה, תאומן למבטא
- הפקת ודיווח כותב
- תמיכה בשפת ת"ר
- דמיון ושיחה
- א-ל- NLP לתאגידים במב' '
- פעול א- 100 ' MSA





