קרב קודם · 2026-07-25 UTC
Observability התמודדות — 25 ביולי 2026
מקטגוריית Observability. 21 סימונים הוצבו על פני 9 לוחמים. Arize AI זכה בכתר.
הדירוג הסופי
ההרכב
הלוחמים
פרופילים של כל כלי שהשתתף בקרב הזה, ממוין לפי הציון הסופי.

Arize AI
מלרכז הערכת LLM ועריכת תצפיות AI שמורכז לסיוע AI ומדעני נתונים במעקב, בתיקון ובקידום ביצועי...'

Arize AI היא פלטפורמת תצפית על AI והערכת LLM. היא מסייעת למפתחים של AI ולמדעני נתונים במעקב, באיתור תקלות ובשיפור ביצועי המודלים שלהם. הפלטפורמה מספקת כלים לזיהוי בעיות והצעת תיקונים, מה שמאפשר למשתמשים לשפר את הדיוק והאמינות של המודלים שלהם. Arize AI מיועדת למפתחים של AI ולמדעני נתונים שצריכים למטב את ביצועי המודלים שלהם. יכולות הפלטפורמה כוללות ניטור ואיתור תקלות, המאפשרים למשתמשים לזהות ולטפל בבעיות במהירות. בנוסף, Arize AI מציעה תכונות להערכת ושיפור ביצועי המודלים, ומאפשרת למשתמשים ללטש את המודלים שלהם עם הזמן. באמצעות Arize AI, משתמשים יכולים לוודא שהמודלים שלהם פועלים בתפוקה מרבית, מה שמוביל לקבלת החלטות טובה יותר ותוצאות משופרות. המיקוד של הפלטפורמה על תצפית והערכה מבדיל אותה משאר כלי פיתוח ה‑AI, והופך אותה למשאב בעל ערך למי שעובד עם מודלים של שפה גדולים ומערכות AI מורכבות.
חלוקת קריטריונים
- מעקב אחרי מודלי AI
- איתור ותיקון בעיות
- הצעת תיקונים
- הערכת ביצועי המודל
- הערכת ואופטימיזציית LLM
Helicone AI היא פלטפורמת נראות ממוקדת מפתחים, שנבנתה במיוחד עבור יישומים המונעים על ידי מודלים שפה גדולים. היא לוכדת בקשות, תגובות, עלויות ולטיות על פני ספקים, ונותנת לצוותים ההנדסיים תצוגה מאוחדת של התנהגות התכונות LLM שלהם בייצור. מעבר לרישום, Helicone מציעה כלים לניפוי בקשות, מעקב אחר זרימות עבודה של סוכנים רב-שלביים, הפעלת הערכות ומעקב אחר שימוש ברמת משתמש. צוותים יכולים לזהות רגרסיות, לשלוט בהוצאות ולשנות בקשות עם נתונים ולא עם ניחושים. היא משתלבת עם ספקי מודלים ומסגרות פופולריים באמצעות פרוקסי קל משקל או רישום אסינכרוני, מה שהופך אותו לפשוט להוסיף לערימות ק существующие ללא שינויים גדולים בקוד.
חלוקת קריטריונים
- רישום בקשות ותגובות
- מעקב אחר עלות ושימוש באסימונים
- ניהול בקשות וגרסאות
- מעקב אחר סוכנים והפעלות
- הערכות ודוחות מותאמים אישית
- אנליטיקה של משתמשים ומגבלות שיעור

llm scout
מעקב אחרי איך המותג שלכם מופיע ב‑ChatGPT, Claude, Perplexity וב‑Google AI Overviews.

LLM Scout הוא כלי ניטור מותגים שנבנה עבור עידן החיפוש הגנרטיבי. הוא עוקב אחרי איך החברה שלכם, המוצרים והמתחרים מוזכרים במגוון אסיסטנטים AI ומנועי תשובה, ומספק לצוותי השיווק ו‑SEO תובנות לערוץ שהכלים האנליטיים המסורתיים מפספסים. הפלטפורמה מריצה פקודות חוזרות על מערכות כמו ChatGPT, Claude, Perplexity ו‑Google AI Overviews, ולאחר מכן מדווחת על נתח הקול, סנטימנט, מקורות הציטוט ושינויים לאורך זמן. צוותים יכולים להשתמש בתובנות אלה כדי לחדד אסטרטגיית תוכן, לזהות פערים שבהם המתחרים מומלצים במקום, ולמדוד את השפעת מאמצי האופטימיזציה שמיועדים למודלים של שפה גדולים.
חלוקת קריטריונים
- מעקב אחרי אזכורים של מותג ומתחרים
- מעקב על פני ChatGPT, Claude, Perplexity ו‑AI Overviews
- ניתוח סנטימנט ונתח הקול
- צפייה במקורות הציטוט
- מעקב אחרי פקודות מותאמות
- דיווח על מגמות היסטוריות

AgentOps הוא פלטפורמה למפתחים המתמקדת במחזור החיים של סוכנים ב‑AI, ומספקת כלים למעקב, ניטור ולשחרור באגים שמגלים מה סוכנים עושים בפועל בזמן הריצה. הוא רושם קריאות ל-LLM, שימוש בכלים, עלויות ושגיאות, כך שהצוותים יוכלו להבין את ההתנהגות של הסוכן בתהליכים מורכבים של מרובה שלבים. מעבר למעקב, AgentOps מציע הצגת סשנים מחדש, ניתוח ביצועים והשתלבות עם מסגרות סוכנים פופולריות כגון LangChain, CrewAI ו-AutoGen. זה מאפשר למהנדסים להחליף את הפרוטוטיפ להפקה עם אמינות מדידה במקום להסתמך על ניחושים או על חיפוש יומנים. הפתרון מיועד למפתחים ולצוותים שמפתחי יישומים מבוססי סוכנות, אשר צריכים לעקוב אחרי רגרסיות, לשלוט בהוצאות ולהוכיח שהסוכנים שלהם פועלים כראוי לפני ואחרי הפריסה.
חלוקת קריטריונים
- שַ ֵ ע ְצֵ ַ ֵ ֱ ֲ ִ ֵ ָ ֱ ֲ ֵ ֵ ְ ּ ָ ְ ֶ
- עַ ְצֵ ַ ָ ֲ ֳ ֵ ֳ ֹ ֵ ִ ֵ ֿ ֵ ֿ ָ
- ֵב ִ ֵ ִ ֻ ֱ ֲ ֵ ַ ִ ְ ָ ֹ ֵ
- ֵ ֳ ְ ִ ֲ ֻ ְ ֹ ָ ֵ ֿ ֵ ֿ ָ
- ֵ ִ ֱ ֲ ֵ ַ ַ ֵ ֹ ֵ ֲ ֹ ֹ
- ֵ ֵ ֶ ַ ֵ ֵ ֵ ַ ִ ֵ ַ ִ


באתר של פרויקט AI2AI, משתמשים יכולים לצפות בשיחות בזמן אמת בין שני סוכני AI. כדי להתחיל אינטראקציה, משתמשים חייבים ליצור שני ישויות, להקצות להם הנחיה, הקשר, קול ומין, ולבחור מודל שפה. ניתן להתחיל, לשמור ולשתף את האינטראקציה עם משתמשים אחרים באתר. דוגמאות אינטראקציות מסופקות, המראות תרחישים שונים, כגון פיתוי, כעס, סקרנות והצעות מכירה. משתמשים חדשים צריכים להירשם ולקבל $1 זיכוי כדי לחקור את הפלטפורמה. התמחור מבוסס על תעריף לדקה, החל מ-1 סנט לדקה.
חלוקת קריטריונים
- צפייה בשיחה ישירה בין AI ל-AI
- שני ישויות AI שונות בשיחה
- חווית משתמש ללא מגע
- הדגמת התנהגות AI מתעוררת
- ממשק מבוסס דפדפן נגיש

Confident AI היא פלטפורמת הערכה ומעקב לצוותים הבונים יישומי מודלים שפתיים גדולים. מופעלת על ידי מסגרת DeepEval בקוד פתוח, היא מספקת מרחב עבודה מאוחד להפעלת בנצ'מרקים, בדיקות רגרסיה ובדיקות איכות על פני הנחיות, מודלים וצינורות אחזור. הפלטפורמה עוזרת למהנדסים לזהות הזיות, רגרסיות בהנחיות וכישלונות אחזור לפני השחרור, תוך שהיא מציעה ניטור בייצור כדי לעקוב אחר אינטראקציות משתמש אמיתיות. צוותים יכולים לרכז מערכי נתונים, לשתף תוצאות בדיקה ולשנות הנחיות עם משוב מדיד ולא ניחוש. היא מיועדת למפתחים, מהנדסי ML וצוותי בקרת איכות שרוצים גישה מובנית ומונעת מדדי ל- QA של LLM ולא ביקורת ידנית אד-הוק.
חלוקת קריטריונים
- מדדי הערכה המופעלים על ידי DeepEval
- בדיקת רגרסיה להנחיות ומודלים
- הערכת RAG ואחזור
- ניטור ומעקב בייצור
- ניהול מערכי נתונים ובדיקות
- שיתוף פעולה של צוות על תוצאות הערכה


Edwin AI הוא סוכן AI למבצעי IT שתוכנן להאיץ את גילוי התקלות, הטריאז' והפתרון. הוא מספק פלטפורמה מרכזית לצוותי IT לחקור תקלות, להבין את השפעתן, למצוא או ליצור פתרונות וליישמם בכלים קיימים ללא צורך לעבור בין מערכות. Edwin AI משווה התראות, מזהה גורמים מקוריים ומפעיל תיקונים אוטומטית, החל מההתראה הראשונה ועד לפתרון מאומת. הוא משתמש בנתוני היסטוריה ונתוני תצפית כדי לחזות ולמנוע הפסקות. הכלי משולב עם למעלה מ-3,000 כלים בתחומי תצפית, APM, ביטחון ו-CMDB, מה שמאפשר תובנות בזמן אמת ופעולה ומבטל סילואים. מחקר של Forrester מצא כי Edwin AI הניב רווח של 313% עבור ארגון מורכב, עם תקופת החזר על ההשקעה של 6 חודשים או פחות.
חלוקת קריטריונים
- שילוב התראות והפחתת רעש
- הצעות גורמים מקוריים בניהול AI
- סיכום תקלות בשפה טבעית
- שילובים עם פלטפורמות ITSM ותצפית
- זרימות טריאז' אוטומטיות
- עשרת ידע מתקלות קודמות


FoundryAI היא פלטפורמת פיתוח המתמקדת ביצירת סוכני AI שמטפלים בתהליכים עסקיים אמיתיים. היא משלבת כלים לעיצוב סוכנים, בדיקה ושיפור מתמשך, כך שהצוותים יכולים לעבור מהאבטיפוס לייצור מבלי לחבר בין מערכות נפרדות. הפלטפורמה מתמקדת בהערכת ביצועים, ומספקת למפתחים דרכים למדוד את ביצועי הסוכן מול משימות מוגדרות ולשפר את ההתנהגות לאורך זמן. זה עושה אותה מתאימה לארגונים שמאצלים תמיכת לקוחות, תפעול פנימי, או עבודה חזרתית של ידע שבה האמינות חשובה. FoundryAI מכוונת צוותים טכניים שצריכים יותר שליטה ממה שמציעים בנאי‑ללא‑קוד, אך רוצים איטרציה מהירה יותר מאשר בניית סוכנים מהיסוד.
חלוקת קריטריונים
- סביבת בניית סוכנים
- כלי הערכה ובדיקה
- ניטור ביצועים
- תמיכה באוטומציה של זרימות עבודה
- לולאות שיפור איטרטיבי
- שילוב עם מערכות עסקיות

Weave
מבנה זרימת עבודה ללא קוד תוכנה שמאפשר לעסקיםpara automatize פעולות על ידי התבססות על מודלים רב-לשוניים (LLMs) ובאיזורה פרסומים

W&B Weave היא פלטפורמת תצפית והערכה המסייעת לעקוב ולשפר יישומי מודל שפה גדול (LLM). Weave מספקת כלים למעקב, איסוף מדדי ביצועים והערכת תגובות של יישומים באמצעות שופטי LLM וצורני ציון מותאמים אישית. תכונות מרכזיות כוללות מעקב אחר הפעלות, שיחות LLM ושיחות כלים, כמו גם הכנסת כלים באופן ידני של סוכנים מותאמים אישית. הפלטפורמה תומכת באינטגרציות עם SDKs פופולריים ו- Harnesses, כמו גם יכולת תצפית סוכנים מותאמת אישית. Weave מספקת ספריות Python ו-TypeScript להתקנה ושימוש בפלטפורמה. היא מתארחת על גבי Weights & Biases (W&B), ודורשת חשבון W&B ומפתח API לאימות. משתמשים יכולים לעקוב אחר שיחות ל-LLM, לבדוק תשומות ותפוקות, ולצפות במדדי סוכנים בממשק המשתמש של Weave. בעוד ש-Weave מאפשרת אוטומציה והערכה של יישומי LLM, היא אינה בונה זרימות עבודה של AI ללא קוד, כפי ששמה מרמז.
חלוקת קריטריונים
- עקוב אחר סצנות של אג'נט
- זכויות ניתוח מובנות של אג'נט
- LLM עקוב והערכה
- תמיכה OpenTelemetry
- W&B
- ספריות Python ו-TypeScript





