קרב קודם · 2023-12-27 UTC
Observability התמודדות — 27 בדצמבר 2023
מקטגוריית Observability. 30 סימונים הוצבו על פני 8 לוחמים. Fiddler AI זכה בכתר.
הדירוג הסופי
ההרכב
הלוחמים
פרופילים של כל כלי שהשתתף בקרב הזה, ממוין לפי הציון הסופי.


Fiddler AI היא פלטפורמת ארגונית שמסייעת לצוותים לעקוב, לנתח ולהגן על מודלים של למידת מכונה ויישומי AI גנרטיבי בתפעול. היא מספקת נראות על ביצועי המודל, הסטת נתונים, הטייה ובעיות איכות, ובמקביל מציעה אמצעי הגנה מפני סיכונים ספציפיים ל‑LLMs כגון הזיות, הזרקת פקודות ופלטים לא בטוחים. הכלי תוכנן למהנדסי ML, מדעי נתונים וצוותי סיכון וציות, Fiddler משלב הסברתיות, ניטור בזמן אמת, ומנגנוני בטיחות בתהליך עבודה אחד. הוא מתממשק עם צינורות ML נפוצים וסביבות ענן, ומסייע לארגונים ליישם פרקטיקות AI אחראיות בקנה מידה רחב.
חלוקת קריטריונים
- ניטור ביצועי מודל ונדידת נתונים
- זיהוי הזיות ובטיחות LLM
- הגנה מפני הזרקת הנחיה ופריצת כלא
- AI מוסבר וניתוח שורש
- הערכות הטיה והוגנות
- לוחות בקרה והתראות עבור AI בייצור


FoundryAI היא פלטפורמת פיתוח המתמקדת ביצירת סוכני AI שמטפלים בתהליכים עסקיים אמיתיים. היא משלבת כלים לעיצוב סוכנים, בדיקה ושיפור מתמשך, כך שהצוותים יכולים לעבור מהאבטיפוס לייצור מבלי לחבר בין מערכות נפרדות. הפלטפורמה מתמקדת בהערכת ביצועים, ומספקת למפתחים דרכים למדוד את ביצועי הסוכן מול משימות מוגדרות ולשפר את ההתנהגות לאורך זמן. זה עושה אותה מתאימה לארגונים שמאצלים תמיכת לקוחות, תפעול פנימי, או עבודה חזרתית של ידע שבה האמינות חשובה. FoundryAI מכוונת צוותים טכניים שצריכים יותר שליטה ממה שמציעים בנאי‑ללא‑קוד, אך רוצים איטרציה מהירה יותר מאשר בניית סוכנים מהיסוד.
חלוקת קריטריונים
- סביבת בניית סוכנים
- כלי הערכה ובדיקה
- ניטור ביצועים
- תמיכה באוטומציה של זרימות עבודה
- לולאות שיפור איטרטיבי
- שילוב עם מערכות עסקיות

Quotient AI היא פלטפורמת נראות והערכה שנבנתה עבור צוותים שמשלוחים תכונות המונעות בינה מלאכותית. היא עוקבת באופן רציף אחר מערכות בינה מלאכותית בייצור - כולל חיפוש, יצירה מוגברת באחזור (RAG) וסוכנים אוטונומיים - כדי לחשוף הזיות, שגיאות אחזור ובעיות איכות אחרות לפני שמשתמשים קצה נתקלים בהן. הפלטפורמה משלבת הערכות אוטומטיות עם התראות בזמן אמת, ומסייעת לצוותים של הנדסת תוכנה ולמידת מכונה לאבחן סיבות שורש, לעקוב אחר רגרסיות בין שינויים במודל או בקידום, ולשמור על אמינות בקנה מונית. על ידי הפעלת צינורות בינה מלאכותית, Quotient מעניקה למפתחים תצוגה של האופן שבו יישומי ה- AI שלהם מתנהגים בפועל בשטח, במקום להסתמך רק על אמות מידה לא מקוונות.
חלוקת קריטריונים
- סקירת זמן-אמת AI והתרעות
- אבחנה hallucinations והתערע
- תכליות לבדיקה של RAG קווים
- ריצות ואבחנה של אגנט התקין
- אנליזת חזרה מצד model ושאלות
- סקירה-פעילות בהפצה para AI לאפליקציות


Portkey היא מערכת שרת-בר רשמית עבור בניית, ניהול והעקבה של יאי. היא מספקת מערכת רחבת-תווך לקבוצות יאי לעבור לייצור, כולל תכונות כגון AI Gateway, Observability, Guardrails, Governance, ו- Prompt Management. המערכת מאצלת באמצעות API מאוחד לגישה ישירה ל-1800 LLMs, עוזרת לשיפר את תהליך החברה באמצעות API ואפשרת לקבוצות להתמקד בבנייה ולא בניהול. Portkey מציע ניהול מיידי, המאפשר למשתמשים למנוע ולתפוס שאיבות מוקדם, מאפשרת ניהול שימושים פרואקטיבי. נוסף על זה, המערכת מספקת תכונות לאחסן קכייז' מחדש, , המציג 150000 יאי שנמשכים יומנית.
חלוקת קריטריונים
- Gateway AI עם הגייה של הגייה
- Prompt management - management- versioning
- Logi - - traces, - - analytics
- Semantic caching - retries
- Guardrails - input output validation
- Dashboards לשלב וציית עם - monitoring- ]
Helicone AI היא פלטפורמת נראות ממוקדת מפתחים, שנבנתה במיוחד עבור יישומים המונעים על ידי מודלים שפה גדולים. היא לוכדת בקשות, תגובות, עלויות ולטיות על פני ספקים, ונותנת לצוותים ההנדסיים תצוגה מאוחדת של התנהגות התכונות LLM שלהם בייצור. מעבר לרישום, Helicone מציעה כלים לניפוי בקשות, מעקב אחר זרימות עבודה של סוכנים רב-שלביים, הפעלת הערכות ומעקב אחר שימוש ברמת משתמש. צוותים יכולים לזהות רגרסיות, לשלוט בהוצאות ולשנות בקשות עם נתונים ולא עם ניחושים. היא משתלבת עם ספקי מודלים ומסגרות פופולריים באמצעות פרוקסי קל משקל או רישום אסינכרוני, מה שהופך אותו לפשוט להוסיף לערימות ק существующие ללא שינויים גדולים בקוד.
חלוקת קריטריונים
- רישום בקשות ותגובות
- מעקב אחר עלות ושימוש באסימונים
- ניהול בקשות וגרסאות
- מעקב אחר סוכנים והפעלות
- הערכות ודוחות מותאמים אישית
- אנליטיקה של משתמשים ומגבלות שיעור


KeywordsAI היא פלטפורמה המיועדת למפתחים המאגדת את הכלים הדרושים לפריסת יישומי LLM ברמת ייצור. היא מספקת שער API יחיד לגישה למספר ספקי מודלים, יחד עם תכונות מובנות של observability, logging והערכה, כדי לסייע לצוותים להבין כיצד תכונות ה‑AI שלהם מתפקדות בעולם האמיתי. הפלטפורמה נועדה להפחית את העומס התפעולי של ניהול מוצרי LLM. המפתחים יכולים לנטר את זמן ההמתנה והעלות, לבצע דיבוג של פרומפטים, לערוך הערכות ולנהל גרסאות של פרומפטים מבלי להרכיב יחד כלים נפרדים. זה מקל על צוותי ההנדסה לאיטרציה על תכונות AI ולשמור על אמינות כאשר השימוש גדל.
חלוקת קריטריונים
- שער גריד תאים יחידי ל-LLM
- דיווחי בקשות ואיתור
- הסתננות שכר ודליקיות
- ניסויי ׳קרשי' ושליטה במהדורות
- זרמי עבירה ובדיקה
- אינטגרציות SDK ו-API


Maxim AI היא פלטפורמת מפתחים שנועדה לעזור לצוותים לפרוס סוכני AI אמינים ויישומי LLM. היא מאחדת הנדסת פרומפט, הערכה, נראות וניהול מערכי נתונים, כך שהצוותים יכולים לבצע איטרציות במהירות תוך שמירה על מדידת האיכות. הפלטפורמה תומכת בהערכות אוטומטיות ובאנושיות על פני מודלים ופרומפטים מרובים, ומאפשרת למהנדסים להשוות תוצרים, לאתר רגרסיות ולחקור תקלות בייצור. היא נועדה לשיתוף פעולה חוצת תפקידים, עם זרימות עבודה שמאפשרות גם לבעלי עניין טכניים וגם ללא רקע טכני לתרום לבדיקות וסקירה. Maxim משמש בדרך כלל צוותים הבונים צ'אטבוטים, קופילוטים, סוכני קול וזרימות עבודה מרובת שלבים עם סוכנים הדורשות ביצועים עקביים למרות שינוי בפרומפטים, מודלים וקלטי משתמש.
חלוקת קריטריונים
- ויצהר-משחק במרחב של תעודי
- הערכה אוטומטית ובדיקה מאנשי
- בקרה ומחקר באמצעות LLM
- ניהול מסלול האפקת ונגש-משא
- ניהול ועריכ-ס-קר
- תמיכ-ם ל-LLM וספקים רב-מע-

Relari היא פלטפורמה למפתחים המתמקדת בשיפור מהימנותם של סוכני AI באמצעות בדיקה והערכה שיטתיים. היא עוזרת לצוותים ליצור מערכי נתונים סינתטיים, לבצע הערכות אוטומטיות ולמדוד את ביצועי הסוכנים במגוון תרחישים מציאותיים לפני הפצה לייצור. בגיבוי של Y Combinator (W24), רלרי מתמקדת בצוותים הנדסיים הבונים יישומי LLM מורכבים וסוכנים רב-שלביים שבהם בקרת האיכות המסורתית אינה מספיקה. הכלים שלה שואפים להביא קפדנות של הנדסת תוכנה - בדיקות יחידה, בדיקות רגרסיה ומדדים ניתנים למדידה - למערכות AI לא דטרמיניסטיות. הפלטפורמה תומכת במעריכים מותאמים אישית, הדמיית תרחישים ומעקב רציף, מה שהופך אותה לשימושית הן לאימות טרום-השקה והן להבטחת איכות שוטפת של סוכנים בייצור.
חלוקת קריטריונים
- ייצור את אסמבלים סינתטיים
- הערכה בבירוקרטיה של האגנטים
- אימולירת סצנריות ושיחות
- מדדי ביקורת-הערכה ניתנת להגדרה
- תביר-השוואה-הדדיה לרכזי LLM
- איפוסד מדדים ודיווחי ביצוע





