წარსული ბრძოლა · 2023-12-27 UTC
Observability შერკინება — 27 დეკემბერი, 2023
Observability კატეგორიიდან. 30 ნიშნები განთავსებული 8 მებრძოლზე. Fiddler AI-მა აიღო გვირგვინი.
საბოლოო შედეგები
შემადგენლობა
მებრძოლები
ამ ბრძოლაში მონაწილე ყველა ხელსაწყოს პროფილი, დალაგებული მათი საბოლოო ქულის მიხედვით.

Fiddler AI
AI-ის ნახვალეობისა და უსაფრთხოების პლატფორმა ML‑სა და LLM‑აპლიკაციების მონიტორინგისთვის, ახსნისთვის და მართვისთვის.

Fiddler AI არის ორგანიზაციული პლატფორმა, რომელიც გუნდებს ეხმარება მონიტორინგში, ანალიზში და მანქანური სწავლის მოდელებისა და გენერაციული AI აპლიკაციების უსაფრთხოების უზრუნველყოფაში პროდუქციაში. ის აძლევს ხედი მოდელის შესრულებაზე, მონაცემთა გადახვებზე, bias-ზე და ხარისხის პრობლემებზე, ასევე უზრუნველყოფს უსაფრთხოების საშუალებებს LLM‑ებთან დაკავშირებულ რისკებზე, როგორიცაა hallucinations, prompt injection და unsafe outputs. ML ინჟინრებმა, მონაცემთა მეცნიერებმა, რისკის და შესაბამისობის გუნდებმა შექმნილია Fiddler AI, რომელიც აერთიანებს განმარტებადობას, რეალურ დროში მონიტორინგს და guardrails-ს ერთ workflow-ში. იგი ინტეგრირდება საერთო ML pipeline-ებით და ღრუბლოვან გარემოებთან, რაც ორგანიზაციებს საშუალებას აძლევს მასშტაბურად operationalize-ს პასუხისმგებლური AI‑ის პრაქტიკები.
კრიტერიუმების დაყოფა
- მოდელის შესრულება და დრიფტის მონიტორინგი
- LLM-ის ჰალუსინაციებისა და უსაფრთხოების გამოვლენა
- პრომპტის ინექციისა და ჯეიკბრეიკისგან დაცვა
- განმარტებადი AI და ძირითადი მიზეზის ანალიზი
- დახრილობისა და სამართლიანობის შეფასებები
- დაფის პანელები და გაფრთხილებები პროდუქციის AI-სთვის


FoundryAI არის განვითარების პლატფორმა, რომელიც ორიენტირებულია AI აგენტების შექმნაზე, რომლებსაც რეალურ ბიზნეს სამუშაო ნაკადებს ახორციელებენ. იგი აერთიანებს აგენტის დიზაინს, ტესტირებას და მუდმივი გაუმჯობესების ხელსაწყოებს, რათა გუნდებს შეძლება პროტოტიპიდან პროდუქციაზე გადასვლა, ცალკე სისტემების შეყოფის გარეშე. პლატფორმა ხაზგასმით უყრდნობა შეფასებას, შემმუშავებლებს აძლევს საშუალებებს აგენტის შესრულების გაზომვისთვის განსაზღვრული დავალებების მიმართ და ქცევის დროის მიხედვით გასაუმჯობესებლად. ეს ქმნის მას შესაფერისს ორგანიზაციებისთვის, რომლებიც მომხმარებლების მხარდაჭერის, შიდა ოპერაციების ან განმეორებადი ცოდნის სამუშაოების ავტომატიზაციას იწვევს, სადაც საიმედოობას აქვს მნიშვნელობა. FoundryAI მიზნად ისახავს ტექნიკურ გუნდებს, რომლებიც მეტი კონტროლს საჭიროებენ, ვიდრე no‑code ბილდერებმა სთავაზობენ, თუმცა სწრაფი იტერაციის სურვილს აჩვენებენ, ვიდრე აგენტების სრულად ნულიდან შექმნა.
კრიტერიუმების დაყოფა
- აგენტის შესაქმნელად გარემო
- შეფასებისა და სატესტო ხელსაწყოები
- წარმადობის მონიტორინგი
- სამუშაო პროცესების ავტომატიზაციის მხარდაჭერა
- იტერაციული გაუმჯობესების ციკლები
- ინტეგრაცია ბიზნესი სისტემებთან

Quotient AI
ნამდინარე მონიტორინგისა და შეფასების პლატფორმა AI-ში მარცხის დროს ძებნა, RAG და აგენტებში.
Quotient AI არის ობსერვაბილიტისა და შეფასების პლატფორმა, რომელიც შექმნილია AI-მყარ ფუნქციების გამოშვებისთვის პასუხისმგებელ გუნდებისთვის. იგი უცდუნებლივ აკვირდება წარმოების AI სისტემებს - მათ შორის ძიება, გენერაცია, რომელსაც ახდენს მოგზაურობა გამოყენებით (RAG) და ავტონომიურ აგენტებს, რათა ამოსავალი მოვლენები, შეცდომები და სხვა ხარისხის პრობლემები ბოლო მომხმარებლების შესვლამდე. პლატფორმა ავტომატურ შეფასებებს რეალურ დროში ალერტებთან აერთებს, რაც ინჟინერიასა და ML გუნდებს დიაგნოზის მთავარ მიზეზებში, მოდელის ან საწყისი ცვლილებების გასწრებაში, და მასშტაბირებადობის შენარჩუნებაში ეხმარება. Quotient AI-ის AI მილების ინსტრუმენტირებით, დეველოპერებს მიეწოდებათ ხილვა იმის შესახებ, თუ როგორ მოქმედებს მათი გამოყენება ველში, ვიდრე მხოლოდ ოფლაინ ბენჩმარკებზე დაყრდნობით.
კრიტერიუმების დაყოფა
- ნამდინარე AI მონიტორინგი და შეტყობინება
- ჰალუცინაციისა და ამოღების შეცდომის დეტექტირება
- RAG პიპლაინების შეფასების ინსტრუმენტები
- აგენტის ქცევის გამოყვლისა და დიაგნოსტიკა
- რეგრესიის ანალიზი მოდელისა და პრომპტის ცვლილებების გასწვავლებაზე
- AI გამოყენებების პროდუქციული დასაკვეთი

Portkey
გაერთიანებული კონტროლის პლანი AI აპლიკაციების შექმნის, მართვისა და მონიტორინგისთვის

Portkey არის გაერთიანებული კონტროლის სივრცე AI გამოყენებების შექმნის, მართვისა და მონიტორინგისთვის. ის იძლევა კომპლექსურ პლატფორმას AI გუნდებისთვის პროდუქციაში გასვლისთვის, შემდეგი ფუნქციების შეთავაზებით: AI Gateway, Observability, Guardrails, Governance და Prompt Management. პლატფორმა საშუალებას აძლევს მომხმარებლებს 1,600-ზე მეტ LLM-ებზე წვდომის უზრუნველყოფა ერთიანი API-ს მეშვეობით, რაც მოდელების ინტეგრაციის პროცესს ავტომატიზებს და გუნდებს შექმნაზე ფოკუსირების საშუალებას აძლევს, ვიდრე მართვაზე. Portkey ასევე სთავაზობს რეალურ დროში დაკვირვების შესაძლებლობას, რაც მომხმარებლებს საშუალებას აძლევს LLM-ების ქცევის მონიტორინგს, ანომალიების ადრეულ შეტყობას და გამოყენების პროაქტიულ მართვას. გარდა ამისა, პლატფორმა იძლევა კეშირების შესაძლებლობას, რომელიც მომხმარებლებს ვალდებული ტესტების შემცირების შედეგად ათასობით დოლარის დაზოგვაში ეხმარება. Portkey დაპროექტებულია AI გუნდებისთვის და მხარს უჭერს ფართო სპექტრის LLM-ებს, 3000-ზე მეტი GenAI გუნდით და დიდი რაოდენობით ტოკენებით, რომლებიც ყოველდღე გადის.
კრიტერიუმების დაყოფა
- AI შლუზი მრავალი მიმწოდებლის მარშრუტიზაციით
- პრომპტის მართვა და ვერსიონირება
- მოთხოვნის ლოგები, კვალები და ანალიტიკა
- სემანტიკური კეშირება და ხელახლა ცდა
- ინპუტისა და აუთფუთის ვალიდაციისთვის გარდრეილები
- გამოყენებისა და ღირებულების მონიტორინგის პანელები
Helicone AI
ყველა-ერთიანი დაკვირვების პლატფორმა, რომელიც მონიტორინგს, დებუგსა და პროდუქციის LLM აპლიკაციების გაუმჯობესებას უზრუნველყოფს.
Helicone AI არის დეველოპერებზე ორიენტირებული observability პლატფორმა, რომელიც სპეციალურად შემზადებულია დიდი ენის მოდელებით (LLM) გაშვებული აპლიკაციებისათვის. იგი რეგისტრირებს მოთხოვნებს, პასუხებს, ხარჯებს და ლატენციას სხვადასხვა პროვაიდერებზე, რაც ინჟინერინგის გუნდებს აძლევს ერთიან ხედვას, როგორ მოქმედებს მათი LLM ფუნქციები პროდუქციაში. ჟურნალიირებიდან გამომტევად, Helicone ხელს აძლიერებს ხელსაწყოებს პრომპტების გამართვის, მრავალნაბიჯიანი აგენტის სამუშაო ნაკადის ტრეკინგის, შეფასებების ჩატარებისა და მომხმარებელ-დონის მოხმარების მონიტორინგის. გუნდებს შეუძლია რეგრესის აღმოჩენა, ხარჯის კონტროლირება და პრომპტებზე ციკლური მუშაობა მონაცემებზე დაყრდნობით, არა შეხედულებით. ის ინტეგრირდება პოპულარულ მოდელთა პროვაიდერებთან და ფრეიმვორკებთან მსუბუქი პროქსი ან ასინქრონული ლოგინგის საშუალებით, რაც მას მარტივად აძლევს არსებული სტეკებზე დასამატებლად, არ საჭიროებს მნიშვნელოვანი კოდის ცვლილებებს.
კრიტერიუმების დაყოფა
- მოთხოვნების და პასუხების ლოგირება
- ხარჯის და ტოკენების გამოყენების ტრეკინგი
- პრომპტების მართვა და ვერსიაირება
- აგენტებისა და სესიის ტრეკინგი
- მომხმარებლის შეფასებები და ცხრილები
- მომხმარებლებისა და რეგულაციის ლიმიტის ანალიტიკა

KeywordsAI
ერთიანი დეველოპერ პლატფორმა LLM აპლიკაციების აგებისთვის, მონიტორინგისთვის და მასშტაბირებისთვის

KeywordsAI არის პროგრამისტებისთვის ორიენტირებული პლატფორმა, რომელიც ერთიანად აერთიანებს საჭირო ხელსაწყოებს, რათა წარმოებადი ხარისხის LLM‑ის აპლიკაციების მიწოდება მოხდეს. ის უზრუნველყოფს ერთ API‑გეატ, რომელიც მრავალ მოდელის მომწოდებელთან წვდომის საშუალებას აძლევს, ასევე ჩაშენებულ შესამჩნევებლობას, ჟურნალირებას და შეფასების ფუნქციებს, რომლებიც გუნდებს ეხმარება მათ AI‑თვისებების რეალურ სამყაროში როგორ მუშაობს. პლატფორმა შეიქმნილია LLM‑ით გაშვებული პროდუქტების ოპერაციული ზედამხედველობის ხარჯის შემცირებისთვის. დეველოპერები შეუძლიათ მონიტორინგი ლატენსიისა და ღირებულების შესახებ, პრომპტების გამართვა, შეფასებების გაშვება და პრომპტ‑ვერსიების მართვა, გარეშე სხვადასხვა ინსტრუმენტების გაერთიანებისა. ეს ხდის უფრო მარტივს ინჟინერულ გუნდებისთვის AI‑ს ფუნქციებზე იტერაციისა და საიმედოობის შენარჩუნებას, როცა მოხმარება მასშტაბურ ხდება.
კრიტერიუმების დაყოფა
- ერთიანი LLM გეატვე სხვადასხვა მომწოდებლებზე
- მოთხოვნების ჟურნალის ჩაწერა და ტრეკინგი
- ფასისა და ლატენსის მონიტორინგი
- პრომპტის ექსპერიმენტირება და ვერსიების კონტროლი
- მೌಲ്യांकन და ტესტირების სამუშაო ნაკადები
- SDK-ები და API ინტეგრაციები

Maxim AI
End-to-end პლატფორმა AI agents-ების შეფასებისთვის, მონიტორინგისთვის და გაუმჯობესებისთვის

Maxim AI არის დეველოპერებისთვის შექმნილი პლატფორმა, რომელიც დაეხმარება გუნდებს AI აგენტებისა და LLM‑ის აპლიკაციების საიმედოდ და სწრაფად განთავსებაში. ის ერთობს prompt engineering, evaluation, observability და dataset management, რაც გუნდებს საშუალებას აძლევს სწრაფად დააბრუნონ iteration‑ები, ხოლო ხარისხი იყოს გაზომვადი. პლატფორმა მხარს უჭერს ავტომატურ და ადამიანის შეფასებებს მრავალ მოდელსა და პრომპტზე, რაც ინჟინრებს საშუალებას აძლევს შეადარონ შედეგები, გამოიცანით რეგრესია და ტრეკონ წარმოებაში შეცდომები. იგი შექმნილია მრავალფუნქციური თანამშრომლობისთვის, სამუშაო ნაკადებით, რომლებიც საშუალებას აძლევენ როგორც ტექნიკურ, ასევე არათექნიკურ დაინტერესებულებს მონაწილეობას ტესტირებისა და გადახედვის პროცესში. Maxim ჩვეულებრივ გამოიყენება გუნდებს, რომლებიც აგებენ ჩატბოტებს, კოპილოტებს, ხმოვანი აგენტებს და მრავალსად-step აგენტურ სამუშაო პროცესებს, რომელთაც საჭიროა მუდმივი შესრულება შეცვლილი პრომპტებზე, მოდელებზე და მომხმარებლის შეყვანებზე.
კრიტერიუმების დაყოფა
- Prompt playground და versioning
- Automated agent და LLM evaluations
- Production observability და tracing
- Dataset curation და management
- Human review და annotation workflows
- Multi-model და multi-provider support
Relari (YC W24)
ტესტირება, შეფასება და ხელოვნური მონაცემთა გენერაციის პლატფორმა აი აგენტებისთვის.

Relari არის დეველოპერების პლატფორმა, რომელიც მიზნად ისახავს AI აგენტების საიმედოობის გაუმჯობესებას სისტემატიური ტესტირებისა და შეფასების საშუალებით. ის დახმარებას უწევს გუნდებს სინთეტიკური მონაცემთა სეტების გენერაციაში, ავტომატიზირებული შეფასებების ჩატარებაში და აგენტების შესრულების შეფასებაში რეალისტურ სცენარიებში წარმოებაში გაშვებამდე. Y Combinator-ის (W24) მხარდაჭერით, Relari ინჟინერიაში კომპლექსური LLM გამოყენებებისა და მულტი-ნაბიჯიანი აგენტების მშენებლობაზე ითვისებს მიზნად იმ შემთხვევებში, სადაც ტრადიციული QA ვერ ასწრებს. მისი ინსტრუმენტები მიზნად ისახავს სოფტვერის ინჟინერიის ზუსტი მეთოდების, როგორებიცაა ერთეული ტესტები, რეგრესიის შემოწმება და ზომიერი მაჩვენებლები, არა-დეტერმინისტული AI სისტემების გამოყენებაში მოყვანა. პლატფორმა უზრუნველყოფს ინდივიდუალურ შემოწმებადებს, სცენარის სიმულაციასა და უწყვეტ მონიტორინგს, რის გამოც ის საჭიროა როგორც წინასაწარმოო ვალიდაციისთვის, ისე პროდუქტიული აგენტების ხარისხის მუდმივი უზრუნველყოფისთვის.
კრიტერიუმების დაყოფა
- ხელოვნური მონაცემთა გენერაცია
- ავტომატური აგენტის შეფასების პიპლაინები
- სცენარისა და კონვერსაციის სიმულაცია
- შეფასების მეტრიკების კონფიგურაცია
- რეგრესიული ტესტირება LLM აპლიკაციებისთვის
- შესრულების ბენჩმარკინგი და ანგარიშგება





